← к ленте

OpenAI представила результаты модели Astra в математике и информатике

С@seeallochnayaAI-инженер
3 нед

OpenAI опубликовала 10 достижений модели Astra в математике и теоретической информатике, оцененных моделями GPT-5.6 Sol Pro и Fable 5 Max.

Способность ИИ решать сложные математические задачи на уровне профессиональных исследователей меняет подход к научным открытиям.

  • Демонстрация того, что современные модели ИИ способны справляться с задачами, которые ранее требовали глубокой человеческой экспертизы.
  • Использование ИИ для оценки сложности научных задач помогает объективизировать прогресс в области машинного обучения.
  • Результаты показывают потенциал ИИ как инструмента для ускорения фундаментальных исследований в математике и информатике.
Долго ждать не пришлось: OpenAI выложили результаты, полученные моделью Astra (официально подтвердили название). Блогпост называется «Десять достижений в математике и теоретической информатике» Мне трудно осознать всю сложность этих задач. Я не то что математик, у меня диплома-то даже нет 😀 и я не вижу разницы, скажем, между 3-м и 10-м результатами. Поэтому я попросил GPT-5.6 Sol Pro и Fable 5 Max (чтоб не было позитивного биаса на OpenAI) классифицировать их, используя систему критериев задач в бенчмарке OpenMath от EpochAI: 🟢 «Значимый результат» (Solid Result): Сильный исследователь в данной области был бы рад, если бы его среднестатистическая работа решала задачи такого уровня. Тем не менее, за пределами узкой специализации эта проблема вряд ли вызвала бы большой резонанс. 🟡 «Крупное достижение» (Major Advance): Среднестатистический специалист, работающий в широкой области математики (в масштабах теории чисел или теории графов), обратил бы на это внимание и, скорее всего, нашел бы время, чтобы вникнуть хотя бы в общую суть решения. 🔴 «Прорыв» (Breakthrough): Среднестатистический математик захотел бы узнать об этом результате, даже если он выходит за рамки его специализации. Такая работа стала бы кандидатом на звание одного из лучших результатов года во всей математике. Обе модели — и Fable, и Sol — сошлись во мнении, что результат №3 — это «Прорыв» (что объясняет, почему сотрудник OpenAI из всех выделяет именно его в своём твите). Они также согласны, что как минимум 7 решений из 10 относятся к категории «Крупное достижение». Что еще интересно, в официальных критериях EpochAI сказано следующее: «Когда для задачи подходили сразу несколько уровней оценки, мы склонялись к более консервативному варианту. Было бы неприятно понижать статус задачи уже после того, как она решена, в то время как мы всегда можем подчеркнуть любые неожиданно интересные элементы в самом решении». И Fable 5 считает, что как минимум три результата находятся на грани «Прорыва» (№1, №4 и №9).
OpenAI представила результаты модели Astra в математике и информатике

Кратко (AI)

OpenAI опубликовала отчет о десяти достижениях модели Astra в области математики и теоретической информатики. Автор поста использовал модели GPT-5.6 Sol Pro и Fable 5 Max для оценки сложности этих задач по критериям OpenMath от EpochAI, в результате чего большинство задач были классифицированы как крупные достижения, а одна — как прорыв.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖