Только что последняя задача FrontierMath Tier 4 была решена GPT-6 Astra.
На данный момент все задачи этого исследовательского теста, ранее считавшегося кошмаром для больших моделей в математике, были успешно решены ИИ как минимум один раз.
Epoch AI также официально признал, что FrontierMath Tier 4 достиг насыщения.

Хотя из приведённого выше графика видно, что Astra ещё не достигла прямого результата в 100%, опубликованный OpenAI результат составляет 97,6%.
Однако согласно алгоритму Epoch «полное решение» означает, что после накопления попыток с различными моделями и в разное время каждая задача из Tier 4 уже была успешно решена.
Астра преодолела именно ту, которая до этого оставалась единственной, не поддавшейся ИИ.
(Проще говоря, Astra, возможно, допустила ошибку во время одного из тестов, но она правильно решила задачу, которую раньше никто не смог решить)

Честно говоря, эта скорость развития все еще довольно безумная.
Если вы следите за оценкой моделей, вы знаете, что на 11 июля 2025 года, сразу после запуска Tier 4, лучший результат на рейтинге составлял около 5%.
Прошло ровно год и два месяца, и эта бывшая «высокая стена» превратилась в «ступеньку» — последняя проблема, которую невозможно было обойти с помощью ИИ, также преодолена.
Автор вопроса, доцент математики университета Маркетт Джей Пантон, также отметил, что ранее ИИ искал численные упрощения, но на этот раз решение ИИ было очень близко к его собственному.

Однако, совсем недавно, когда GPT-6 Astra активно атаковал математическое сообщество, решая задачи тысячелетия через день, Pantone заявил, что ему уже сложно удивляться!
Можно сказать, что математика стала одним из самых активных направлений, где Astra недавно проявила себя.
От менее чем 2% до отдельной «исследовательской защиты»
FrontierMath был впервые выпущен 7 ноября 2024 года, и его создание было направлено на предотвращение слишком быстрого обхода математических бенчмарков ИИ.
Тогда традиционные математические бенчмарки, такие как GSM8K и MATH, все труднее позволяли различать модели верхнего уровня, поэтому Epoch AI в сотрудничестве с более чем 60 математиками разработала новый набор оригинальных задач, ранее не публиковавшихся.
Среди них — лауреаты Филдсовской премии Тао Чжэсюань, Тимоти Гауэрс, Ричард Борчердс.
Когда Теренс Тао просмотрел некоторые из этих исследовательских задач, он прямо сказал, что они «чрезвычайно сложны» и даже предположил, что самые трудные задачи уровня Tier 3 могут по-прежнему вызывать трудности у ИИ еще несколько лет.

По итогам первого раунда тестирования, как и ожидалось, точность ведущей модели составила менее 2%.
Изначально база вопросов FrontierMath содержала 300 вопросов, разделенных на три уровня сложности: Tier 1, Tier 2 и Tier 3.

Уровень 1 примерно соответствует сложным задачам для студентов бакалавриата и математическим олимпиадам, однако разрешено использование более продвинутых инструментов; уровень 2 достигает уровня старших аспирантов; уровень 3 ближе к исследовательским задачам, с которыми сталкиваются докторанты на ранних этапах.
Но с появлением моделей вывода эти три первых уровня也开始变得 недостаточными, поэтому в 2025 году Epoch добавил еще один уровень — Tier 4.
Уровень 4 в основном разработан математическими профессорами и постдоками, каждый из которых в течение нескольких недель проводит краткосрочные исследования в своей области, после чего результаты сжимаются в одну задачу, которую можно автоматически проверить.

Изначально в Tier 4 включено 50 вопросов, охватывающих анализ, теорию чисел, комбинаторику, топологию, алгебраическую геометрию и другие области.
Во время первоначального выпуска только три вопроса из всех тестов моделей были решены, и эти решения опирались на некоторые верные, но недостаточно обоснованные предположения.
В связи с этим на публичной странице примеров вопросов на официальном сайте Epoch Epoch также указывала: некоторые из этих вопросов могут не быть решены ИИ в течение десятилетий.

(Эту фразу теперь будут постоянно дёргать)
Однако по мере усиления моделей проявилась еще одна проблема: сам банк вопросов也开始 не выдерживать «испытаний» ИИ.
В процессе тестирования OpenAI обнаружила, что ошибок в FrontierMath оказалось больше, чем ожидалось.
Затем Epoch запустил независимый аудит: сначала с помощью GPT-5.5 и Claude Opus 4.7 были выявлены подозрительные моменты, после чего математики провели повторную проверку каждой задачи. В итоге версия v2 была выпущена в июне 2026 года, в которой Tier 4 исправил 12 задач, удалил 7 задач и оставил 43 задачи.
После доработки результаты модели продолжили расти.
GPT-5.6 Sol достиг 83,0%, Claude Fable 5 — 90,2%, а GPT-6 Astra показал результат 97,6%.

Более того, Astra также решила единственную задачу, которую раньше не могли решить ИИ.

На данный момент каждая задача уровня 4 была успешно преодолена ИИ хотя бы один раз. Эта исследовательская защита, созданная специально для самых мощных моделей, в итоге также была взломана.
Однако это не означает, что «математика уже решена ИИ». Напротив, FrontierMath уже начал двигаться на следующий этап.
Сейчас в проекте, помимо уровней 1–4, добавлены настоящие открытые задачи, а также формализация проблем Эрдёша в Lean в рамках FrontierMath Erdős.

Первый использует нерешенные математические задачи для тестирования модели; второй требует от ИИ написания полных доказательств, проходящих формальную верификацию.
На этот раз Astra решила только 2 задачи из 68 задач FrontierMath Erdős.
История продолжается~
Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор: henry
