Новейшая рассуждающая модель OpenAI, GPT-6 Astra, была запущена 3 сентября с результатом 97,6% на FrontierMath Tier 4 (v2). Это именно тот показатель, который заставляет перепроверить информацию, особенно когда вы узнаете, что более ранняя внутренняя версия модели едва справлялась с 17% на тестах по математическим способностям.
Траектория от 17% до 47% внутри компании, а затем до почти идеального результата на публичных тестах, сжимает то, что обычно занимает годы прогресса, в один цикл разработки.
Бенчмарковый блиц
На ARC-AGI-3, измеренном в собственной системе оценки OpenAI, Astra показала результат 99,9%. На ExploitBench она достигла идеальных 100%. GPQA Diamond — эталонный тест на научное рассуждение на уровне аспирантуры — показал результат 96,0%. Terminal-Bench Science 0.1 дал результат 64,6%.
Результат FrontierMath Tier 4 (v2) является основным показателем. GPT-5.6 Sol, предшественник Astra, показал 83,0% на том же тесте. Результат Astra в 97,6% означает улучшение на 14,6 процентных пункта.
От 17% до мирового уровня
Ранние версии модели, которая позже стала Astra, показывали примерно 17% по оценкам математических способностей. Благодаря итеративным улучшениям этот показатель вырос до примерно 47% перед дальнейшей доработкой модели для её публичного выпуска.
OpenAI также признала Astra за вклад в новые идеи по проблеме простых промежутков — notoriously сложной области теории чисел, которой человеческие математики занимаются на протяжении веков.
Кто получает доступ и когда
Развертывание Astra проходило поэтапно. В день запуска доступ получили отдельные организации, а вскоре после этого расширенный доступ стал доступен для подписчиков ChatGPT Plus, Pro, Business и Enterprise. Доступ к API предоставляется напрямую через OpenAI, а также через Azure и AWS Bedrock.
Конкурентная среда
Независимые оценки поместили Astra в число лучших по производительности ИИ-моделей, доступных сегодня, хотя некоторые тесты отмечают, что определенные варианты Claude от Anthropic превосходят её в тестах на общую интеллектуальность.
Рост с 83,0% до 97,6% на FrontierMath за одну генерацию модели указывает на то, что потолок для математических рассуждений ИИ, если он существует, еще не достигнут.
