Щойно останнє завдання FrontierMath Tier 4 було розв’язано GPT-6 Astra.
На цей момент усі завдання цього дослідницького тесту, який раніше вважався непереборною математичною проблемою для великих моделей, були хоча б один раз успішно розв’язані штучним інтелектом.
Epoch AI також офіційно висновув, що FrontierMath Tier 4 насичений.

Хоча з наведеного вище графіка видно, що Astra ще не досягла 100%, сама OpenAI оголосила результат у 97,6%.
Але згідно з алгоритмом Epoch, «повне розв’язання» означає, що після накопичення спроб різних моделей у різний час, кожна задача з Tier 4 вже мала успішне розв’язання.
А страта знищила саме ту, що раніше була єдиною, яку ще не здолали ІІ.
(Просто кажучи, Astra, можливо, припустилася помилки під час одного з тестів, але саме це завдання було раніше нерозв’язаним)

Чесно кажучи, ця швидкість розвитку досить неймовірна.
Якщо ви стежите за оцінками моделей, то знаєте, що на 11 липня 2025 року, коли Tier 4 тільки вийшов, найвищий результат на списку становив лише близько 5%.
Пройшло рік і два місяці, і ця колишня «висока стіна» перетворилася на «сходи» — остання проблема, яку важко було обійти за допомогою штучного інтелекту, також подолана.
Автор питання, доцент математики університету Маркетт Джей Пантон, також зазначив, що раніше ІІ шукали числові скорочення, але на цей раз розв’язок ІІ був дуже близький до його власного.

Однак, саме недавно, коли GPT-6 Astra зосередилася на математичній галузі, вирішуючи проблеми тисячоліття щодня, Pantone заявив, що вже важко здивуватися!
Можна сказати, що математика стала одним із найактивніших напрямків, де Astra останнім часом найбільше проявляє себе.
Від менше ніж 2% до окремої «дослідницької лінії захисту»
FrontierMath був випущений 7 листопада 2024 року, і його метою було запобігти швидкому проходженню математичного бенчмарку штучним інтелектом.
Тоді традиційні математичні бенчмарки, такі як GSM8K і MATH, все складніше розрізняли результати лідерів, тому Epoch AI у співпраці з понад 60 математиками розробила серію оригінальних завдань, які раніше не публікувалися.
Серед них — лауреати Філдсовської премії Теренс Тао, Тімоті Гауерс, Річард Борчердс.
Після перегляду деяких дослідницьких завдань Теренс Тао відкрито сказав, що ці завдання «надзвичайно складні» і навіть вважав, що найскладніші завдання рівня Tier 3 можуть застрягнути AI ще на кілька років.

Після першого раунду тестування, як і очікувалося, точність лідируючої моделі не перевищила 2%.
Спочатку основна база питань FrontierMath містила 300 питань, розподілених за складністю на три рівні: Tier 1, Tier 2 і Tier 3.

Рівень 1 приблизно відповідає складним завданням для бакалаврів та математичним олімпіадам, але дозволяє використовувати більш просунуті інструменти; Рівень 2 вже досягає рівня старших аспірантів; Рівень 3 ближчий до дослідницьких завдань, з якими зустрічаються докторанти на початку своєї роботи.
Але з появою моделей висновків ці три рівні також почали ставати все менш достатніми, тому в 2025 році Epoch додав ще один рівень — Tier 4.
Рівень 4 більшістю розроблений математичними професорами та постдокторантами, кожен з яких протягом кількох тижнів проводить короткострокове дослідження в межах своєї наукової галузі, а потім стискає результати у вигляді питання, яке можна автоматично перевірити.

Спочатку рівень 4 містив 50 питань, які охоплювали аналіз, теорію чисел, комбінаторику, топологію, алгебраїчну геометрію…
На початку випуску всі тести моделей разом мали лише три задачі, які були розв’язані, причому ці розв’язки ґрунтувалися на деяких правильних, але недостатньо обґрунтованих припущеннях.
З урахуванням цього, на публічній сторінці з прикладами завдань на офіційному сайті Epoch Epoch раніше зазначала: деякі з цих завдань можуть не бути вирішені штучним інтелектом протягом десятиліть.

(Цей текст зараз починають повторно розбирати)
Проте зі зростанням потужності моделей виявилася ще одна проблема: сама база питань також почала не витримувати «випробувань» ШІ.
Під час тестування OpenAI виявила, що у FrontierMath помилок більше, ніж очікувалося.
Після цього Epoch розпочав незалежний аудит: спочатку використав GPT-5.5 та Claude Opus 4.7 для виявлення підозрілих моментів, а потім передав їх математикам для перевірки кожного питання окремо. У підсумку у червні 2026 року було запущено версію v2, у якій Tier 4 виправив 12 питань, видалив 7 і залишив 43.
Після оновлення результати моделі продовжують стрімко зростати.
GPT-5.6 Sol досяг 83,0%, Claude Fable 5 — 90,2%, а GPT-6 Astra показав результат 97,6%.

Ще важливіше, Astra також розв’язала єдину задачу, яку раніше ніколи не вдалося розв’язати штучному інтелекту.

На цей момент кожне завдання рівня 4 вже було хоча б один раз успішно подолане ШІ. Ця дослідницька система захисту, створена спеціально для найпотужніших моделей, також була зламана.
Проте це не означає, що «математика вже вирішена штучним інтелектом». Навпаки, FrontierMath сам вже переходить до наступного етапу.
Зараз до проекту, крім рівнів 1–4, додано справжні відкриті проблеми, а також формалізація проблем Ердеша у Lean у FrontierMath Erdős.

Перший тестує модель, пропонуючи їй досі нерозв’язані математичні проблеми; другий вимагає, щоб ШІ написав повний доказ, який проходить формальну верифікацію.
На цей раз Astra розв’язала лише 2 з 68 задач FrontierMath Erdős.
Історія продовжується~
Цей текст походить від офіційного аккаунту WeChat «Quantum Bit», автор: henry
