Глобальные ИИ-модели доминируют на IMO 2026 с идеальными результатами

icon MarsBit
Поделиться
AI summary iconСводка
Новости об ИИ и криптовалюте прозвучали, когда четыре модели ИИ — Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 и AxiomProver — набрали 42/42 на Международной математической олимпиаде 2026 года, опередив 99% человеческих участников. За семь лет идеальный результат показали только 30 человек. Axiom Math перевела задачи на язык Lean 4 для автоматической проверки. Стоимость варьировалась от 0,18 до 51 доллара. Глобальные обсуждения криптовалютной политики могут вскоре включить роль ИИ в математике и логике.

Июль в Шанхае — жаркая волна.

67-я Международная математическая олимпиада официально завершилась, китайская команда завоевала первое место с результатом 232 балла. Трое юношей набрали максимальный результат — 42 балла.

Axiom Math

Аплодисменты еще не утихли, как на GitHub появилась еще одна впечатляющая статистика.

Бывший инженер Google Диди Дас провела сравнительный анализ ИИ: 7 передовых крупных моделей самостоятельно решили все 6 задач IMO 2026.

Claude Fable 5 набрал идеальные 42 балла. Затратило всего 2,5 часа и 51 доллар.

Версия xhigh GPT-5.6 Sol также получила идеальную оценку. Время выполнения — 3,8 часа, а стоимость снизилась до крайне низких 20 долларов.

Кими K3 следом набрал идеальный результат. После 17,4 часов напряженной борьбы и затрат 31 доллара.

Включая независимый AxiomProver, все четыре стороны достигли идеального результата.

Axiom Math

В качестве справки, за последние семь лет на IMO в соревновании участвовали 4347 человек, и только 30 из них набрали полный балл — это 0,69%.

Axiom Math

Подавляющее превосходство по результатам

Как видно из результатов, между идеальным результатом в 42 балла и четвертым местом в 28 баллов лежит пропасть в 14 баллов, причем три модели с идеальным результатом заняли первые места совершенно разными способами.

Claude Fable 5 работает чисто и эффективно. 9 диалогов, 6 с эффективным выводом, максимальная продолжительность одного сеанса — 73 минуты (P3), всего выведено 700 000 токенов.

GPT-5.6 Sol выглядит несколько нестабильно. На P2 он работал 106 минут, выполнил 4 цикла, но два раза прерывался из-за сбоев в сети. Однако управление вычислительной мощностью просто ужасающе эффективно — общее количество выведенных токенов составило всего 230 000, что меньше всех среди трех идеальных результатов.

Кими K3 — как неустанное чудовище. Модель MoE с 2,8 триллионами параметров за один раз выдает 1,54 миллиона токенов — в 6,5 раза больше, чем у Sol. Только одна задача P3 требует 6 атак и длится 491 минуту.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Прямое столкновение математической интуиции

P1 — самая мягкая закуска на全场, все модели справляются за несколько минут, а человеческие участники почти не допускают ошибок.

На доске записано 2026 целых положительных чисел, каждое из которых больше 1. На каждом шаге выбираются два числа m и n, они стираются и заменяются на gcd(m,n) и lcm(m,n)/gcd(m,n). Процесс повторяется до тех пор, пока это возможно. Докажите, что: (a) процесс обязательно завершится, и в итоге останется ровно одно число M, большее 1; (b) значение M не зависит от порядка операций.

Axiom Math

Для лучшего понимания этой задачи сначала проведем небольшой эксперимент.

На доске написаны только 12 и 18. 12 = 2² × 3, 18 = 2 × 3². Шаг 1: НОД(12,18) = 6, НОК(12,18)/6 = 6, на доске получается [6, 6]. Шаг 2: НОД(6,6) = 6, НОК(6,6)/6 = 1, на доске получается [6, 1]. Осталось только одно число, большее 1, игра завершена. M = 6.

Как бы вы ни меняли порядок действий, M всегда равно 6. Почему?

Ответ спрятан в простых множителях.

Для каждого простого числа p возьмите наибольший общий делитель всех чисел, деленных на p, и перемножьте эти степени простых чисел — это значение остается неизменным от первого шага до последнего.

Claude Fable 5: непосредственно создал счетчик, который обязательно уменьшается на каждом шаге.

Для этой задачи Fable 5 определяет величину Φ = T + N. T — это сумма количества простых множителей всех чисел на доске (с повторениями), N — количество чисел, больших 1. Например, для доски [12, 18]: простые множители 12 — это 2, 2, 3 (всего 3), простые множители 18 — это 2, 3, 3 (всего 3), T = 6, N = 2, Φ = 8.

Затем это доказывает: при выполнении каждой операции Φ уменьшается как минимум на 1. Рассмотрим два случая — если gcd(m,n) > 1, общее количество простых множителей T уменьшается; если gcd(m,n) = 1, T остается неизменным, но количество чисел, больших 1, уменьшается на одно, N уменьшается на 1. Φ — это положительное целое число, на каждом шаге уменьшающееся как минимум на 1, поэтому процесс обязательно завершится за конечное число шагов. Один единственный счетчик — и一刀斩断.

Axiom Math

GPT-5.6 Sol: Отслеживание произведения, лексикографическое уменьшение размерности.

Сол рассматривает две величины: P = произведение всех чисел, K = количество чисел, больших 1. На каждом шаге, если gcd(m,n) = d > 1, произведение двух новых чисел равно mn/d, что меньше исходного, и глобальное произведение P строго уменьшается. Если d = 1, P остается неизменным, но K уменьшается на 1.

Пара (P, K) строго убывает в лексикографическом порядке: либо P уменьшается, либо P остается неизменным, а K уменьшается. Лексикографический порядок положительных целых чисел не может убывать бесконечно. Завершение.

Axiom Math

Два совершенно разных подхода решили часть (a) одной и той же проблемы.

На части (b) три модели сходятся: все они доказывают, что для каждого простого числа p наибольший общий делитель количества делений на p всех чисел на доске остается неизменным в процессе операций. Итоговая формула также абсолютно одинакова —

Axiom Math

Вернёмся к примеру: 12 и 18. Для p=2, v₂(12) = 2, v₂(18) = 1, НОД = 1, вклад 2¹. Для p=3, v₃(12) = 1, v₃(18) = 2, НОД = 1, вклад 3¹. M = 2 × 3 = 6, что полностью совпадает с ручным расчётом.

Самый дешевый белый лист на всей площадке

Задача P6 по теории чисел — финальная задача дня 2; она требует доказать, что рекуррентная последовательность в конечном итоге становится периодической.

В прошлом году на IMO 2025 только 6 человек в мире решили задачу P6.

Claude Fable: 5:26 минут, два раунда, идеальный результат. GPT-5.6 Sol: 60 минут, два раунда, идеальный результат. Кими K3: 381 минут, четыре раунда, максимальный балл.

Grok 4.5 на P6 выдал всего 7053 токенов, заняв последнее место. В загруженном файле четко указано: Full proof: (Not yet complete.)

0,18 $, самая дешевая белая бумага на всей площадке.

Проблемы Grok не ограничиваются этим. В течение всего теста он постоянно попадал в странную галлюцинацию: утверждал, что «доказательство уже записано в файл», хотя на фоне даже не трогал инструмент для записи.

Это не проблема математических способностей, а проблема возможностей агента. Модель знает, что должна записать файл, и утверждает, что записала его, но на уровне вызова инструментов не выполнила действия.

Три шага за три года

Ужасающая эволюция кремниевого мозга

В 2024 году AlphaProof от DeepMind впервые достигла порога серебряной медали на уровне IMO.

В 2025 году OpenAI и DeepMind одновременно выступили. OpenAI не раскрыла модель, решила 5 задач и завоевала золотую медаль с 35 баллами, Gemini Deep Think достиг того же уровня.

В 2026 году три универсальные крупные модели сразу набрали максимальный балл. На этот раз ни одна из них не проходила специальной математической подготовки, и все могут ими пользоваться. Даже одна из них является открытой.

Axiom Math

Автор машинного вызова

Исходной точкой всего тестирования стала компания Axiom Math.

Они перевели все шесть задач IMO 2026, слово за словом, в формализованные формулировки на Lean 4, понятные машине.

С этой системой машинно-читаемых вопросов ИИ сможет напрямую генерировать доказательства Lean и автоматически оцениваться компилятором, без необходимости в человеческих экзаменаторах.

Получив условие задачи, Диди Дас быстро создал полностью автоматизированную тестовую систему. Крупнейшие модели соревновались друг с другом, пройдя все шесть этапов. AxiomProver также самостоятельно набрал максимальный балл.

Стоит отметить, что основателю Axiom Math Хон Летон всего 25 лет. Она родилась в Гуанчжоу и за три года получила дипломы по математике и физике в MIT, а также стала лауреатом премии Morgan.

В конце прошлого года её собственная разработка AxiomProver показала идеальный результат на математической олимпиаде Putnam — это шестой идеальный результат за 98-летнюю историю соревнования.

В марте этого года компания завершила раунд финансирования серии A на сумму 200 миллионов долларов США. Оценка компании достигла 1,6 миллиарда долларов США.

Axiom Math

Как будет перестроена жизнь обычных людей

Модель, способная написать 4229 строк строго доказанного кода, обладает не просто умением решать математические задачи.

Он действительно управляет длинной цепочкой логических рассуждений, где каждый шаг не может быть пропущен, не может быть ошибочным и не может быть неясным.

Есть ли уязвимости в условиях контракта, выполняются ли условия страхового возмещения, соответствует ли налоговая схема законодательству — за всеми этими внешними проявлениями скрывается одна и та же проблема: ответ не может быть «в целом правильным».

Раньше такая проверка по каждой позиции была доступна только профессионалам и оплачивалась по часам.

Сейчас, с внедрением этой функции в потребительские продукты, при возникновении сложных проблем достаточно просто открыть телефон.

Справочные материалы:

https://x.com/deedydas/status/2079409461874332066

Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, редактор: Моисей

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.