Глобальні моделі ШІ домінують на IMO 2026 з ідеальними результатами

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Новини про ШІ та криптовалюту розлетілися, коли чотири моделі ШІ — Claude Fable 5, GPT-5.6 Sol xhigh, Kimi K3 та AxiomProver — отримали 42/42 на Міжнародній математичній олімпіаді 2026 року, перевершивши 99% людських учасників. За сім років ідеальний результат здобули лише 30 людей. Axiom Math переклали завдання на Lean 4 для автоматизованого оцінювання. Витрати варіювалися від $0,18 до $51. Глобальні обговорення політики щодо криптовалют можуть швидко включити роль ШІ в математиці та логіці.

Липень у Шанхаї — хвилі спеки.

67-а Міжнародна математична олімпіада офіційно завершилася, китайська команда здобула перше місце з результатом 232 бали. Три юнаки набрали повний результат — 42 бали.

Axiom Math

Оплески ще не згасли, а на GitHub з’явилася ще одна вражаюча статистика.

Бувший інженер Google Діді Дас провів порівняльний аналіз ШІ: 7 передових великих моделей самостійно розв’язали всі 6 завдань IMO 2026.

Claude Fable 5 набрав 42 бали з 42. Витрачено лише 2,5 години і 51 долар.

Версія xhigh GPT-5.6 Sol також отримала максимальний бал. Час виконання — 3,8 години, а вартість знижена до надзвичайно низьких 20 доларів.

Kimi K3 слідом за ним отримав ідеальний результат. Після 17,4 годин боротьби, витративши 31 долар.

Разом із незалежним AxiomProver усі чотири сили досягли ідеального результату.

Axiom Math

Як порівняння, за останні сім років на МОІ участь взяли 4347 людських учасників, лише 30 з них отримали повний бал — це 0,69%.

Axiom Math

Перевага за результатами

З результатів видно, що між ідеальним результатом 42 і четвертим місцем з 28 існує розрив у 14 балів, а також три моделі з ідеальним результатом зайняли перше місце різними способами.

Claude Fable 5 працює чітко й ефективно. 9 діалогів, 6 ефективних відповідей, найтриваліша сесія — 73 хвилини (P3), загалом виведено 700 000 токенів.

GPT-5.6 Sol виглядає трохи нестабільно. На P2 він 106 хвилин виконував 4 цикли, під час яких двічі переривався через проблеми з мережею. Але контроль обчислювальних потужностей дійсно жахливий — загальний вихід становить лише 230 000 токенів, найменший серед трьох ідеальних результатів.

Kimi K3 — це невичерпний велетень. Модель MoE з 2,8 трильйона параметрів викинула 1,54 мільйона токенів за раз — у 6,5 разів більше, ніж Sol. Лише одна задача P3 вимагала 6 атак і тривала 491 хвилину.

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Axiom Math

Прямий зіткнення математичної інтуїції

P1 — найбільш м’який закуска на всій арені, всі моделі справляються за кілька хвилин, а людські гравці майже не допускають помилок.

На дошці записано 2026 цілих додатних чисел, кожне з яких більше 1. На кожному кроці вибираються два числа m і n, вони стираються, а на їх місце записуються gcd(m,n) і lcm(m,n)/gcd(m,n). Операцію повторюють, доки це можливо. Доведіть: (a) процес обов’язково завершиться, і залишиться рівно одне число M, більше за 1; (b) значення M не залежить від порядку операцій.

Axiom Math

Щоб полегшити розуміння цього завдання, спочатку проведемо мініатюрний експеримент.

На дошці лише 12 і 18. 12 = 2² × 3, 18 = 2 × 3². Крок 1: gcd(12,18) = 6, lcm(12,18)/6 = 6, дошка стає [6, 6]. Крок 2: gcd(6,6) = 6, lcm(6,6)/6 = 1, дошка стає [6, 1]. Залишається лише одне число більше за 1, гра завершується. M = 6.

Як би ви не змінювали порядок дій, M завжди дорівнює 6. Чому?

Відповідь прихована в простих множниках.

Для кожного простого числа p візьміть НСД усіх чисел, що діляться на p, а потім перемножте ці степені простих чисел — це значення залишається незмінним від першого кроку до останнього.

Claude Fable 5: створив лічильник, який обов’язково зменшується на кожному кроці.

Для цієї задачі Fable 5 визначає величину Φ = T + N. T — це сума кількості простих множників усіх чисел на дошці (з урахуванням повторень), N — кількість чисел, більших за 1. Наприклад, для дошки [12, 18]: прості множники 12 — це 2, 2, 3 (разом 3), прості множники 18 — це 2, 3, 3 (разом 3), отже T = 6, N = 2, Φ = 8.

Потім це доводить: при виконанні кожного кроку Φ зменшується щонайменше на 1. Розглянемо два випадки — якщо НСД(m,n) > 1, загальна кількість простих множників T зменшується; якщо НСД(m,n) = 1, T залишається незмінним, але кількість чисел, більших за 1, зменшується на одне, N зменшується на 1. Φ — це додатне ціле число, на кожному кроці воно зменшується щонайменше на 1, тому процес обов’язково завершиться за скінченну кількість кроків. Один лічильник, одне рішення.

Axiom Math

GPT-5.6 Sol: Відстеження продуктів, лексикографічне зменшення вимірності.

Сол аналізує два показники: P = добуток усіх чисел, K = кількість чисел, більших за 1. На кожному кроці, якщо НСД(m,n) = d > 1, добуток нових двох чисел дорівнює mn/d, що менше початкового, і глобальний добуток P строго зменшується. Якщо d = 1, P залишається незмінним, але K зменшується на 1.

Пара (P, K) строго зменшується в лексикографічному порядку: або P зменшується, або P залишається незмінним, але K зменшується. Лексикографічний порядок додатних цілих чисел не може зменшуватися нескінченно. Завершення.

Axiom Math

Два абсолютно різні підходи вирішили частину (a) однієї й тієї ж проблеми.

На частині (b) три моделі приходять до одного й того ж результату: всі вони доводять, що для кожного простого числа p найбільший спільний дільник кількостей ділень на p усіх чисел на дошці залишається незмінним під час операцій. Остаточна формула теж ідентична —

Axiom Math

Повернемося до прикладу: 12 і 18. Для p=2, v₂(12) = 2, v₂(18) = 1, НСД = 1, внесок 2¹. Для p=3, v₃(12) = 1, v₃(18) = 2, НСД = 1, внесок 3¹. M = 2 × 3 = 6, що повністю збігається з ручним обчисленням.

Найбільш доступний білий лист

Ця задача з теорії чисел P6 є фінальною задачею Дня 2 і вимагає довести, що рекурентна послідовність в кінцевому підсумку стає періодичною.

У минулому році на IMO 2025 лише 6 людей з усього світу розв’язали P6.

Claude Fable 5: 26 хвилин, два раунди, максимальний результат. GPT-5.6 Sol: 60 хвилин, два раунди, максимальний результат. Kimi K3: 381 хвилина, чотири раунди, максимальний бал.

Grok 4.5 на P6 видав лише 7053 токени, зайняв останнє місце. У файлі з підтвердженням чітко написано: Full proof: (Not yet complete.)

0,18 $, найдешевший білий папір на всій платформі.

Проблеми Гроку не обмежуються цим. Упродовж усього тестування він постійно потрапляв у дивні галюцинації: переконано стверджував, що «докази було записано у файл», тоді як у фоновому режимі навіть не торкався інструменту для запису.

Це не проблема математичних здібностей, а проблема здібностей агента. Модель знає, що має писати файл, і стверджує, що написав його, але на рівні виклику інструментів не виконала дій.

Три стрибки за три роки

Жахлива еволюція кремнієвого мозку

У 2024 році AlphaProof від DeepMind вперше досяг межі срібної медалі на рівні IMO.

У 2025 році OpenAI та DeepMind одночасно виступили. OpenAI не публікував модель, розв’язав 5 завдань і здобув золоту медаль з 35 балами, Gemini Deep Think досяг того ж рівня.

У 2026 році три загальні великі моделі отримали ідеальний результат. На цей раз ні одна з них не проходила спеціалізованого навчання з математики, і всі можуть їх використовувати. Навіть одна з них є відкритого коду.

Axiom Math

Автор машинного виклику

Початком усієї перевірки стала компанія Axiom Math.

Вони переклали всі шість завдань IMO 2026, слово за словом, у формат Lean 4, зрозумілий для машини.

З цією системою машинно-читаних завдань AI зможе безпосередньо генерувати докази Lean, а компілятор автоматично оцінюватиме їх, не потребуючи людських експертів.

Отримавши умову, Діді Дас швидко створила повністю автоматизовану тестову систему. Великі моделі розігналися по трасі й пройшли всі 6 етапів. AxiomProver також самостійно отримав ідеальний результат.

Варто зазначити, що засновниці Axiom Math Хон Летонь лише 25 років. Вона народилася в Гуанчжоу і за три роки здобула дві ступені з математики та фізики в MIT, а також стала лауреатом премії Morgan.

Наприкінці минулого року її створений AxiomProver отримав ідеальний результат на математичній олімпіаді Putnam. Це шостий ідеальний результат за 98-річну історію змагань.

У березні цього року компанія завершила раунд фінансування серії A на 200 мільйонів доларів США. Оцінка досягла 1,6 мільярда доларів США.

Axiom Math

Як буде перебудоване життя звичайних людей

Модель, яка може написати 4229 рядків строго доведеного коду, має не лише здатність розв’язувати математичні задачі.

Він справді керує ланцюговим логічним міркуванням, де кожен крок не можна пропустити, не можна помилитися і не можна бути нечітким.

Чи є пробіли в умовах договору, чи відповідають умови страхового виплати, чи є податкова схема відповідною до законодавства — за всіма цими питаннями приховано одну й ту ж саму проблему: відповідь не може бути «приблизно правильною».

Раніше така перевірка по одному запису була доступна лише професіоналам і оплачувалася за годину.

Зараз, зі впровадженням цієї функції у споживчі продукти, для вирішення складних питань достатньо просто відкрити телефон.

Джерела:

https://x.com/deedydas/status/2079409461874332066

Цей матеріал надійшов із офіційного каналу WeChat «Новий розум», автор: АСІ-Апокаліпсис, редактор: Моїсей

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.