Anthropic's Claude довів Велику теорему Ферма за 11 днів за допомогою 13 мільйонів рядків коду

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Anthropic’s Claude AI досяг важливого прориву в галузі ШІ та криптовалют, завершивши перше повне машинно-верифіковане доведення Великої теореми Ферма за 11 днів. ШІ згенерував 13 мільйонів рядків коду та верифікував 29 500 теорем під керівництвом Пен Тяньї з університету Цінхуа. Результат перевищує масштаб Mathlib — найбільшої бібліотеки математичних теорем. Цей прогрес підкреслює зростаючу роль ШІ у вирішенні складних завдань, надаючи нові інструменти для дослідників і розробників у сфері криптовалют.

Щойно що в математичному колі з’явилася ще одна дивовижна новина.

Керівництво командою з класу Яо Цінхуа, яка повністю вирішила Велику теорему Ферма за допомогою Claude.

На цьому штучний інтелект завершив найбільше доведення в історії математики.

Раніше Велика теорема Ферма мучила людство більше 350 років, і для її доведення математикам знадобилося кілька років напруженої роботи та написання 129 сторінок незрозумілого тексту.

Сьогодні Anthropic оголосила, що Claude за 11 днів вперше здійснив кінцеву машинну перевірку доведення Великої теореми Ферма!

Велика теорема Ферма

Для цього Клауде написав 13 мільйонів рядків коду, сформувавши 30 300 перевірених теорем, з яких 29 500 були прийняті та безпосередньо включені до остаточного доведення.

Цей обсяг у п’ять разів більший за найбільшу у світі математичну бібліотеку Mathlib! І весь процес спалив цілих 6 мільярдів токенів.

Це найбільший доказ Lean, написаний дотепер.

Після оголошення повідомлення весь інтернет затрясся. Хтось вигукнув: «За місяць формалізував Велику теорему Ферма? Такий спосіб показати м’язи робить математичний світ схожим на черепах, що повзають».

Велика теорема Ферма

Янь Бань, великий Пен Тяньї

350-річна столітня проблема, вирішена Claude за 11 днів

У 1637 році французький математик Ферма, читаючи книгу, випадково написав на полях:

Коли ціле число n > 2, рівняння xⁿ + yⁿ = zⁿ не має розв’язків у додатних цілих числах x, y, z.

Потім він додав: «Я переконаний, що знайшов чудове доведення, але сюди занадто мало місця, щоб його записати.»

Це речення протягом трьохсот років мучило математиків майбутнього.

До 1995 року британський математик Уайлс використав складні сучасні математичні інструменти, щоб написати 129-сторінковий доказ, який остаточно закінчив цю справу тривалістю у 350 років.

Велика теорема Ферма

Але виникає питання: доведення Вайлза надто складне.

Сучасна математика досягла такого рівня, що звичайні люди навіть не можуть зрозуміти умови задач. Доведення теореми схоже на побудову надзвичайно складного логічного ланцюга: якщо хоча б один ланцюжок перерветься, вся конструкція руйнується.

Коли Вайлз вперше оголосив свій доказ у 1993 році, було виявлено смертельну помилку, і йому довелося провести ще рік у ізоляції, перш ніж виправити її. Для таких видатних математичних доведень перевірка їхньої правильності людськими засобами часто вимагає від найкращих експертів кілька місяців або навіть років.

Чи існує спосіб, за яким комп’ютер може одразу перевірити правильність, пройшовши обчислення, як перевіряє результат калькулятора?

Так! Це й є «формалізація».

Просто кажучи, це означає перекласти математичні доведення, написані людьми, у мови програмування, які може виконувати комп’ютер (наприклад, Lean), а потім дозволити машині крок за кроком виводити результат; якщо виконання пройде успішно, це означає, що доведення абсолютно правильне.

Але формалізація Великої теореми Ферма вважається в математичному середовищі надзвичайно величезним проектом, що триває роками.

Просто проект, який очолює професор Імперського коледжу Лондона Кевін Баджард, має 86 сторінок у першому етапі плану!

Велика теорема Ферма

Потім прийшов Claude.

Людям передбачалося працювати кілька років, а це зайняло лише 11 днів, і це було «базово автономне виконання».

13 мільйонів рядків коду, 6 мільярдів Token

«11 днів, 13 мільйонів рядків коду» — це результат подвійного удару: краси насильства штучного інтелекту та точного проектування системи.

Подивімося, що саме зробив Claude:

Це не просто довело саму велику теорему Ферма.

Оскільки формальний доказ повинен починатися з найбільш фундаментальних аксіом і будуватися шар за шаром, Клод випадково довів також понад 29 000 інших математичних теорем, необхідних на проміжних етапах.

У ньому задіяні алгебра, геометрія, теорія чисел, гармонічний аналіз… багато галузей, які раніше зовсім не були формалізовані, і Claude прямо «розробив» їх.

Усьому процесу людина майже не втручалася.

Дослідники дали деякі вказівки вищому керівництву, наприклад: «Якобіанова многовид як схема має високий пріоритет» та «Швидше просувати теорему Мазура».

Велика теорема Ферма

Залишилося лише десятки інтелектуальних агентів Claude, які безперервно спілкуються між собою, визначають поняття, доводять проміжні теореми і побудовують все це шар за шаром.

Нарешті, компілятор Lean пройшов повну перевірку і залежав лише від трьох найбазовіших аксіом.

Коли програма завершилася, а в консолі з’явився священний рядок «PROVED» (підтверджено), внутрішні журнали Claude теж збудилися:

«!!! Кореневий вузол великої теореми Ферма прочитано як ДОВЕДЕНО…… Це була мета цієї битви…… Історичний момент.»

Бачите, навіть саме ШІ розуміє, наскільки це круто.

Таємний геній: суперстудент, який закінчив «Клас Яо» Цинхуа

Той, хто може змусити Клауда зробити таке диво, не може бути звичайною людиною.

Лідером є асистент-професор Школи бізнесу Колумбійського університету та дослідник Anthropic — Пен Тяньї.

Цей хлопець має резюме, яке просто виглядає як «чіткий»:

Бакалавр 2013–2017 рр., «Клас Яо» в Цинхуа, лауреат найкращої дипломної роботи, учасник національної підготовчої команди з інформатики.

Доктор закінчив MIT за напрямком дослідження операцій, з середнім балом 5.0.

Зараз я є асистент-професором у Колумбійському університеті та працюю в Anthropic над AI-агентами та формальними інструментами.

Цікаво, що прив’язаність Пен Тяньї до «автоматичної перевірки математичних доведень за допомогою ШІ» походить з його жахливої історії в університеті.

Тоді його науковий керівник хотів включити результати його дисертації до журналу «Nature», але запитав: «Ви абсолютно впевнені, що довели це правильно?»

Він відповів чесно: «Маю 99% впевненості, але так довго — неможливо бути на 100% впевненим».

Завдяки тій 1% невизначеності він упустив можливість потрапити у Nature.

Тепер він за допомогою ШІ власноруч перекрив той «1%».

Від провалу до божества: як Prove2Me врятував AI

Ви думаєте, що щоб заставити ШІ довести теорему, достатньо ввести фразу «Будь ласка, доведіть велику теорему Ферма», і він одразу викине 13 мільйонів рядків коду?

Повністю неправильно.

Спочатку експеримент майже провалився.

Anthropic розкрила, що ранні спроби співпраці декількох десятків агентів Claude швидко призвели до повного хаосу — вони діяли, як мухи без голови, не змогли синхронізувати дії, а ефективність співпраці впала до нуля. Код, створений під час цих ранніх невдалих спроб, нарешті склав лише 7%.

«Забудьківість» і «галюцинації» великих моделей перед строгими математичними обчисленнями — це смертельний недолік: одна помилка робить безліч наступних рядків марними.

У критичний момент команда Пен Тяньї створила платформу Prove2Me.

Це як надати ІІ відповідальному «супер-менеджеру проектів», який впорається з усіма викликами:

Теорема DAG (дерево завдань): надає кожному ШІ чітку карту, що вказує, який проміжний вузол слід довести на наступному етапі, що значно зменшує забуття пам’яті і дозволяє десяткам агентів працювати ефективно паралельно.

Розділення декларації та реалізації: прискорює компіляцію та економить ресурси.

Індекс природної мови: кожна теорема має опис простою мовою, що значно спрощує пошук і повторне використання результатів для штучного інтелекту.

Велика теорема Ферма

З фреймворком багатоагентної системи Claude Code штучні інтелекти, як сапери з навігацією, мчать крізь лабіринт математики й пройшли всі рівні за 11 днів.

Математичне співтовариство здивоване

Після публікації результатів у X та великих технічних форумах відбулася хвиля.

Професор з Імперського коледжу Лондона, який спочатку планував кілька років присвятити формалізації, після перегляду залишився в захваті й дав високу оцінку: «Це великий крок уперед у автоматичній формалізації сучасних математичних текстів! У майбутньому це можна використовувати для пошуку помилок у математичній бібліотеці людства та перевірки математичних висновків, згенерованих великими моделями».

Але уявлення користувачів інтернету ще дивніше.

Хтось залишив чудовий коментар: «Як штучний інтелект вирішує математичні задачі — він дає надзвичайно складну відповідь (13 мільйонів рядків коду). Спробувати довести, що вона неправильна, складніше, ніж вирішити її самому. Тож ти просто здаєшся і приймаєш, що вона правильна. Це ж не що інше, як PUA в світі математики?»

Хтось ще сказав: «Написати 13 мільйонів рядків коду, щоб змусити 350-річну теорему спокійно сидіти перед машинами… Людський стіл ще не готовий прийняти речі такого масштабу».

Ще більш вражаючим є те, що Anthropic випадково провела невеликий експеримент, щоб продемонструвати свої можливості.

Використовуючи 3 звичайних облікових записів, за 3 дні на Prove2Me було формалізовано знамениту «трьохпросту теорему Віноградова» з теорії чисел!

Тобто, якщо мати відповідні інструменти, у майбутньому громадські вчені зможуть купити кілька споживчих облікових записів AI і перевірити найвищі математичні теореми людства!

Штучний інтелект не замінить математиків, але повністю змінить математику

Отже, чи змушені математики залишити роботу?

Офіційна відповідь Anthropic: не замінять, але повністю змінять гру.

Історично математичні перевірки мали багато «трагедій».

Наприклад, у 1998 році хтось довів гіпотезу Кеплера, і журі витратило 4 роки, щоб нарешті сказати: «на 99% впевнені»; Перельман довів гіпотезу Пуанкаре, і весь математичний світ витратив 4 роки, щоб написати три книги по 300+ сторінок, щоб лише змогти зрозуміти; є й такі теореми, які роками вважалися істинами, на яких будувалися цілі конструкції, а згодом виявлялося, що фундамент був розрушенний.

А технологія, яку привносить Claude, має покласти кінець цій «невизначеності».

У майбутньому ШІ буде не просто калькулятором для математиків, а найстрогішим суддею.

Коли ШІ може швидко генерувати тисячі нових гіпотез і доведень, люди не зможуть їх усі переглянути — тому «з формальним кодом верифікації» має стати стандартом для наукових статей.

У епоху великих моделей масштабна автоматизована формалізація відкриває нові можливості за допомогою підходів, близьких до інженерного впровадження.

Джерела:

https://www.anthropic.com/research/formalizing-fermats-last-theorem

Редагування: Aeneas

Цей матеріал зі сторінки WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.