Google Gemini Flash розв’язує 3 математичні задачі рівня PhD за допомогою фреймворку командної роботи

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Google's Gemini Flash розв’язав три математичні задачі рівня доктора філософії за допомогою рамки відповідності, яка дозволяє агентам ШІ співпрацювати та вдосконалювати розв’язки. Легковагова модель відтворила результати, отримані раніше Gemini Pro, створивши безпомилкові доведення, підтверджені машинами. Фреймворк Teamwork імітує академічний огляд, демонструючи, як менші моделі можуть вирішувати складні завдання. Ліквідність та крипторинки можуть вигодувати від такої структурованої співпраці ШІ.

Якщо б не дивитися на назву, ти б вважав, що це ще один потужний моделі, який не може бути публічно випущений, і його «чіткий» результат:

Дослідження: за один присід розв’язано 7 найкращих математичних і комп’ютерних задач, з поданням 40-сторінкового доведення, яке навіть найстрогіша машинна перевірка не змогла знайти помилок;

Інженерія: вручну написав надзвичайно реалістичний симулятор CPU, який успішно завантажив систему з похибкою 0,71%;

Написав код: випадково оптимізував основний код двох популярних відкритих бібліотек — Eigen і ParlayHash, зміни були одразу прийняті основними розробниками.

Це результати, які команда Google Antigravity оприлюднила 27 серпня.

Google

У довгій технічній статті Teamwork команда Google Antigravity публікує три категорії досягнень: математичні, системні та відкритого коду.

На відміну від очікувань, головною зіркою цього разу стала не худоба, що поглинає обчислювальні потужності, а невелика модель, що позиціонується як «швидка та дешева»: Gemini 3.7 Flash.

Google

Офіційний Google навіть визначив: це перший дослідницький математичний результат рівня доктора, отриманий моделлю рівня Flash.

Чому дешеві моделі можуть перемагати сильніших суперників?

Секрет не в параметрах, а в системі оркестрації багатоагентних систем під назвою Teamwork.

Справжній сигнал, який Google хоче передати галузі: не те, що Flash раптово став розумнішим, а те, що змінився спосіб організації роботи.

Pro керує дослідженням

Flash успішно відтворено

Хто є головним героєм цього звіту? Технічна стаття Google надає дуже строге визначення:

7 результатів з математики та теоретичної інформатики, спочатку отриманих у режимі довгих доведень Teamwork за допомогою Gemini 3.1 Pro.

Але найбільш вражаючим є те, що три з цих жорстких досягнень були повністю відтворені Gemini 3.7 Flash.

Ці три пункти не є вторинними проблемами для заповнення: побудова coresets для наближення підпросторів ℓp, нижня межа розмірності для вкладення максимального скалярного добутку та квантування Хадамара, яке безпосередньо зменшує лідируючу константу приблизно у 5,93 рази.

Кожна з них — це справжня відкрита проблема в академічному світі.

Google

Чотири інші завдання були вирішені виключно 3.1 Pro: нижня межа умовності для розрідженої опуклої оптимізації, наближено оптимальна нижня межа для префіксної матричної декомпозиції, проблема Knuth's Cycles та незалежне відтворення проблеми Ердеша про одиничну відстань у умовах відсутності підключення до інтернету.

Крім того, рекордний результат 71% у тесті TCSBench, який побив внутрішні рекорди Google, було досягнуто за допомогою поєднання 3.7 Flash і 3.1 Pro, що перевершило попередній рекорд у 67,7%, отриманий за допомогою 3.6 Flash і 3.1 Pro.

Серед них справжнім сигналом, який варто звернути увагу, є:

Якщо правильно налаштувати структуру, такі легкі моделі, як Flash, повністю зможуть відтворити дослідження, що використовували флагманські моделі.

Цього достатньо, щоб розширити наші уявлення про те, що можуть робити малі моделі.

Teamwork перетворила «пошук помилок» на жорсткий процес

Teamwork — це фреймворк оркестрації багатоагентних систем, розроблений командою Antigravity.

Достаточно ввести /teamwork-preview, і Gemini прочитає підказку, сама вибере режим та миттєво зібре «команду AI-експертів», яка працюватиме кілька годин або навіть днів.

Вищезгадані математичні досягнення повністю походять із режиму довгого доведення (Long Proof).

Його концепція дуже неінтуїтивна: замість накопичення параметрів, вона базується на тому, щоб група Flash збиралася разом і взаємно «критикувала, сперлася, шукала слабкі місця».

А як саме ці AI проводять зустрічі? Розбивши це, загалом є чотири кроки:

Крок 1: Нав’язлива «стратегія пошуку конкуренції».

Система одночасно розробляє кілька варіантів і призначає кожному варіанту окремого «спеціаліста з запереченням», єдиним KPI якого є спростування цього варіанту.

Цікаво, що схеми, які отримали жорстку критику, ніколи не викидають безпосередньо у смітник, а залишаються в процесі з усіма протилежними думками.

В кінці кінців, у мертвому «відгалуженні» часто криється інспірація, яка може врятувати життя.

Другий крок: слідуйте за зображенням, «точково розберіть».

Після вибору надійної стратегії система розбиває її на сукупність залежних підзадач і візуалізує їх у вигляді строгого топологічного графа. Незалежні задачі виконуються паралельно, а ті, що мають порядок, чекають у черзі.

Третій крок: «Внутрішній турнір» з безумним внутрішнім конкурентним тиском.

Усередині кожної підзадачі проводиться вибуваючий турнір: вузол одночасно читає кандидатські варіанти та оцінює жорстку критику, щоб спільно створити покращену версію.

Якщо загальний провал, повторіть з накопиченими зауваженнями, доки не усунете всі вади.

Крок 4: «Міжциклове навчання» — вчіться на своїх помилках.

Невдалі чернетки залишаються без змін для наступного раунду, кожна помилка, на яку потрапив валидатор, заноситься до «реєстру пасток».

Всі пройдені мертві вулички та підтверджені висновки автоматично синхронізуються зі спільною базою знань, доступною для всіх у будь-який момент.

Google

Турнірна мережа режиму Long Proof: для кожної кандидатської стратегії призначено одного falsifier, а відхилені шляхи залишаються в процесі зі своїми зауваженнями.

Пройшовши цей процес, він більше схожий на надзвичайно жорстку академічну зустріч, де ніхто не може втрутитися, ніж на холодний супермозок.

Тут кожен варіант спочатку має пройти кілька циклів жорсткої критики — лише ті тверді кістки, що не розбиваються, зможуть успішно пройти перевірку.

Це безпосередньо лікує групову гістерію, яку найчастіше допускають традиційні багатоагентні системи:

Раніше один ШІ, випадково збивши ритм, заставляв інші ШІ сліпо повторювати його, в результаті чого на помилковій основі зводилися все вищі споруди.

Секретний інструмент командної роботи — це перетворити «взаємне знайдення помилок» у жорстку систему, від якої неможливо уникнути.

Правда про задачу Кнута

Щодо цих семи досягнень, найбільш захопливим і найчастіше неправильно інтерпретованим є завдання Knuth's Cycles, запропоноване Дональдом Кнутом.

Насправді, цю задачу вже було розв’язано штучним інтелектом весною цього року.

Google

Дональд Кнут, Стэнфордська різдвяна лекція 2023 року.

Кінець лютого цього року Claude Opus 4.6 за кілька годин швидко побудував конструкцію для непарних випадків, змусивши Кнута написати два «Shock!» на початку статті.

Google

Наступними з’явилися моделі gpt-5.3-codex та GPT-5.4 Pro, які доповнили найскладніші парні випадки.

До середини квітня Гарднер у переробленій версії статті чітко підтвердив: ситуація з парними числами вже не підлягає сумніву.

Що саме зробив Google цього разу?

Просто кажучи, Google знайшов два більш елегантні та прості нові конструкції для парних випадків і одночасно опублікував дві перші довгі доведення об’ємом понад 40 та 70 сторінок.

Цей міцний доказ на 40+ сторінок був перевірений за допомогою формальної верифікації Lean — навіть машина не змогла знайти жодних недоліків.

Це, звичайно, досить суттєвий академічний внесок, але його справжнє значення полягає в «наданні більш елегантного доведення», а не у справжньому розриві з нуля.

Це навпаки показує справжні сильні сторони Teamwork:

Він не намагався виправити «острівний інтелект» окремих моделей, а за допомогою інституціоналізованої гри та координації повністю подолав слабкість багатоагентних систем — розсіяний та пасивно підтримуючий один одного спосіб співпраці, відкривши «колективний інтелект».

Від теореми до Shell

Цього разу справді Flash це зробив

Та сама механізм пошуку відмінностей, Google змінив режим і безпосередньо застосував її до складних інженерних задач.

У цій технічній статті чітко зазначено: «Використання Gemini 3.7 Flash». Команда Teamwork з нуля розробила симулятор RISC-V CPU з циклічним та неупорядкованим виконанням.

Виконання в довільному порядку — це стандарт сучасних високопродуктивних процесорів і найчастіше місце, де симулятори збиваються.

Робота в команді проходить у два етапи: спочатку забезпечити правильність функціонування мікроархітектури, власноруч написати конвеєр з неупорядкованим виконанням та буфер переупорядкування, успішно запустити операційну систему xv6 до Shell; потім поетапно синхронізувати таймінг.

Google

Процес запуску ядра xv6 та переходу до оболонки за допомогою симулятора RISC-V, створеного Teamwork.

Найскладніший етап, який Google називає «тихим виконавчим розривом».

Мікроархітектурний стан симулятора може непомітно відхилятися протягом кількох сотень циклів, і коли помилка виявляється на рівні архітектури, вже неможливо знайти її початкову причину.

Рішення Teamwork полягає у ізоляції референсного симулятора Spike в пісочниці, щоб запобігти шахрайству та плагіату агентів, а потім у синхронному спільному симулюванні з перевіркою на кожному кроці.

На завершальному етапі симулятор успішно пройшов понад 100 стандартних тестів RISC-V і показав середню похибку у 0,71% у циклах порівняно з апаратним забезпеченням BOOM на невиданих раніше тестових навантаженнях.

Google

Google розкриває: порівняння синхронізації періодів між симулятором Teamwork та апаратним забезпеченням BOOM не виявило середньої похибки більше 0,71% на тестових навантаженнях.

Проте тут потрібно зрозуміти: це симулятор на рівні програмного забезпечення, а не проектування RTL-чіпа, і тим більше не виробництво чіпа.

Відкритий код у дії, на практиці

У другій половині AI-досліджень важливою є реалізація та прийняття

З усіх результатів останній виглядає найменш вражливо, але має найбільш переконливі докази.

Eigen — це високопродуктивна бібліотека лінійної алгебри, яка широко використовується в світі C++.

Команда виявила неоптимальну реалізацію множення вектора матриці з одним рядком або одним стовпчиком і безпосередньо розробила швидкий шлях на основі SIMD.

У паралельній хеш-таблиці ParlayHash Teamwork впровадила оптимізаційні ідеї Swiss Table, що дозволило подвоїти початкову пропускну здатність вставки при 64 потоках, збільшити загальну пропускну здатність одного потоку на 1,5 рази та зменшити використання пам’яті на 25% на кожен елемент.

Ці дві зміни — це не самозадоволення, зроблене в ізоляції, а справжній код, який був уважно перевірений через строгий процес огляду відкритого коду і офіційно прийнятий зовнішніми супроводжувачами в основну гілку.

Що варто звернути увагу, крім розподілу балів, — це зауваження автора наприкінці математичної статті: доведення спочатку було створене системою внутрішнього штучного інтелекту Gemini від Google, а потім перевірено та відредаговане автором.

Агенти відповідають за безперервне дослідження безкінечних листів паперу, а люди — за підписання та фінальне затвердження. Ось найбільш реальний розподіл обов’язків у сучасних AI-дослідженнях.

Сам Google чітко зазначив: ці питання спочатку мали вирішувати найкращі експерти протягом кількох місяців, а Teamwork скорочує цикл проб і помилок — керівництво та остаточне рішення залишаються за людиною.

Друга половина AI-досліджень вже не полягає в тому, хто має більші параметри моделі, а в тому, хто краще зібрав свою AI-команду.

Чим дешевшою та більшою на зразок товару повсякденного вжитку стає модель, тим ціннішим стає людське прийняття та контроль.

Раніше люди були тими, хто розв’язував задачі. Зараз люди — це ті, хто ставить задачі та перевіряє їх.

Гарднер знайшов конструктивний доказ, який був написаний від руки, і дізнавшись, що хтось перевірив його за допомогою Lean, сказав: «Це дійсно добре», оскільки він «останнім часом все частіше робить помилки».

Навіть доведення 88-річного лауреата премії Тьюринга має пройти перевірку через валідатор — доведення, написані ШІ, не можуть бути винятком.

З завданнями на розв’язання машини будуть справлятися все більше. Але на етапі прийняття обов’язково має бути людина.

Джерела:

https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner

https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf

Цей матеріал надійшов із офіційного аккаунту WeChat «Новий розум», автор: ASI Апокаліпсис, редактор: Юаньюй

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.