Google Gemini Flash решает три математические задачи уровня PhD с использованием фреймворка командной работы

icon MarsBit
Поделиться
AI summary iconСводка
Google's Gemini Flash решил три математические задачи уровня докторантуры, используя рамки соответствия, которые позволяют ИИ-агентам сотрудничать и уточнять решения. Легковесная модель воспроизвела результаты, ранее достигнутые Gemini Pro, и сгенерировала доказательства без ошибок, подтвержденные машинами. Фреймворк Teamwork имитирует академический рецензирование, демонстрируя, как более мелкие модели могут справляться со сложными задачами. Ликвидность и криптовалютные рынки могут извлечь выгоду из такой структурированной коллаборации ИИ.

Если бы не название, вы бы точно подумали, что это еще одна супермощная модель, которую нельзя было выпустить публично, и ее «чудесный» результат:

Научные исследования: за один присест решены семь самых сложных математических и компьютерных задач, представленное 40-страничное доказательство не вызвало никаких замечаний даже у самого строгого машинного контроля;

Инженерная работа: вручную написал чрезвычайно реалистичный симулятор CPU, успешно запустил систему с погрешностью 0,71%;

Написал код: случайно оптимизировал ключевые части двух популярных открытых библиотек — Eigen и ParlayHash, изменения были сразу объединены поддерживаемыми разработчиками.

Это отчет, представленный командой Antigravity Google 27 августа.

Google

В подробной технической статье Teamwork команда Google Antigravity представила три категории достижений: математические, системные и открытые.

Неожиданно, что главную роль сыграла не какая-то мощная модель, поглощающая вычислительные ресурсы, а небольшая модель, ориентированная на «скорость и низкую стоимость»: Gemini 3.7 Flash.

Google

Официальный представитель Google даже заявил: это первый раз, когда модель уровня Flash достигла математических результатов уровня доктора.

На чем основывается способность недорогих моделей побеждать сильнейших противников?

Секрет не в параметрах, а в многоагентной оркестровочной системе под названием Teamwork.

На самом деле, то, что Google хочет донести до отрасли, — это не то, что Flash внезапно стал умнее, а то, что изменился способ организации работы.

Pro ведет исследование

Flash успешно воспроизведен

Кто является главным героем этого отчета? Техническая статья Google дает очень строгое определение:

7 результатов в области математики и теоретической информатики, первоначально все полученные Gemini 3.1 Pro в режиме длинных доказательств Teamwork.

Но удивительно то, что все три ключевых результата были полностью воспроизведены Gemini 3.7 Flash.

Эти три пункта совершенно не являются второстепенными вопросами для заполнения: построение coresets для приближения подпространств ℓp, нижняя граница размерности для вложения максимального скалярного произведения и квантование Хадамара, напрямую снижающее ведущую константу примерно в 5,93 раза.

Каждая из них — это настоящая открытая проблема в академическом сообществе.

Google

Остальные четыре задачи полностью лежат на плечах 3.1 Pro: нижняя граница обусловленности для разреженной выпуклой оптимизации, приближенно оптимальная нижняя граница для префиксной матричной факторизации, задача Knuth's Cycles и проблема Эрдёша о единичных расстояниях, воспроизведенная автономно при отсутствии подключения к сети.

Более того, рекордный результат TCSBench в 71%, который побил внутренние показатели Google, был достигнут благодаря сочетанию 3.7 Flash и 3.1 Pro, превзойдя предыдущий рекорд в 67,7%, установленный комбинацией 3.6 Flash и 3.1 Pro.

Среди них настоящий сигнал, на который стоит обратить внимание:

Если правильно настроить архитектуру, такие легкие модели, как Flash, полностью могут воспроизвести исследования, проведенные с использованием флагманских моделей.

Этого достаточно, чтобы расширить наши представления о том, что могут делать малые модели.

Teamwork превратила «поиск ошибок» в жесткую систему

Teamwork — это фреймворк оркестрации мультиагентных систем, разработанный командой Antigravity.

Вам достаточно ввести /teamwork-preview, и Gemini прочитает подсказку, сам выберет режим и сразу соберёт «команду AI-экспертов», которая будет работать несколько часов или даже дней.

Упомянутые ранее математические достижения полностью получены в режиме длинного доказательства (Long Proof).

Его концепция крайне контринтуитивна: вместо накопления параметров он полагается на то, что группа Flash собирается вместе, чтобы друг друга «критиковать, спорить и находить слабые места».

А как именно эти ИИ проводят встречи? Всего выделяется четыре этапа:

Шаг 1: Безумная конкуренция в «поиске стратегий».

Система одновременно развивает множество кандидатских решений и назначает на каждое решение отдельного «специалиста по возражениям», чей единственный KPI — опровергнуть это решение.

Интересно, что схемы, подвергшиеся жесткой критике, никогда не выбрасываются прямо в корзину, а остаются в процессе, неся на себе все возражения.

В конце концов, на непроходимом «ложном пути» часто скрывается вдохновение, способное спасти жизнь.

Шаг 2: Следуйте по следам, «точно разберите».

После выбора надежной стратегии система разбивает ее на множество взаимосвязанных подзадач и строит строгую топологическую диаграмму. Независимые задачи могут выполняться параллельно, а задачи с последовательной зависимостью выполняются в порядке очереди.

Шаг 3: Безумная внутренняя конкуренция «внутреннего турнира».

Внутри каждой подзадачи проводится однократный турнир, где узлы одновременно читают альтернативные варианты и анализируют язвительную критику, совместно создавая улучшенную версию.

Если общий провал, перезапустите с накопленными возражениями, пока уязвимость не будет полностью устранена.

Шаг 4: «Межцикловое обучение» — учиться на своих ошибках.

Неудачные черновики остаются без изменений для следующего раунда; каждая ошибка, с которой столкнулся валидатор, фиксируется в «реестре ловушек».

Все пройденные мертвые пути и подтвержденные выводы в реальном времени синхронизируются с общей базой знаний, доступной всем для использования в любое время.

Google

Сеть турнира в режиме Long Proof: для каждой кандидатской стратегии назначается один falsifier, а отклонённые пути остаются в процессе с возражениями.

Пройдя через этот процесс, он больше напоминает не холодный супермозг, а точную копию крайне жесткого академического семинара, где никто не может ничего скрыть.

Здесь чужой план сначала должны несколько раз жестко раскритиковать, и только костяк, который не разваливается, сможет успешно пройти.

Это сразу устраняет массовую истерию, наиболее часто встречающуюся у традиционных многоразумных систем:

Раньше, если один ИИ случайно сбивал ритм, другие ИИ слепо повторяли его, в итоге строя все выше на неправильном фундаменте.

Секретный прием командной работы — это превращение «поиска ошибок друг в друге» в жесткую систему, от которой невозможно уклониться.

Правда о головоломке Кнута

Из этих семи достижений самым примечательным и наиболее подверженным неправильному толкованию является задача Knuth's Cycles, предложенная Дональдом Кнутом.

На самом деле, эта задача уже была решена с помощью ИИ весной этого года.

Google

Дональд Кнут, рождественская лекция Стэнфорда 2023 года.

В конце февраля этого года Клауд Опус 4.6 за примерно один час молниеносно предложил конструкцию для нечетных случаев, заставив Кнута написать два «Shock!» в начале статьи.

Google

Затем модели gpt-5.3-codex и GPT-5.4 Pro дополнили самые сложные четные случаи.

К середине апреля Гартнер в пересмотренной версии статьи однозначно подтвердил: ситуация с четными числами уже не вызывает сомнений.

Что же сделал Google на этот раз?

Проще говоря, Google нашел два более элегантных и простых новых построения для четных случаев и сразу же представил две первые подробные доказательства объемом более 40 и 70 страниц.

Причем эта более чем 40-страничная строгая доказательная работа прошла формальную верификацию в Lean — даже машина не смогла найти никаких ошибок.

Это, конечно, довольно значительный академический вклад, но его истинное значение заключается в «предоставлении более изящного доказательства», а не в настоящем прорыве с нуля.

Это как раз демонстрирует настоящее сильное место Teamwork:

Он не стремился устранить «островной интеллект» отдельной модели, а путем институционализированной игры и координации полностью устранил слабость многопроцессных систем — рассеянность и взаимное согласие, высвободив «коллективный интеллект».

От теоремы до Shell

На этот раз действительно Flash виноват

Та же самая система поиска различий, Google сменила режим и сразу взялась за сложную инженерную задачу.

В этой технической статье прямо указано: «Использование Gemini 3.7 Flash». Команда Teamwork с нуля создала симулятор RISC-V CPU с циклическим и неупорядоченным выполнением.

Out-of-order execution is a standard feature of modern high-performance CPUs and the most common cause of simulator crashes.

Работа в команде проходит в два этапа: сначала обеспечить корректность микроархитектурных функций, самостоятельно реализовав конвейер с неупорядоченным выполнением и буфер переупорядочивания, чтобы успешно запустить операционную систему xv6 до оболочки; затем постепенно синхронизировать временные параметры по тактам.

Google

Процесс запуска ядра xv6 и перехода в Shell с помощью симулятора RISC-V, построенного Teamwork.

Самый сложный этап, который Google называет «молчаливым разрывом».

Микроархитектурное состояние симулятора может незаметно отклоняться в течение нескольких сотен циклов, и к моменту, когда ошибка обнаруживается на архитектурном уровне, её первопричина уже невозможно установить.

Решение Teamwork заключается в изоляции эталонного симулятора Spike в песочнице для предотвращения мошенничества и плагиата агентами, а также в синхронном совместном моделировании с проверкой на каждом шаге.

В итоге эта симуляторная система успешно прошла более 100 стандартных тестов RISC-V, показав среднюю ошибку в 0,71% по циклам по сравнению с аппаратным решением BOOM на незнакомых тестовых нагрузках.

Google

Google раскрыла: сравнение синхронизации циклов между симулятором Teamwork и оборудованием BOOM не выявило средней ошибки более 0,71% на тестовой нагрузке.

Однако здесь необходимо уточнить, что это симулятор на уровне программного обеспечения, совершенно не имеющий отношения к проектированию RTL-чипов и тем более к производству чипов.

Открытая практическая реализация с реальными инструментами

Во второй половине AI-исследований решающее значение имеет внедрение и проверка

По сравнению с математикой и симуляторами, последние результаты кажутся наиболее скромными, но доказательства у них самые убедительные.

Eigen — это высокопроизводительная библиотека линейной алгебры, широко используемая в мире C++.

Команда обнаружила неоптимальную реализацию умножения вектора матрицы на строку или столбец и непосредственно создала быструю траекторию на основе SIMD.

В параллельной хеш-таблице ParlayHash Teamwork внедрила оптимизации, вдохновленные Swiss Table, что позволило увеличить начальную пропускную способность вставки на 64 потоках вдвое, повысить общую пропускную способность на один поток на 1,5 раза и сократить использование памяти на каждый элемент на 25%.

Эти два изменения — не самодовольная оценка, сделанная в одиночку, а настоящий код, который был тщательно пройден через строгий процесс открытого кода и официально принят внешними сопровождающими в основную ветку.

Более важным, чем разбор баллов, является заявление автора в конце математической статьи: доказательство было сначала создано внутренней системой искусственного интеллекта Gemini от Google, а затем проверено и отредактировано автором.

Агенты отвечают за безумные поиски на бесконечных листах черновиков, а люди — за подпись и финальную проверку. Именно таково настоящее распределение обязанностей в современных AI-исследованиях.

Сам Google четко сказал: эти проблемы изначально требовали от ведущих экспертов нескольких месяцев работы, Teamwork сокращает цикл проб и ошибок, но руль и окончательное решение остаются за человеком.

Во второй половине AI-исследований решающим фактором уже не является размер параметров модели, а то, какая у вас лучше сформирована команда AI.

Чем дешевле модель и чем больше она похожа на товары повседневного спроса, тем ценнее становится проверка и контроль со стороны человека.

Раньше люди решали задачи. Сейчас люди ставят задачи и проверяют их.

Гарднер нашел рукописное доказательство для Клода, а затем узнал, что кто-то проверил его с помощью Lean, и сказал: «Это действительно хорошо», так как он «в последнее время все чаще допускает ошибки».

Даже доказательство лауреата Тьюринговской премии в возрасте 88 лет должно пройти проверку валидатором — доказательства, написанные ИИ, не могут быть исключением.

Задачи по решению будут увеличиваться с каждым днём. На этапе приёмки обязательно должен быть человек.

Справочные материалы:

https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner

https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf

Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, редактор: Юаньюй

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.