Если бы не название, вы бы точно подумали, что это еще одна супермощная модель, которую нельзя было выпустить публично, и ее «чудесный» результат:
Научные исследования: за один присест решены семь самых сложных математических и компьютерных задач, представленное 40-страничное доказательство не вызвало никаких замечаний даже у самого строгого машинного контроля;
Инженерная работа: вручную написал чрезвычайно реалистичный симулятор CPU, успешно запустил систему с погрешностью 0,71%;
Написал код: случайно оптимизировал ключевые части двух популярных открытых библиотек — Eigen и ParlayHash, изменения были сразу объединены поддерживаемыми разработчиками.
Это отчет, представленный командой Antigravity Google 27 августа.

В подробной технической статье Teamwork команда Google Antigravity представила три категории достижений: математические, системные и открытые.
Неожиданно, что главную роль сыграла не какая-то мощная модель, поглощающая вычислительные ресурсы, а небольшая модель, ориентированная на «скорость и низкую стоимость»: Gemini 3.7 Flash.

Официальный представитель Google даже заявил: это первый раз, когда модель уровня Flash достигла математических результатов уровня доктора.
На чем основывается способность недорогих моделей побеждать сильнейших противников?
Секрет не в параметрах, а в многоагентной оркестровочной системе под названием Teamwork.
На самом деле, то, что Google хочет донести до отрасли, — это не то, что Flash внезапно стал умнее, а то, что изменился способ организации работы.
Pro ведет исследование
Flash успешно воспроизведен
Кто является главным героем этого отчета? Техническая статья Google дает очень строгое определение:
7 результатов в области математики и теоретической информатики, первоначально все полученные Gemini 3.1 Pro в режиме длинных доказательств Teamwork.
Но удивительно то, что все три ключевых результата были полностью воспроизведены Gemini 3.7 Flash.
Эти три пункта совершенно не являются второстепенными вопросами для заполнения: построение coresets для приближения подпространств ℓp, нижняя граница размерности для вложения максимального скалярного произведения и квантование Хадамара, напрямую снижающее ведущую константу примерно в 5,93 раза.
Каждая из них — это настоящая открытая проблема в академическом сообществе.

Остальные четыре задачи полностью лежат на плечах 3.1 Pro: нижняя граница обусловленности для разреженной выпуклой оптимизации, приближенно оптимальная нижняя граница для префиксной матричной факторизации, задача Knuth's Cycles и проблема Эрдёша о единичных расстояниях, воспроизведенная автономно при отсутствии подключения к сети.
Более того, рекордный результат TCSBench в 71%, который побил внутренние показатели Google, был достигнут благодаря сочетанию 3.7 Flash и 3.1 Pro, превзойдя предыдущий рекорд в 67,7%, установленный комбинацией 3.6 Flash и 3.1 Pro.
Среди них настоящий сигнал, на который стоит обратить внимание:
Если правильно настроить архитектуру, такие легкие модели, как Flash, полностью могут воспроизвести исследования, проведенные с использованием флагманских моделей.
Этого достаточно, чтобы расширить наши представления о том, что могут делать малые модели.
Teamwork превратила «поиск ошибок» в жесткую систему
Teamwork — это фреймворк оркестрации мультиагентных систем, разработанный командой Antigravity.
Вам достаточно ввести /teamwork-preview, и Gemini прочитает подсказку, сам выберет режим и сразу соберёт «команду AI-экспертов», которая будет работать несколько часов или даже дней.
Упомянутые ранее математические достижения полностью получены в режиме длинного доказательства (Long Proof).
Его концепция крайне контринтуитивна: вместо накопления параметров он полагается на то, что группа Flash собирается вместе, чтобы друг друга «критиковать, спорить и находить слабые места».
А как именно эти ИИ проводят встречи? Всего выделяется четыре этапа:
Шаг 1: Безумная конкуренция в «поиске стратегий».
Система одновременно развивает множество кандидатских решений и назначает на каждое решение отдельного «специалиста по возражениям», чей единственный KPI — опровергнуть это решение.
Интересно, что схемы, подвергшиеся жесткой критике, никогда не выбрасываются прямо в корзину, а остаются в процессе, неся на себе все возражения.
В конце концов, на непроходимом «ложном пути» часто скрывается вдохновение, способное спасти жизнь.
Шаг 2: Следуйте по следам, «точно разберите».
После выбора надежной стратегии система разбивает ее на множество взаимосвязанных подзадач и строит строгую топологическую диаграмму. Независимые задачи могут выполняться параллельно, а задачи с последовательной зависимостью выполняются в порядке очереди.
Шаг 3: Безумная внутренняя конкуренция «внутреннего турнира».
Внутри каждой подзадачи проводится однократный турнир, где узлы одновременно читают альтернативные варианты и анализируют язвительную критику, совместно создавая улучшенную версию.
Если общий провал, перезапустите с накопленными возражениями, пока уязвимость не будет полностью устранена.
Шаг 4: «Межцикловое обучение» — учиться на своих ошибках.
Неудачные черновики остаются без изменений для следующего раунда; каждая ошибка, с которой столкнулся валидатор, фиксируется в «реестре ловушек».
Все пройденные мертвые пути и подтвержденные выводы в реальном времени синхронизируются с общей базой знаний, доступной всем для использования в любое время.

Сеть турнира в режиме Long Proof: для каждой кандидатской стратегии назначается один falsifier, а отклонённые пути остаются в процессе с возражениями.
Пройдя через этот процесс, он больше напоминает не холодный супермозг, а точную копию крайне жесткого академического семинара, где никто не может ничего скрыть.
Здесь чужой план сначала должны несколько раз жестко раскритиковать, и только костяк, который не разваливается, сможет успешно пройти.
Это сразу устраняет массовую истерию, наиболее часто встречающуюся у традиционных многоразумных систем:
Раньше, если один ИИ случайно сбивал ритм, другие ИИ слепо повторяли его, в итоге строя все выше на неправильном фундаменте.
Секретный прием командной работы — это превращение «поиска ошибок друг в друге» в жесткую систему, от которой невозможно уклониться.
Правда о головоломке Кнута
Из этих семи достижений самым примечательным и наиболее подверженным неправильному толкованию является задача Knuth's Cycles, предложенная Дональдом Кнутом.
На самом деле, эта задача уже была решена с помощью ИИ весной этого года.

Дональд Кнут, рождественская лекция Стэнфорда 2023 года.
В конце февраля этого года Клауд Опус 4.6 за примерно один час молниеносно предложил конструкцию для нечетных случаев, заставив Кнута написать два «Shock!» в начале статьи.

Затем модели gpt-5.3-codex и GPT-5.4 Pro дополнили самые сложные четные случаи.
К середине апреля Гартнер в пересмотренной версии статьи однозначно подтвердил: ситуация с четными числами уже не вызывает сомнений.
Что же сделал Google на этот раз?
Проще говоря, Google нашел два более элегантных и простых новых построения для четных случаев и сразу же представил две первые подробные доказательства объемом более 40 и 70 страниц.
Причем эта более чем 40-страничная строгая доказательная работа прошла формальную верификацию в Lean — даже машина не смогла найти никаких ошибок.
Это, конечно, довольно значительный академический вклад, но его истинное значение заключается в «предоставлении более изящного доказательства», а не в настоящем прорыве с нуля.
Это как раз демонстрирует настоящее сильное место Teamwork:
Он не стремился устранить «островной интеллект» отдельной модели, а путем институционализированной игры и координации полностью устранил слабость многопроцессных систем — рассеянность и взаимное согласие, высвободив «коллективный интеллект».
От теоремы до Shell
На этот раз действительно Flash виноват
Та же самая система поиска различий, Google сменила режим и сразу взялась за сложную инженерную задачу.
В этой технической статье прямо указано: «Использование Gemini 3.7 Flash». Команда Teamwork с нуля создала симулятор RISC-V CPU с циклическим и неупорядоченным выполнением.
Out-of-order execution is a standard feature of modern high-performance CPUs and the most common cause of simulator crashes.
Работа в команде проходит в два этапа: сначала обеспечить корректность микроархитектурных функций, самостоятельно реализовав конвейер с неупорядоченным выполнением и буфер переупорядочивания, чтобы успешно запустить операционную систему xv6 до оболочки; затем постепенно синхронизировать временные параметры по тактам.

Процесс запуска ядра xv6 и перехода в Shell с помощью симулятора RISC-V, построенного Teamwork.
Самый сложный этап, который Google называет «молчаливым разрывом».
Микроархитектурное состояние симулятора может незаметно отклоняться в течение нескольких сотен циклов, и к моменту, когда ошибка обнаруживается на архитектурном уровне, её первопричина уже невозможно установить.
Решение Teamwork заключается в изоляции эталонного симулятора Spike в песочнице для предотвращения мошенничества и плагиата агентами, а также в синхронном совместном моделировании с проверкой на каждом шаге.
В итоге эта симуляторная система успешно прошла более 100 стандартных тестов RISC-V, показав среднюю ошибку в 0,71% по циклам по сравнению с аппаратным решением BOOM на незнакомых тестовых нагрузках.

Google раскрыла: сравнение синхронизации циклов между симулятором Teamwork и оборудованием BOOM не выявило средней ошибки более 0,71% на тестовой нагрузке.
Однако здесь необходимо уточнить, что это симулятор на уровне программного обеспечения, совершенно не имеющий отношения к проектированию RTL-чипов и тем более к производству чипов.
Открытая практическая реализация с реальными инструментами
Во второй половине AI-исследований решающее значение имеет внедрение и проверка
По сравнению с математикой и симуляторами, последние результаты кажутся наиболее скромными, но доказательства у них самые убедительные.
Eigen — это высокопроизводительная библиотека линейной алгебры, широко используемая в мире C++.
Команда обнаружила неоптимальную реализацию умножения вектора матрицы на строку или столбец и непосредственно создала быструю траекторию на основе SIMD.
В параллельной хеш-таблице ParlayHash Teamwork внедрила оптимизации, вдохновленные Swiss Table, что позволило увеличить начальную пропускную способность вставки на 64 потоках вдвое, повысить общую пропускную способность на один поток на 1,5 раза и сократить использование памяти на каждый элемент на 25%.
Эти два изменения — не самодовольная оценка, сделанная в одиночку, а настоящий код, который был тщательно пройден через строгий процесс открытого кода и официально принят внешними сопровождающими в основную ветку.
Более важным, чем разбор баллов, является заявление автора в конце математической статьи: доказательство было сначала создано внутренней системой искусственного интеллекта Gemini от Google, а затем проверено и отредактировано автором.
Агенты отвечают за безумные поиски на бесконечных листах черновиков, а люди — за подпись и финальную проверку. Именно таково настоящее распределение обязанностей в современных AI-исследованиях.
Сам Google четко сказал: эти проблемы изначально требовали от ведущих экспертов нескольких месяцев работы, Teamwork сокращает цикл проб и ошибок, но руль и окончательное решение остаются за человеком.
Во второй половине AI-исследований решающим фактором уже не является размер параметров модели, а то, какая у вас лучше сформирована команда AI.
Чем дешевле модель и чем больше она похожа на товары повседневного спроса, тем ценнее становится проверка и контроль со стороны человека.
Раньше люди решали задачи. Сейчас люди ставят задачи и проверяют их.
Гарднер нашел рукописное доказательство для Клода, а затем узнал, что кто-то проверил его с помощью Lean, и сказал: «Это действительно хорошо», так как он «в последнее время все чаще допускает ошибки».
Даже доказательство лауреата Тьюринговской премии в возрасте 88 лет должно пройти проверку валидатором — доказательства, написанные ИИ, не могут быть исключением.
Задачи по решению будут увеличиваться с каждым днём. На этапе приёмки обязательно должен быть человек.
Справочные материалы:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
Эта статья взята из официального аккаунта WeChat «Новости ИИ», автор: АСИ, редактор: Юаньюй
