名前を見なければ、またしても公開できないほど強力なトップモデルが、「チート」のような成績を出したと思ってしまうだろう:
研究を行う:7つのトップレベルの数学およびコンピュータ科学の難問を一気に解決し、提出した40ページに及ぶ証明は、最も厳格な機械審査さえも不備を見つけることができなかった;
プロジェクト:ゼロから、システムを起動し、誤差0.71%という極めて高精度なCPUシミュレーターを手書きで作成した。
コードを書く:EigenとParlayHashの2つの主要なオープンソースライブラリのコアコードを最適化し、変更はアップストリームのメンテナーによって直接マージされた。
これは、GoogleのAntigravityチームが8月27日に発表した成績表です。

Teamworkの技術長文では、Google Antigravityチームが数学、システム、オープンソースの3つの成果を発表しました。
意外にも、今回の主役は計算リソースを大量に消費する巨大モデルではなく、「速く、安価」を売りにする小型モデルであるGemini 3.7 Flashだった。

Google公式は、これがFlash級のモデルが初めて博士レベルの数学的成果を達成したと評価している。
安価なモデルはなぜ階級を越えて戦えるのか?
秘密はパラメータにはなく、Teamworkというマルチエージェントオーケストレーションフレームワークにあります。
グーグルが業界に真正に伝えたいメッセージは、Flashが急に賢くなったのではなく、作業のやり方が変わったということである。
Proが探索を主導
Flashが成功して再現されました
この成績表の主役は誰か?グーグルの技術的な長文は、非常に厳密な定義を示している:
7つの数学および理論コンピュータ科学の結果は、すべて当初、Gemini 3.1 ProがTeamworkのロングプローフモードで達成した。
しかし驚異的なのは、その3つのハードコアな成果がGemini 3.7 Flashによって完全に再現されたことです。
これらの3つは、単なる補完的な問題ではなく、ℓp部分空間近似のcoreset構成、最大内積埋め込みの次元下限、そしてハダマール量子化によってリーディング定数を直接約5.93倍低減することである。
それぞれは、学術界における真面目な未解決問題である。

残りの4項目は3.1 Proが単独で対応し、スパース凸最適化の条件数下界、プレフィックス行列分解の近似最適下界、Knuthのサイクル問題、およびオフライン状態で再現されたErdős単位距離問題を含みます。
さらに、Googleの内部記録を更新したTCSBench評価の最高得点71%は、3.7 Flashと3.1 Proが強力に連携して達成したもので、前世代の3.6 Flashと3.1 Proが記録した67.7%を上回りました。
その中で、私たちが注目すべき真正なシグナルは:
編成フレームワークを正しく構築すれば、Flashのような軽量モデルでも、フラッグシップモデルで実現された研究を再現することが完全に可能です。
これは、「小さなモデルに何ができるか」という私たちの認識の境界を十分に広げます。
Teamworkは「找茬」をハードコアな制度にした
Teamworkは、Antigravityチームが開発したマルチエージェントオーケストレーションフレームワークです。
/teamwork-previewと入力するだけで、Geminiがプロンプトを読み取り、自らモードを選択し、その場で「AIエキスパートチーム」を組成し、数時間から数日間動き続けます。
前述の数学的成果は、すべてその長証明(Long Proof)モードから生み出されたものです。
その設計思想は極めて直感に反している:パラメーターを積み重ねるのではなく、複数のFlashが集まって互いに「指摘し合い、反論し合い、弱みを突き合う」ことによって成り立っている。
では、これらのAIはどのように会議をしているのでしょうか?これを分解すると、合計で4つのステップがあります:
ステップ1:過剰な競争による「競争戦略の検索」。
システムは同時に複数の候補案を育成し、各案に専任の「反論担当者」を割り当て、その唯一のKPIはその案を反論することです。
興味深いことに、激しく批判された案はそのままゴミ箱に捨てられるのではなく、反対意見を抱えたままプロセスに残される。
結局のところ、行き止まりの「歪んだ道」の中に、命を救うインスピレーションが隠れていることが多い。
ステップ2:図に従って、「精密に分解」する。
信頼できる戦略を一度選択すると、システムはそれを依存関係を持つ複数のサブ問題に分解し、厳密なトポロジー図として可視化します。並列で実行可能なものは同時に進み、順序が必要なものは順番に待ちます。
ステップ3:過熱する「内部トーナメント」。
各サブ問題内で新たなトーナメントを実施し、ノードは候補案を読みながら辛辣な批評を検討し、協力してアップグレード版を生み出す。
総合が失敗した場合、累積された反対意見を伴って再実行し、脆弱性を完全に修正するまで繰り返す。
ステップ4:「クロスラウンド学習」で教訓を活かす。
失敗したドラフトはそのまま次ラウンドに残し、バリデーターが踏んだすべての落とし穴を「トラップ登録簿」に蓄積する。
通った死胡同と証明された結論は、すべてリアルタイムで共有知識ベースに同期され、全員がいつでも参照できます。

Long Proofモードのトーナメントネットワーク:各候補戦略に1名のファルシファイラーを割り当て、否決されたルートは反対意見を伴ったままプロセスに残る。
この一連のプロセスを経ると、それは冷たい超脳というより、非常に厳しく、誰も水を濁すことができない学術セミナーを再現しているように見える。
ここで、誰の案もまず数回にわたって激しく批判され、砕けない硬い骨だけがスムーズに通過できる。
これは、従来のマルチエージェントが最もよく犯す集団ヒステリーを直接改善します:
以前、あるAIがうっかりリズムを狂わせると、他のAIが無批判に「おうむ返し」になり、誤った基盤の上にどんどん高層を築いていった。
チームワークの秘策とは、「互いに突っ込む」ことを、誰も逃れられない確固たる制度に変えたことだ。
クヌースの難題の真実
この7つの成果のうち、最も注目され、誤解されやすいのは、ドナルド・クヌースが提唱したKnuth's Cyclesの難題である。
実際、この問題は今年の春にすでにAIが継承して解かれました。

ドナルド・クヌース、2023年スタンフォード・クリスマス講義
今年2月末、Claude Opus 4.6はわずか1時間ほどで奇数の場合の構成を閃光のように提示し、高德納が論文の冒頭に「Shock!」を二つ連続して書き記すに至った。

その後、GPT-5.3-CodexやGPT-5.4 Proなどのモデルが続々と登場し、最も難しい偶数のケースも補完しました。
4月中旬までに、ガートナーは論文の改訂版で、偶数の場合にはもはや疑いの余地がないと明確に断定した。
では、グーグルは今回何をしたのですか?
簡単に言えば、グーグルは偶数の場合に、より洗練され、より単純な2つの新しい構成を発見し、同時に最初の長編証明としてそれぞれ40ページ以上と70ページ以上の文書を発表しました。
その40ページ以上のハードコアな証明は、Lean形式検証を通過し、機械さえも問題を見つけることができません。
これは確かに相当堅実な学術的貢献ですが、その真の意義は、まったく新しい突破口を開くことではなく、「より洗練された証明」を提示したことにあります。
これはむしろTeamworkの真の強みを示している:
それは、単一モデルの「孤立した知性」を補完するのではなく、制度化されたゲーム理論と編成を通じて、マルチエージェントの散在し、互いに同調するという協力の課題を根本的に解決し、「群衆の知恵」を解放した。
定理からShellへ
今回は本当にFlashがやったんだ
同じ探し出しメカニズムを使用して、グーグルは別のモードに変更し、ハードコアなエンジニアリングをそのまま取り入れた。
今回は技術的な長文で明確に「Gemini 3.7 Flashを使用」と記されています。Teamworkはゼロから周期単位、順序非依存実行のRISC-V CPUシミュレーターを構築しました。
乱序実行は現代の高性能CPUの標準機能であり、エミュレーターで最も崩れやすい部分でもある。
チームワークは二段階で進める:まず、マイクロアーキテクチャの機能が正しく動作することを確認し、自らオーダー乱れパイプラインとリオーダバッファを実装して、xv6オペレーティングシステムをシェルまで起動させる。次に、クロックサイクルごとにタイミングを同期させる。

Teamworkが構築したRISC-Vシミュレータがxv6カーネルを起動し、Shellに進入するプロセス。
最も難しい段階は、Googleが「サイレント実行のギャップ」と呼ぶものである。
シミュレータのマイクロアーキテクチャ状態は、数百サイクルにわたって静かにずれていき、アーキテクチャレベルでエラーが報告された頃には、その根本原因を特定できなくなっている。
チームワークの解決策は、参照シミュレータSpikeをサンドボックス化して隔離し、エージェントの不正やコピーを防ぎ、全行程を同期してシミュレーションし、各ステップで照合することです。
最終、このシミュレーターは100以上のRISC-V標準ベンチマークを実行し、未見のテスト負荷においてBOOMハードウェアとの平均サイクル誤差は0.71%に過ぎませんでした。

Googleの開示:TeamworkシミュレータとBOOMハードウェアのサイクルアライメント比較では、テスト負荷における平均誤差は0.71%未満でした。
ただし、ここで明確にしておく必要がありますが、これはソフトウェアレベルのエミュレーターであり、RTLチップ設計ではなく、さらにはチップの製造や流片には及びません。
本物のオープンソース実践
AI研究的下半场比拼的是落地与验收
数学やシミュレーターと比べて、最後のカテゴリの成果は最も地味に見えるが、その証拠は最も堅実である。
Eigenは、C++の世界で広く使用されている高性能線形代数ライブラリです。
Teamworkは、単一行または単一列の行列ベクトル積の非最適な実装を特定し、直接SIMDの高速パスを手作業で実装しました。
並列ハッシュテーブルParlayHashでは、TeamworkがSwiss Tableの最適化アイデアを導入し、64スレッドでの初期挿入スループットを2倍に、シングルスレッドの全体スループットを1.5倍に向上させるとともに、各要素のメモリ使用量を25%削減しました。
この2つの変更は、閉門造車の自己満足的なパフォーマンス評価ではなく、厳格なオープンソースコードレビューを経て、外部のメンテナーによって正式にアップストリームブランチにマージされた本物のコードです。
ランニングスプリットよりも注目すべきは、数学論文の末尾に記された著者の声明である:証明はまずGoogle内部のGeminiエージェントシステムによって行われ、その後著者によって検証・編集された。
エージェントは無限の下書き用紙で狂ったように探求し、人間は署名と最終承認を担当する。これが現在のAI研究における最も現実的な役割分担である。
グーグル自身が明確に述べているように、これらの問題は本来、最高峰の専門家が数ヶ月かけて取り組むものでした。Teamworkは試行錯誤のサイクルを短縮するだけで、運転席と最終的な承認権は依然として人間が握っています。
AI研究の後半戦では、モデルのパラメータ数が大きいかどうかではなく、どのAIチームをより良く構築できたかが勝負の分かれ目である。
モデルが安くなり、使い捨ての日用品のように扱われるほど、人間の検証と品質管理の価値が高まる。
以前、人は問題を解く存在だった。今、人は問題を出し、検証する存在である。
高德納はClaudeに手書きの証明を構成させ、後にLeanでそれが検証されたことを知り、「最近、間違いが増えているので、これは本当に良いことです」と言いました。
88歳のチューリング賞受賞者の証明でさえ検証ツールを通過しなければならず、AIが書いた証明也不例外。
問題を解く作業は、機械がどんどん増えていく。検収の段階では、必ず人が監視しなければならない。
参考資料:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
本文は微信公众号「新智元」より、著者:ASI启示録、編集:元宇
