如果不看名字,你肯定會以為這又是一個強大到無法公開發行的頂級模型,甩出的一份「開掛」戰績:
從事科研:一口氣解決了七道頂尖數學與電腦科學難題,提交的四十頁長篇證明連最嚴苛的機器審核都挑不出錯;
從零手寫了一個極度逼真的 CPU 模擬器,不僅成功啟動系統,運行誤差為 0.71%;
寫代碼:順手優化了 Eigen 和 ParlayHash 兩個主流開源庫的核心代碼,修改已直接被上游維護者合併。
這是谷歌 Antigravity 團隊於 8 月 27 日剛公布的成績單。

在 Teamwork 技術長文 中,谷歌 Antigravity 團隊集中公布數學、系統與開源三類成果。
令人意外的是,這次擔當主力的並非什麼算力吞金獸,而是主打「快且便宜」的小模型:Gemini 3.7 Flash。

Google 官方甚至定調:這是 Flash 級模型首次做出博士級的數學研究成果。
為何低成本模型能夠越級挑戰?
秘密不在參數裡,而在一套名為 Teamwork 的多智能體編排框架。
Google 真正想向行業傳遞的訊號是:不是 Flash 突然變聰明了,而是做事的組織方式變了。
Pro 主導探索
Flash 成功複現
誰是這份成績單的主角?谷歌的技術長文給出了非常嚴謹的界定:
7 項數學與理論電腦科學成果,最初均由 Gemini 3.1 Pro 在 Teamwork 的長證明模式下取得。
但令人驚艷的是,當中3項硬核成果被 Gemini 3.7 Flash 完整重現了。
這三項絕非用來湊數的邊緣問題:ℓp 子空間近似的 coreset 構造、最大內積嵌入的維度下界,以及將領先常數直接降低約 5.93 倍的 Hadamard 量化。
每一項,都是學術界正經八百的開放難題。

The remaining 4 items are solely handled by 3.1 Pro, including the condition number lower bound for sparse convex optimization, the approximate optimal lower bound for prefix matrix factorization, Knuth's Cycles problem, and the Erdős unit distance problem reproduced independently under offline conditions.
不仅如此,刷新谷歌內部記錄的 TCSBench 評測 71% 最高分,也是由 3.7 Flash 與 3.1 Pro 強強聯手跑出的,直接超越了上一代 3.6 Flash 搭 3.1 Pro 所取得的 67.7% 紀錄。
其中,真正值得我們注意的信號是:
只要把架構搭對,像 Flash 這樣主打輕量的小模型,完全能重新跑通旗艦模型所做的研究。
This is enough to refresh our understanding of what small models can do.
Teamwork 將「找茬」打造成硬核制度
Teamwork 是 Antigravity 團隊開發的多智能體編排框架。
你只需輸入 /teamwork-preview,Gemini 就會讀取提示詞、自行選擇模式,並即時邀請成員組建一個「AI 專家團」,運行數小時甚至數天。
The mathematical results mentioned earlier all come from the Long Proof mode.
它的設計思路極其反直覺:不靠堆砌參數,而是靠讓一群 Flash 聚在一起互相「挑刺、抬杠、挑軟肋」。
那這幫 AI 究竟是怎麼開會的?拆解下來總共有四步:
第一步:瘋狂內捲的「競爭策略搜索」。
系統會同時孵化多個候選方案,並為每個方案指派一名專職的「抬杠專員」,唯一KPI就是駁倒該方案。
有趣的是,即使被猛烈批評的方案也不會直接丟進回收站,而是帶著滿身反對意見留在流程中。
After all, inspiration that can save your life often lies within a dead-end path.
第二步:按圖索驥,「精準拆解」。
一旦選定可靠的策略,系統便會將其拆解為一連串具有依賴關係的子問題,並繪製成嚴密的拓撲圖。可並行的獨立推進,有先後順序的則按序排隊。
Step 3: The瘋狂內卷「內部錦標賽」。
在每個子問題內部再進行一輪淘汰賽,節點一邊閱讀候選方案,一邊參考毒舌批評,合力打磨出一個升級版。
如果綜合失敗,就帶著累積的反對意見重新運行,直到修補所有漏洞。
Step 4: “Cross-Round Learning” – Learn from Experience.
失敗的草稿原封不動留給下一轮,驗證器踩過的每個大坑統統沉淀進「陷阱登記簿」。
走過的死路、證出的結論,全部實時同步至共享知識庫,供全員隨時調用。

Long Proof 模式錦標賽網絡:每項候選策略配備一名 falsifier,被否決的路徑將帶著反對意見保留在流程中。
跑完這套流程,它与其說是個冷冰冰的超級大腦,不如說是複刻了一場極其殘酷、誰也別想渾水摸魚的學術組會。
Here, everyone's proposal must first go through several rounds of intense scrutiny—only the toughest bones will make it through successfully.
這直接治癒了傳統多智能體最常出現的群體癔症:
過去,一個 AI 稍有不慎帶偏了節奏,其他 AI 就會盲目跟隨,最終在錯誤的地基上越蓋越高。
團隊合作的殺手鐧,不過是將「互相找碴」實實在在地轉化為一套無人能逃避的硬核制度。
Knuth 難題的真相
關於這 7 項成果,最引人注目、也最容易被誤讀的,莫過於高德納(Donald Knuth)提出的 Knuth's Cycles 難題。
事實上,這道題在今年春天已經被 AI 接力解完了。

Donald Knuth,2023年斯坦福聖誕講座。
今年 2 月底,Claude Opus 4.6 僅用了一小時左右,就閃電般給出了奇數情形的構造,逼得高德納在論文開頭連寫兩個「Shock!」

隨後,gpt-5.3-codex 與 GPT-5.4 Pro 等模型接力登場,補全了最難處理的偶數情況。
By mid-April, Gartner definitively confirmed in the revised paper that the even case is no longer in doubt.
那谷歌這次做了什麼?
簡而言之,谷歌為偶數情況找到了兩個更優雅、更簡單的新構造,並隨之提出了兩份長達 40 多頁和 70 多頁的首批長篇證明。
其中那份40多頁的硬核證明,更通過了 Lean 形式化驗證,連機器都完全挑不出毛病。
這當然是相當扎實的學術貢獻,但它的真正意義在於「給出了更漂亮的證明」,而不是真正意義上的從零破局。
這反而顯示出 Teamwork 真正強大的地方:
它並未試圖彌補單一模型的「孤島智商」,而是透過制度化的博弈與協調,徹底解決了多智能體各自為政、相互附和的協作短板,釋放出「群體智慧」。
從定理到 Shell
這次真的是 Flash 干的
相同的找茬機制,谷歌換個模式,直接拿去啃硬核工程。
這次技術長文明確寫著「使用 Gemini 3.7 Flash」。Teamwork 從零構建了一個週期級、亂序執行的 RISC-V CPU 模擬器。
亂序執行是現代高性能 CPU 的標準配置,也是模擬器最容易崩潰的地方。
團隊合作分兩步走:先確保微架構功能正確,自行撰寫亂序流水線與重排序緩衝,成功將 xv6 操作系統啟動至 Shell;再逐週期對齊時序。

Teamwork 構建的 RISC-V 模擬器啟動 xv6 核心並進入 Shell 的過程。
The hardest hurdle, which Google calls the "silent execution gap".
模擬器的微架構狀態可能在數百個週期內悄然偏離,等到架構層面報錯時,早已無法追查根源。
The solution for Teamwork is to sandbox the reference simulator Spike to prevent agents from cheating or plagiarizing, and then perform synchronized simulation with reconciliation at every step.
最終,這套模擬器成功運行了100多個RISC-V標準基準測試,在未見過的測試負載上,與BOOM硬體的平均週期誤差僅為0.71%。

Google disclosed: Cycle alignment comparison between Teamwork simulator and BOOM hardware shows an average error of 0.71% on test workloads.
但這裡需要明確說明,這只是軟體層面的模擬器,絕非 RTL 芯片設計,更談不上流片造芯。
真實刀槍開源實戰
AI 科研下半场比的是落地與驗收
Compared to mathematics and simulators, the last category of results may seem the most unassuming, but the evidence is the most robust.
Eigen 是 C++ 世界中應用極廣的高性能線性代數庫。
Teamwork 在其中發現了一處單行或單列矩陣向量乘法的次優實現,並直接手寫了一條 SIMD 快速路徑。
而在並發雜湊表 ParlayHash 中,Teamwork 引入了 Swiss Table 的優化思路,讓 64 個執行緒的初始插入吞吐量直接翻倍,單執行緒整體吞吐量提升 1.5 倍,同時每個元素還少用了 25% 的記憶體。
這兩處修改絕非閉門造車的自嗨跑分,而是老老實實走完嚴苛的開源代碼審查,並被外部人類維護者正式合併到上游分支的真實代碼。
更值得留意的是,一篇數學論文結尾的作者聲明:證明首先由谷歌內部的 Gemini 智能體系統生成,再由作者核對與編輯。
智能體負責在無盡的草稿紙上瘋狂探索,人類則負責簽字和最終驗收。這才是眼下 AI 科研最真實的分工。
谷歌自己說得很清楚:這些問題原本要頂尖專家花上幾個月才能解決,Teamwork 壓縮的是試錯週期,方向盤和最後簽字權,仍在人手裡。
AI 科研的下半場,比的已經不是誰的模型參數更大,而是誰的 AI 團隊組得更好。
模型越便宜、越像隨用隨取的日用品,人類的驗收和把關就越值錢。
過去,人是解題的人。現在,人是出題和驗收的人。
Gartner 為 Claude 找到了一個手寫證明,後來得知有人用 Lean 驗證了它,他說:「這真是件好事」,因為自己「最近越來越容易出錯」。
即使是88歲圖靈獎得主的證明,也必須通過驗證器的檢驗,AI撰寫的證明更不能例外。
機器會越做越多解題的工作,但驗收這一關,一定要有人把關。
參考資料:
https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner
https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf
本文來自微信公眾號「新智元」,作者:ASI 啟示錄,編輯:元宇
