就在剛剛,谷歌殺回來了!
今夜,谷歌正式發布了 Gemini 3.8 Flash,以及專攻網路安全的 Gemini 3.8 Flash Cyber。
這是谷歌在短短六週內連續發布的第三個 Flash 版本。
前兩次更新,看起來只是熱身,因為這一次,谷歌直接把性價比推到最前沿——
單任務成本 0.58 美元!輸入僅需 0.75 美元/百萬 Tokens!
就是這樣一個「白菜價」的小模型,在多項核心基準測試中,硬是達到了全球最強旗艦 Opus 5、GPT-5.6 Sol 和 Grok 4.6 的水準。
谷歌 DeepMind 的專家姚順宇評價說:對於模型而言,這只是邁出了一小步;但對於 RSI 來說,這是一次巨大飛躍。

在 X 上,開發者們已經炸了。
有人實測後,發出靈魂拷問:「天哪,谷歌是不是發錯貨了?這不就是一直沒放出的 Gemini 3.5 Pro 嗎?拿著 Flash 的價格,幹著 Pro 的活!」


在 DeepMind 團隊中,大概有人從 7 月開始就沒合過眼。
當所有人都還在消化 Fable 5.1 時,谷歌再次掀翻了牌桌。
谷歌「卷王」回歸:性價比之王
沉寂已久的 Google,以極度內卷的方式,向世界宣告:大魔王回來了。

要理解 Gemini 3.8 Flash 帶來的震撼,我們必須先看看當今 AI 市場的格局。
原本,在 Artificial Analysis 測試中,已形成極其嚴密的壁壘。若要擁有頂級的智力(Intelligence Index 約 60 分),就必須付出高昂的 Token 成本。
結果,Gemini 3.8 Flash 就像一個刺客,簡直不講武德。
在 Artificial Analysis 的高推理模式下,Gemini 3.8 Flash 的智力指數飆升到了 59 分!

這是什麼概念?這距離最頂級的 GPT-5.6 Sol 和 Grok 4.6 僅一步之遙,甚至在某些維度上超越了 Claude Opus 5!
而做到這一切的代價呢?它的單任務成本僅為 0.58 美元。
具體來說,輸入成本維持在 0.75 美元/百萬 Tokens,輸出為 3.75 美元/百萬 Tokens。
谷歌製作了一張圖:在智力與成本的帕累托前沿上,Gemini 3.8 Flash 那個代表「最高效」的藍點位於軟體工程基準 DeepSWE 的右上角,把第二名甩出了一條街。

Gemini 3.8 Flash 不僅聰明,還快得離譜。它的生成速度達到驚人的 305 tokens/s,而下一檔的模型才勉強跑到 154 tokens/s。
又快、又聰明、還便宜得像不要錢,這才是人類真正能天天用的模型。

尤其在長週期軟體工程基準(DeepSWE v1.1)上,3.8 Flash 打出了 73.7% 的驚人成績。
在這個需要 AI 自主解決複雜工程問題、端到端寫代碼的測試中,它不僅超越了大多數昂貴的前沿大模型,而且成本僅是後者的零頭。
要知道,這只是「Flash」版,並不是「Pro」,更不是「Ultra」。
這次,谷歌再次讓小型模型搶了旗艦模型的飯碗。
有人親測了 Gemini 3.8 Flash 和 Opus 5 執行同一任務。

這種在編程能力上的大幅躍升絕非偶然。

這種在編程能力上的大幅躍升絕非偶然。
據報導,在谷歌內部代碼工具 Jetski 的測試中,谷歌工程師甚至更傾向於使用 3.8 Flash,而非 Anthropic 的 Opus 模型。

這背後是谷歌從年初開始就在強化學習上大力投入資源——也就是模型訓練的「後期打磨」階段,讓模型在試錯中真正學會做事。
Google DeepMind 組建了一支代碼突擊隊,專注於提升編程模型能力,這個團隊由 DeepMind CTO 領導,聯創謝爾蓋·布林直接監督。
他們的目標是逼出遞歸自我進化,將程式設計模型硬生生改造為全自動 AI 研究員,徹底打通整個研發閉環。

在內部備忘錄中,谷歌直接說:
為了贏得最後的衝刺,我們必須緊急彌補智能體執行方面的差距,將我們的模型轉變為主力開發者。

此外,谷歌還挖來了Barret Zoph——Thinking Machines Lab聯合創始人,曾任OpenAI後訓練負責人,現任研究副總裁,主管強化學習與後訓練方向。這波操作,明顯是要死磕到底。
上個月,聯合創始人、諾貝爾獎得主 Demis Hassabis 辭去 CEO 職務,接任的 Koray Kavukcuoglu 上任後立即表示:提速、提速、再提速。
基準「注水」,還是實力超群?
不過,在讚嘆聲中,谷歌普遍被指提前開香檳,高興得太早。

最不爽的是 Meta——
Meta 的 Muse Spark 1.3 與 Gemini 3.8 Flash 狭路相逢,前者在 Artificial Analysis 的智能指數上獲得 62 分,與 Claude Fable 5 持平,躋身頂尖行列。
而 Muse 的輸入成本比 Fable 5 低 8 倍,輸出成本低近 12 倍,性價比拉滿。
Meta 的首席 AI 官 Alexandr Wang 直接諷刺道:在 Artificial Analysis 智能指數上,Gemini 什麼也不是,只能吃其他模型的汽車尾氣。


Muse Spark 1.3 的得分高於 GPT-5.6 Sol、Grok 4.6 和 Gemini 3.8 Flash,但目前僅限受限預覽。
有人指出,雖然 3.8 Flash 的基準測試圖好看,但實戰起來,就未必了。
的確,Gemini 3.8 Flash 在 Terminal-Bench 2.1、HLE 等測試中超越了 GPT-5.6 Sol 和 Opus 5,但 TBench 2.1 與 TBench 4 之間的巨大分數差距,暴露了這其中可能存在一定的「刷榜」成分。
也就是說,當面對陌生的、尚未被包含在訓練集中的真實世界 Zero-shot 挑戰時,3.8 Flash 大概率還是不如 Opus 5 這種參數巨獸。
但谷歌的解法極其聰明——勤能補拙。
正如谷歌在官方博客中所言:「這些性能的提升源於核心的設計選擇:3.8 Flash 工作得更努力。」
面對複雜任務時,3.8 Flash 被設計為會執行額外的推理步驟,不斷迭代調用工具。當遇到不懂的問題時,它不會直接放棄,而是透過消耗更多的 Token,在內部進行高速的自我驗證和反思。
即使它透過多次迴圈思考消耗了更多的 Token,由於其基礎單價實在太便宜(0.75 美元/百萬 tokens),算總賬下來,它依然比你直接調用一次 GPT-5.6 要便宜得多!
This strategy directly breaks the single-dimensional competition of "larger parameters = stronger capability" in the past.
它證明了:在一個完美的 Agent 循環中,速度和極低的推理成本,本身就是一種強大的智力。
為什麼發 Flash?「被取消的」Pro 版
Did Google really not send the wrong item this time?
Gemini 3.5 Pro 至今連影子都沒有。下一代的王牌 Gemini 4 預訓練數據倒是挺漂亮,但後訓練階段還未完成。

事實上,谷歌遲遲不發佈 Pro 版本,背後有一段辛酸史。
劈柴曾在今年5月誇下海口,說「下個月」就會推出更強大的 Pro 系列,但一直拖延。
其實,谷歌內部原本有幾個 3.5 Pro 的候選模型,但最終都被無情「殺掉」了——因為它們並沒有比現在的 Flash 系強出足夠多的身位!
同時,大家翹首以盼的下一代旗艦 Gemini 4 雖然在預訓練評估中表現良好,但目前仍卡在最關鍵的後訓練階段。
Overall, everything came together in a serendipitous way to drive the frantic iteration of the Flash series.
2 小時挖出數月才能發現的漏洞:網路安全版屠榜了
這次谷歌,只是讓 3.8 Flash 在常規任務上壓低價格嗎?
Far beyond that.
這次發布會真正的殺器,是它的雙生兄弟——Gemini 3.8 Flash Cyber。
連開發者都在驚呼:「到底是怎樣的安全任務,值得谷歌為 Flash 專門推出一個 Cyber 專屬變體?」
谷歌的答案是:為了對抗未來的 AI 黑客。
在發現漏洞的基準測試 CyberGym 上,3.8 Flash Cyber 取得 86.2% 的分數,直接屠榜,將之前的大型模型遠遠甩在身後。
不仅如此,現實世界中的代碼可不止 C/C++。
在谷歌內部橫跨20種程式語言的複雜程式碼庫綜合測試中,這個模型發現廣泛漏洞的成功率竟然超過了70%。
更驚人的,是它在真實世界的實戰戰績。
Chrome 安全團隊拿它進行測試,發現它生成的正確修復補丁數量,是之前市面上最優且體積大得多的商業模型的 2.6 倍。
Wiz 安全公司測試發現,其在滲透測試中的召回率提高了 7.5–9.7%,而成本降低了 2.3 到 5.2 倍。
最令人驚訝的是,谷歌雲漏洞研究團隊利用它,在短短 2 小時內,就發現了一個關鍵的基礎性漏洞——而以往,人類頂級專家找到這樣的漏洞,通常需要幾個月的時間!
在 CWE-Bench(補丁能力測試)中,3.8 Flash Cyber 的首次通過率達到 47.2%,與最領先的前沿大模型(47.8%)幾乎不相上下,但價格卻只有九牛一毛。

也正因 3.8 Flash Cyber 的網絡攻防破壞力過於驚人,谷歌並未選擇將其完全開源,而是透過全新的 Fairwind 計畫,僅向受信任機構開放。
OpenAI、Anthropic 與 谷歌:大模型三國殺進入分水嶺
透過 Gemini 3.8 Flash 的發布,可以看出當今 AI 三巨頭已經走上了三條截然不同的進化路線。
Anthropic(Claude 系列)專注於「知識的可靠性與穩定性」。
在偏向知識覆蓋和事實準確率的測試(如 AA-Omniscience)中,Claude 依然是降維打擊。
前七名全是 Claude 系,他們現在明顯在強化企業級任務中的不犯錯能力,力求穩定輸出。
OpenAI(GPT 系列)押注的是「深度推理與頓悟」。
在偏向物理、數學推導的 CritPt 測試中,GPT-5.6 Sol 斷崖式領先。
OpenAI 似乎在追求一種純粹的智力湧現,要求模型在沒有人告訴它答案時,能自己像科學家一樣「想」出來。
Google(Gemini 系)打造的是「無限循環的超高速打工人」。
Google 這次給出了第三種答案:也許我一次想不通最難的物理題,但我反應極快、成本極低。
在 Agent 的時代,我可以一秒鐘思考 100 次,寫代碼、運行、報錯、修改,以極低的成本進行暴力迭代,硬生生砸出正確結果。
Agen 在現實中遇到的麻煩,需要反覆試錯、調用工具、動態調整。
而 Gemini 3.8 Flash 簡直就是為這種「長程工作流」量身訂製的。
你可以在 Google Antigravity 中,僅用一個提示詞加上迴圈指令,就讓 3.8 Flash 自動生成一個包含謎題、環境貼圖和 3D 關卡的完整遊戲。
你可以用它一鍵生成帶有街景和導航的 DOS 版谷歌地圖。
顯然,Gemini 3.8 Flash 的易用性和成本,已經突破了某個奇點。
Gemini 3.8 Flash 的到來,彷彿谷歌向全行業宣告:大模型正擺脫「只有巨頭才用得起」的限制,向算力普惠狂奔。
那些原本需要耗費數萬美元、跑上數天數夜的智能體任務,現在只需幾杯咖啡的錢,幾分鐘就能完成。
屬於普通人的超級個體時代,真的來了。
This is the awakening moment for small models.
參考資料:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
編輯:Aeneas 大衛
本文來自微信公眾號「新智元」,作者:ASI啟示錄
