Google 的 Gemini 3.8 Flash 以低成本和高性能挑戰頂尖 AI 模型

icon MarsBit
分享
AI summary icon精華摘要
頂尖山寨幣新聞揭幕,谷歌推出 Gemini 3.8 Flash 及其網絡安全版本 Gemini 3.8 Flash Cyber。該模型單一任務每百萬個代幣僅需 0.58 美元,輸入則為 0.75 美元,表現優於或與 GPT-5.6 Sol 和 Grok 4.6 持平。Gemini 3.8 Flash Cyber 在 CyberGym 測試中取得 86.2% 的分數,兩小時內發現關鍵漏洞。谷歌專注於速度、低成本和迭代推理,撼動了 AI + 加密貨幣新聞領域,挑戰「越大越好」的模式。

就在剛剛,谷歌殺回來了!

今夜,谷歌正式發布了 Gemini 3.8 Flash,以及專攻網路安全的 Gemini 3.8 Flash Cyber。

這是谷歌在短短六週內連續發布的第三個 Flash 版本。

前兩次更新,看起來只是熱身,因為這一次,谷歌直接把性價比推到最前沿——

單任務成本 0.58 美元!輸入僅需 0.75 美元/百萬 Tokens!

就是這樣一個「白菜價」的小模型,在多項核心基準測試中,硬是達到了全球最強旗艦 Opus 5、GPT-5.6 Sol 和 Grok 4.6 的水準。

谷歌 DeepMind 的專家姚順宇評價說:對於模型而言,這只是邁出了一小步;但對於 RSI 來說,這是一次巨大飛躍。

Google

在 X 上,開發者們已經炸了。

有人實測後,發出靈魂拷問:「天哪,谷歌是不是發錯貨了?這不就是一直沒放出的 Gemini 3.5 Pro 嗎?拿著 Flash 的價格,幹著 Pro 的活!」

Google

Google

在 DeepMind 團隊中,大概有人從 7 月開始就沒合過眼。

當所有人都還在消化 Fable 5.1 時,谷歌再次掀翻了牌桌。

谷歌「卷王」回歸:性價比之王

沉寂已久的 Google,以極度內卷的方式,向世界宣告:大魔王回來了。

Google

要理解 Gemini 3.8 Flash 帶來的震撼,我們必須先看看當今 AI 市場的格局。

原本,在 Artificial Analysis 測試中,已形成極其嚴密的壁壘。若要擁有頂級的智力(Intelligence Index 約 60 分),就必須付出高昂的 Token 成本。

結果,Gemini 3.8 Flash 就像一個刺客,簡直不講武德。

在 Artificial Analysis 的高推理模式下,Gemini 3.8 Flash 的智力指數飆升到了 59 分!

Google

這是什麼概念?這距離最頂級的 GPT-5.6 Sol 和 Grok 4.6 僅一步之遙,甚至在某些維度上超越了 Claude Opus 5!

而做到這一切的代價呢?它的單任務成本僅為 0.58 美元。

具體來說,輸入成本維持在 0.75 美元/百萬 Tokens,輸出為 3.75 美元/百萬 Tokens。

谷歌製作了一張圖:在智力與成本的帕累托前沿上,Gemini 3.8 Flash 那個代表「最高效」的藍點位於軟體工程基準 DeepSWE 的右上角,把第二名甩出了一條街。

Google

Gemini 3.8 Flash 不僅聰明,還快得離譜。它的生成速度達到驚人的 305 tokens/s,而下一檔的模型才勉強跑到 154 tokens/s。

又快、又聰明、還便宜得像不要錢,這才是人類真正能天天用的模型。

Google

尤其在長週期軟體工程基準(DeepSWE v1.1)上,3.8 Flash 打出了 73.7% 的驚人成績。

在這個需要 AI 自主解決複雜工程問題、端到端寫代碼的測試中,它不僅超越了大多數昂貴的前沿大模型,而且成本僅是後者的零頭。

要知道,這只是「Flash」版,並不是「Pro」,更不是「Ultra」。

這次,谷歌再次讓小型模型搶了旗艦模型的飯碗。

有人親測了 Gemini 3.8 Flash 和 Opus 5 執行同一任務。

Google

這種在編程能力上的大幅躍升絕非偶然。

Google

這種在編程能力上的大幅躍升絕非偶然。

據報導,在谷歌內部代碼工具 Jetski 的測試中,谷歌工程師甚至更傾向於使用 3.8 Flash,而非 Anthropic 的 Opus 模型。

Google

這背後是谷歌從年初開始就在強化學習上大力投入資源——也就是模型訓練的「後期打磨」階段,讓模型在試錯中真正學會做事。

Google DeepMind 組建了一支代碼突擊隊,專注於提升編程模型能力,這個團隊由 DeepMind CTO 領導,聯創謝爾蓋·布林直接監督。

他們的目標是逼出遞歸自我進化,將程式設計模型硬生生改造為全自動 AI 研究員,徹底打通整個研發閉環。

Google

在內部備忘錄中,谷歌直接說:

為了贏得最後的衝刺,我們必須緊急彌補智能體執行方面的差距,將我們的模型轉變為主力開發者。

Google

此外,谷歌還挖來了Barret Zoph——Thinking Machines Lab聯合創始人,曾任OpenAI後訓練負責人,現任研究副總裁,主管強化學習與後訓練方向。這波操作,明顯是要死磕到底。

上個月,聯合創始人、諾貝爾獎得主 Demis Hassabis 辭去 CEO 職務,接任的 Koray Kavukcuoglu 上任後立即表示:提速、提速、再提速。

基準「注水」,還是實力超群?

不過,在讚嘆聲中,谷歌普遍被指提前開香檳,高興得太早。

Google

最不爽的是 Meta——

Meta 的 Muse Spark 1.3 與 Gemini 3.8 Flash 狭路相逢,前者在 Artificial Analysis 的智能指數上獲得 62 分,與 Claude Fable 5 持平,躋身頂尖行列。

而 Muse 的輸入成本比 Fable 5 低 8 倍,輸出成本低近 12 倍,性價比拉滿。

Meta 的首席 AI 官 Alexandr Wang 直接諷刺道:在 Artificial Analysis 智能指數上,Gemini 什麼也不是,只能吃其他模型的汽車尾氣。

Google

Google

Muse Spark 1.3 的得分高於 GPT-5.6 Sol、Grok 4.6 和 Gemini 3.8 Flash,但目前僅限受限預覽。

有人指出,雖然 3.8 Flash 的基準測試圖好看,但實戰起來,就未必了。

的確,Gemini 3.8 Flash 在 Terminal-Bench 2.1、HLE 等測試中超越了 GPT-5.6 Sol 和 Opus 5,但 TBench 2.1 與 TBench 4 之間的巨大分數差距,暴露了這其中可能存在一定的「刷榜」成分。

也就是說,當面對陌生的、尚未被包含在訓練集中的真實世界 Zero-shot 挑戰時,3.8 Flash 大概率還是不如 Opus 5 這種參數巨獸。

但谷歌的解法極其聰明——勤能補拙。

正如谷歌在官方博客中所言:「這些性能的提升源於核心的設計選擇:3.8 Flash 工作得更努力。」

面對複雜任務時,3.8 Flash 被設計為會執行額外的推理步驟,不斷迭代調用工具。當遇到不懂的問題時,它不會直接放棄,而是透過消耗更多的 Token,在內部進行高速的自我驗證和反思。

即使它透過多次迴圈思考消耗了更多的 Token,由於其基礎單價實在太便宜(0.75 美元/百萬 tokens),算總賬下來,它依然比你直接調用一次 GPT-5.6 要便宜得多!

This strategy directly breaks the single-dimensional competition of "larger parameters = stronger capability" in the past.

它證明了:在一個完美的 Agent 循環中,速度和極低的推理成本,本身就是一種強大的智力。

為什麼發 Flash?「被取消的」Pro 版

Did Google really not send the wrong item this time?

Gemini 3.5 Pro 至今連影子都沒有。下一代的王牌 Gemini 4 預訓練數據倒是挺漂亮,但後訓練階段還未完成。

Google

事實上,谷歌遲遲不發佈 Pro 版本,背後有一段辛酸史。

劈柴曾在今年5月誇下海口,說「下個月」就會推出更強大的 Pro 系列,但一直拖延。

其實,谷歌內部原本有幾個 3.5 Pro 的候選模型,但最終都被無情「殺掉」了——因為它們並沒有比現在的 Flash 系強出足夠多的身位!

同時,大家翹首以盼的下一代旗艦 Gemini 4 雖然在預訓練評估中表現良好,但目前仍卡在最關鍵的後訓練階段。

Overall, everything came together in a serendipitous way to drive the frantic iteration of the Flash series.

2 小時挖出數月才能發現的漏洞:網路安全版屠榜了

這次谷歌,只是讓 3.8 Flash 在常規任務上壓低價格嗎?

Far beyond that.

這次發布會真正的殺器,是它的雙生兄弟——Gemini 3.8 Flash Cyber。

連開發者都在驚呼:「到底是怎樣的安全任務,值得谷歌為 Flash 專門推出一個 Cyber 專屬變體?」

谷歌的答案是:為了對抗未來的 AI 黑客。

在發現漏洞的基準測試 CyberGym 上,3.8 Flash Cyber 取得 86.2% 的分數,直接屠榜,將之前的大型模型遠遠甩在身後。

不仅如此,現實世界中的代碼可不止 C/C++。

在谷歌內部橫跨20種程式語言的複雜程式碼庫綜合測試中,這個模型發現廣泛漏洞的成功率竟然超過了70%。

更驚人的,是它在真實世界的實戰戰績。

Chrome 安全團隊拿它進行測試,發現它生成的正確修復補丁數量,是之前市面上最優且體積大得多的商業模型的 2.6 倍。

Wiz 安全公司測試發現,其在滲透測試中的召回率提高了 7.5–9.7%,而成本降低了 2.3 到 5.2 倍。

最令人驚訝的是,谷歌雲漏洞研究團隊利用它,在短短 2 小時內,就發現了一個關鍵的基礎性漏洞——而以往,人類頂級專家找到這樣的漏洞,通常需要幾個月的時間!

在 CWE-Bench(補丁能力測試)中,3.8 Flash Cyber 的首次通過率達到 47.2%,與最領先的前沿大模型(47.8%)幾乎不相上下,但價格卻只有九牛一毛。

Google

也正因 3.8 Flash Cyber 的網絡攻防破壞力過於驚人,谷歌並未選擇將其完全開源,而是透過全新的 Fairwind 計畫,僅向受信任機構開放。

OpenAI、Anthropic 與 谷歌:大模型三國殺進入分水嶺

透過 Gemini 3.8 Flash 的發布,可以看出當今 AI 三巨頭已經走上了三條截然不同的進化路線。

Anthropic(Claude 系列)專注於「知識的可靠性與穩定性」。

在偏向知識覆蓋和事實準確率的測試(如 AA-Omniscience)中,Claude 依然是降維打擊。

前七名全是 Claude 系,他們現在明顯在強化企業級任務中的不犯錯能力,力求穩定輸出。

OpenAI(GPT 系列)押注的是「深度推理與頓悟」。

在偏向物理、數學推導的 CritPt 測試中,GPT-5.6 Sol 斷崖式領先。

OpenAI 似乎在追求一種純粹的智力湧現,要求模型在沒有人告訴它答案時,能自己像科學家一樣「想」出來。

Google(Gemini 系)打造的是「無限循環的超高速打工人」。

Google 這次給出了第三種答案:也許我一次想不通最難的物理題,但我反應極快、成本極低。

在 Agent 的時代,我可以一秒鐘思考 100 次,寫代碼、運行、報錯、修改,以極低的成本進行暴力迭代,硬生生砸出正確結果。

Agen 在現實中遇到的麻煩,需要反覆試錯、調用工具、動態調整。

而 Gemini 3.8 Flash 簡直就是為這種「長程工作流」量身訂製的。

你可以在 Google Antigravity 中,僅用一個提示詞加上迴圈指令,就讓 3.8 Flash 自動生成一個包含謎題、環境貼圖和 3D 關卡的完整遊戲。

你可以用它一鍵生成帶有街景和導航的 DOS 版谷歌地圖。

顯然,Gemini 3.8 Flash 的易用性和成本,已經突破了某個奇點。

Gemini 3.8 Flash 的到來,彷彿谷歌向全行業宣告:大模型正擺脫「只有巨頭才用得起」的限制,向算力普惠狂奔。

那些原本需要耗費數萬美元、跑上數天數夜的智能體任務,現在只需幾杯咖啡的錢,幾分鐘就能完成。

屬於普通人的超級個體時代,真的來了。

This is the awakening moment for small models.

參考資料:

https://x.com/alexandr_wang/status/2095266112212754659?s=20

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

編輯:Aeneas 大衛

本文來自微信公眾號「新智元」,作者:ASI啟示錄

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露