Google 於 9 月 2 日發布 Gemini 3.8 Flash 及面向網絡防禦的 3.8 Flash Cyber。距離 3.7 Flash 推出僅三週,這也是六週內第三次更新 Flash 系列。Google 將 3.8 定位為目前最強大的推理與編碼 Flash 模型,普通版本已上線 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise 及部分消費者產品;Cyber 版本則僅透過新的 Fairwind Program 優先開放給可信的政府機構、關鍵基礎設施運營商和軟體維護者。兩者共享基礎智能,但部署權限與安全防護並不相同。
普通 3.8 Flash 的介紹價仍為每百萬輸入 Token 0.75 美元、輸出 3.75 美元,與 3.7 相同。不過此價格僅持續至 2026 年 12 月 31 日;自 2027 年 1 月 1 日起,官方列示的價格將上調至輸入 1.50 美元、輸出 7.50 美元。較易被忽略的是,模型在複雜任務中會執行更多推理步驟並反覆調用工具,Google 明確提醒高努力等級可能消耗更多 Token。單價未上漲,並不等於一項任務的總帳單一定不變。
Flash 開始爭奪長任務,速度之外更看完成率
Google 提供的證據涵蓋長週期編碼、專業分析和多步推理。3.8 Flash 在 DeepSWE v1.1 長週期軟體工程評測中超越大多數更大的前沿模型;在 HLE-Verified 上達到 54.9%。公司還引用金融代理和法律代理基準,說明其試圖將 Flash 從低延遲問答模型轉向能持續規劃、調用工具並交付完整結果的工作模型。硬體拆解可視化、單提示生成 DOS 版地圖和 3D 遊戲等演示,則強調模型不僅輸出程式碼片段,而是能在迴圈中不斷檢查和修改成品。
但基準分數不能直接兌換成企業生產力。長任務的成功率通常受程式碼倉庫規模、依賴環境、測試品質、工具權限和重試預算的影響。當使用 3.8「更勤奮」的策略提高完成率時,也會增加執行時間和 Token 使用量。開發團隊需要記錄單次調用價格、單次任務總 Token 數、工具調用次數、成功前的重試次數和人工返工時間,才能判斷升級是否真的更便宜。對於延遲或預算優先的工作負載,Google 仍建議降低努力等級,或繼續使用 3.7 Flash;舊版本並未因新品發布而立即停止支援。
普通版本已向開發者和企業開放,Google AI Pro 和 Ultra 用戶也可在 Gemini 應用、搜索 AI Mode 和 Gemini in Sheets 中使用。不同入口的功能、配額和地區開放範圍可能不同,因此「模型已發布」不應被理解為所有用戶、所有產品都獲得完全相同的功能。尤其是帶有自治工具的工作流程,上線還取決於應用是否為模型提供相應的工具、權限和可恢復的執行環境。
Cyber 版本更強也更窄,47.2% 不是自動修復承諾
Gemini 3.8 Flash Cyber 專注於漏洞發現與補丁生成。Google 表示,其在涵蓋 20 種程式語言的內部漏洞發現評測中,成功率超過 70%;在外部 CWE-Bench 補丁評測中,pass@1 為 47.2%,接近某領先前沿模型的 47.8%,但成本更低。Chrome 安全團隊的內部使用結果顯示,3.8 Flash Cyber 生成的正確漏洞補丁數量是最佳大型商業模型的 2.6 倍。Wiz 也報告其內部滲透測試基準的召回率提高了 7.5 至 9.7 個百分點,成本降低 2.3 至 5.2 倍。
這些數字具有參考價值,但也存在界限;內部基準的樣本、提示和人工判定方法並未在公告中完整展開;47.2% 的 pass@1 同時意味著一次生成並不能保證過半數問題都被正確修復。Google 將「修復」優先於「利用」,並為普通 3.8 加入化學、生物、放射、核以及網路濫用防護。Cyber 版本為滿足專業防禦需求採用更寬鬆的網路安全限制,因此未全面公開,僅向 Fairwind 計畫中的可信防禦者提供。
這次發布真正改變的是 Flash 系列的取捨:它不再僅靠低價和速度吸引批量請求,而是透過更長的推理迴圈追求複雜任務的完成率。企業若直接將 3.7 替換為 3.8,最容易犯的錯誤是僅比較百萬 Token 的標價。更穩妥的做法是對真實任務進行分層測試:簡單請求限制努力等級,長任務允許更多迴圈,安全任務則保持人工審批與隔離環境。3.8 Flash 已可使用,Cyber 也已進入限製計劃;至於它能否以更低的總成本完成更多生產任務,仍需由各團隊自己的端到端數據來回答。
