Google 於 2026 年 9 月 2 日發布 Gemini 3.8 Flash 及面向可信網絡防禦機構的 Gemini 3.8 Flash Cyber。普通版擁有 100 萬 Token 上下文,主要專注於程式設計、Agent 和專業知識工作;在 Google 公布的測試中,其長週期軟體工程成績達到 73.7%,接近 Claude Opus 5 的 74.0%,金融 Agent、法律 Agent 和部分綜合推理成績則領先受測模型。Cyber 版能自主尋找漏洞並生成修補程式:Google 內部跨 20 種程式語言的測試成功率超過 70%,Chrome 團隊獲得的正確修補程式數量達到大型商業模型的 2.6 倍。當前 API 優惠價為每百萬輸入 Token 0.75 美元、輸出 Token 3.75 美元,但模型會透過更多推理步驟和工具調用換取效能,獨立評測顯示其單任務成本反而比 3.7 Flash 高約 40%。這次發布的關鍵訊號是,過去主要屬於昂貴旗艦模型的 Agent 能力正進入低價、可規模部署的「工作模型」,但能力數據仍以 Google 及合作方測試為主,Cyber 版也不向普通用戶開放。文章作者、來源:DeepMind
每六週更新三次,Google 將 Flash 變為主力模型
Gemini 3.8 Flash 距離 3.7 Flash 發布僅三週,也是 Google 六週內推出的第三個 Flash 版本。
過去,「Flash」通常意味著速度快、成本低,但能力明顯弱於旗艦模型。Gemini 3.8 的定位正在改變:Google 仍將其稱為適合大規模部署的「工作模型」,卻將長週期程式設計、連續工具調用和專業分析作為主要能力,而不再僅讓它承擔聊天、摘要等輕量任務。
新模型支援文本、圖像、音頻、視頻和 PDF 輸入,擁有 100 萬 Token 上下文和 6.4 萬 Token 最大輸出,可調用搜尋、函數及電腦操作工具。它已正式開放,而非測試預覽,可透過 Gemini API、Google AI Studio、Gemini Enterprise、Google Antigravity、Gemini 應用、搜尋 AI Mode 和 Google Sheets 使用。
Google 的託管 Agent Antigravity 也已預設採用 3.8 Flash。這表明該模型真正針對的是需要反覆規劃、調用工具、檢查結果並持續修正的 Agent,而非單次問答。
Programming performance is now approaching that of expensive flagship models.
在 Google 公布的 DeepSWE v1.1 長週期軟體工程測試中,Gemini 3.8 Flash 取得 73.7% 的成績,高於 3.7 Flash 的 65.3% 和 GPT‑5.6 Sol 的 72.7%,與 Claude Opus 5 的 74.0% 相差 0.3 個百分點。
此類測試要求模型進入真實代碼庫,理解多個文件之間的關係,定位問題並完成能通過測試的修改。它比獨立生成一段函數更接近實際編程 Agent 的工作。
在 Vals Finance Agent v2 中,3.8 Flash 取得 61.4%,受測的 3.7 Flash、Claude Opus 5 和 GPT‑5.6 Sol 分別為 59.0%、58.6% 和 53.8%。
在 Harvey 法律 Agent 測試中,3.8 Flash 為 10.0%,高於 3.7 Flash 的 8.8%、Claude Opus 5 的 6.7% 和 GPT‑5.6 Sol 的 2.5%。不過,所有模型在這項評測中的絕對得分都很低,“排名第一”並不等於已經能夠可靠處理複雜法律工作。
在多學科推理測試 HLE-Verified 中,3.8 Flash 取得 54.9%,GPT‑5.6 Sol 與 Claude Opus 5 分別為 54.5% 和 54.4%,三者差距很小,不足以證明某一模型擁有穩定的全面優勢。
這些結果主要由 Google 按照其自身配置公布。模型、Agent 框架、推理強度、工具權限與測試預算都會影響最終成績,因此更合理的結論是:Flash 級模型已接近部分高價旗艦模型,而不是 Gemini 已經在所有任務上全面領先。
“更努力”意味著更聰明,也可能意味著更貴
Google 將 3.8 Flash 能力提升歸結為一個直白的設計選擇:讓模型「更加努力」。
面對複雜任務時,它會採用更多中間推理步驟,反覆調用工具,並主動檢查已完成的工作。開發者可選擇低、中、高三個思考等級,中等為預設設定;高等級適用於困難程式設計和多步驟推理,低等級則適用於即時聊天、草稿生成和延遲敏感的任務。
這能降低 Agent 過早停止、遺漏步驟或在一次工具調用失敗後徹底偏離目標的機率,但也會消耗更多 Token。
在 Artificial Analysis 的獨立測試中,3.8 Flash 在高思考等級的智能指數為 59 分,比 3.7 Flash 提高 3 分,與 GPT‑5.6 Sol 的非最高推理配置處於相近水平。它的平均輸出速度約為每秒 300 Token,完成單項測試平均需要 2.5 分鐘。
但 3.8 Flash 的平均輸出 Token 增加約 30%,Agent 評測中的執行輪次也更多。雖然每 Token 價格沒有上漲,其平均單任務成本約為 0.58 美元,比 3.7 Flash 的 0.40 美元高約 40%。
因此,「低單價」並不等於「每項任務一定更便宜」。如果任務本身不需要複雜推理,讓 3.8 Flash 以高強度運行,可能只會增加時間和費用。Google 也建議採用效率優先的工作流程,降低思考等級,或繼續使用仍受支援的 3.7 Flash。
當前低價僅為限時優惠
截至2026年12月31日,Gemini 3.8 Flash的優惠價格為每百萬輸入Token 0.75美元、輸出Token 3.75美元,與3.7 Flash當前價格相同。
自2027年1月1日起,標準價格將變為每百萬輸入Token 1.50美元、輸出Token 7.50美元,正好翻倍。開發者在評估長期成本時,不能將發佈期價格視為永久定價。
即使按照未來標準價格計算,它仍低於部分旗艦型號;但對於需要生成數萬 Token、運行幾十輪工具調用的 Agent,應比較完整任務成本,而非僅比較價目表上的每百萬 Token 數字。
Cyber 版的目標不是解釋漏洞,而是直接交付補丁
Google 同時發布了 Gemini 3.8 Flash Cyber。它與普通版共享基礎能力,但接受了更集中的網絡安全訓練,並採用較寬鬆的網絡安全限制,使其能夠完成普通模型可能拒絕的漏洞分析工作。
在 CyberGym 漏洞發現基準中,Google 表示其已達到前沿水平。由於 CyberGym 主要專注於 C 和 C++ 專案,公司又設計了一套涵蓋 20 種程式語言、包含複雜真實程式碼庫的內部測試,3.8 Flash Cyber 發現漏洞的成功率超過 70%。
發現漏洞只是第一步。Google 特別強調,Cyber 版的訓練重點是修復問題,而不是生成攻擊利用程式。
在由 Collinear 運行的 CWE-Bench 补丁測試中,3.8 Flash Cyber 的首次提交通過率為 47.2%,對比的領先旗艦模型為 47.8%。兩者成績接近,但 Google 表示 Flash Cyber 的運行成本更低。
這代表網路安全 Agent 的目標正從「告知工程師此處可能有問題」,轉向理解漏洞、編寫修補程式、運行測試並驗證修改。如果結果足夠可靠,它可能縮短安全團隊從發現漏洞到部署修復的時間。
Chrome 獲得 2.6 倍正確補丁,但仍需廠商與合作方測試
Google 已將 Flash Cyber 用於內部代碼安全工作。
Chrome 安全團隊稱,其生成的正確漏洞修補數量是受比較大型商業模型的 2.6 倍。網路安全公司 Wiz 則表示,在自己的滲透測試基準中,Flash Cyber 的漏洞召回率比其他前沿模型高出 7.5 至 9.7 個百分點,成本低 2.3 至 5.2 倍。
Google Cloud 漏洞研究團隊還稱,該模型在不到兩小時內發現了一項關鍵基礎漏洞,而類似研究通常可能持續數月。
這些結果具有現實參考價值,但不能視為獨立、可複現的公共評測。Google 沒有公開該關鍵漏洞的具體內容、對比模型名單和完整運行軌跡;Chrome 數據來自 Google 內部,Wiz 也屬於 Fairwind 合作夥伴。因此,它們證明模型已能參與真實安全工作,卻不能證明它在所有代碼庫和漏洞類型上穩定達到同等效果。
最強的網絡安全能力僅向可信機構開放
Flash Cyber 由 Google 新成立的 Fairwind Program 提供,目前參與者超過 650 家,主要包括政府網路安全機構、關鍵基礎設施運營方、軟體維護者和大型安全企業。
參與機構需限制內部訪問人員範圍,並採用多因素認證等安全措施。模型與 CodeMender Agent 結合後,可在機構自己的雲環境中尋找、驗證和修復漏洞。
普通 Google Cloud 客戶仍可使用 CodeMender 配合公開版 Gemini 模型,但無法直接獲得 Flash Cyber 完整能力。
這種「一個基礎模型、兩個權限等級」的發布方式,與 Anthropic 此前將 Claude 分為 Fable 和 Mythos 的路線十分接近:通用編程和分析能力向市場開放,更容易轉化為攻擊能力的網路安全功能則通過身份審核、訪問控制和持續監測提供。
安全沒有明顯升級,但部分非英語表現出現退步
普通版 3.8 Flash 包含針對化學、生物、放射性、核相關內容及網絡攻擊的安全限制;Cyber 版因需完成專業防禦任務,網絡安全限制較寬鬆,故僅向審核後的機構開放。
Google 模型卡認為,與 3.7 Flash 相比,3.8 Flash 在公司前沿安全框架關注的高風險領域並未出現實質性的新能力,因此未觸發更高風險等級。它在 Gray Swan 間接提示詞注入測試中的防護也有所改善。
不過,模型卡同時披露,3.8 Flash 在自動化多語言安全測試中比 3.7 Flash 退步 5.4 個百分點。Google 人工檢查後稱,多數差異屬於誤報或不嚴重內容,但完整樣本和逐語言數據沒有公布。
模型仍保留大型語言模型的常見問題,包括幻覺、偶發響應緩慢或超時,以及為提升表現而使用過多 Token。知識截止時間標示為 2026 年 3 月,但 Google 說明,部分領域的可靠知識可能仍僅更新至 2025 年 1 月左右;涉及最新資訊時仍需上網核實。
真正的競爭正從「誰最聰明」轉向「誰能被大規模使用」
Gemini 3.8 Flash 最值得關注的地方,不在於某項基準領先了零點幾分,而在於 Google 正將長週期程式設計、專業分析和自主工具調用能力壓入 Flash 價格區間。
旗艦模型適用於高價值、低頻率的複雜任務;而實際運行於企業客服、編程流水線、財務分析和安全掃描中的 Agent,卻可能每天處理數百萬次調用。在這些場景中,速度、單價和單位任務成功率往往比排名第一更重要。
3.8 Flash 也顯示出這條路線的矛盾:模型越善於反覆檢查和持續工作,就越可能生成更多 Token,讓「便宜模型」的單任務成本上升。未來 Agent 競爭的核心因此不僅是誰回答得最好,還包括誰能判斷什麼時候繼續思考、什麼時候調用工具,以及什麼時候應該停止。
