作者:Google DeepMind
編譯:深潮 TechFlow
深潮導讀:Google 這次發布的三款模型核心都在解決 AI Agent 商業化的真实痛點——成本和速度。3.6 Flash 比上代省 17% token、價格更低但質量更好;3.5 Flash-Lite 速度達到 350 token/秒,是目前最快的 3.5 系列模型;而專門的網路安全模型 Flash Cyber 則瞄準了代碼漏洞修復這個剛需市場。這不是性能跑分遊戲,是在為大規模部署 AI Agent 鋪路。
Google DeepMind 今日發布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。這些模型專為大規模構建 AI Agent 所需的效率、延遲和可靠性而設計。
Gemini 3.6 Flash:更高效、更優質
3.6 Flash 基於開發者對 3.5 Flash 的反饋進行了改進。它不僅在編碼和知識工作方面更進一步,還顯著提升了 token 效率。根據 Artificial Analysis 指數,3.6 Flash 比 3.5 Flash 減少 17% 的輸出 token 消耗。在某些基準測試中,如 Datacurve 的 DeepSWE,減少幅度高達 65%。完成多步驟工作流程所需的推理步驟和工具調用也更少。
這種效率提升還伴隨著更低的價格。定價為每百萬輸入 token 1.5 美元、每百萬輸出 token 7.5 美元,3.6 Flash 降低了每個 Agent 任務的總成本,讓建構和運行 Agent 更經濟。
即使更高效,3.6 Flash 在各類用例中的性能也優於 3.5 Flash:
代碼編輯更精準,減少了不必要的修改和執行迴圈,在 DeepSWE 上達到 49%(3.5 Flash 為 37%),在機器學習研究基準 MLE Bench 上顯著提升至 63.9%(3.5 Flash 為 49.7%)
電腦操作能力提升,OSWorld-Verified 得分為 83.0%(3.5 Flash 為 78.4%)。電腦操作現已透過 Gemini API 和 Gemini Enterprise 作為內建客戶端工具提供。
知識工作表現更佳,例如 GDPval-AA v2 基準得分為 1421(3.5 Flash 為 1349)。Hebbia 和 Harvey 等客戶發現,它在文件解析、圖表與數據分析、報告撰寫等多模態任務上尤其出色。
客戶反饋 3.6 Flash 在成本和質量上均有進步,在複雜工作流程和知識型任務中平衡了 token 效率、準確性和速度。
安全設計
3.6 Flash 配備了增強的前沿安全防護措施,涵蓋化學、生物、放射和核(CBRN)以及網絡攻擊濫用領域。這些防護使模型對越獄攻擊的抵抗力大幅提升。同時,模型經過訓練,盡量減少對有益用途的拒絕。
Gemini 3.5 Flash-Lite:為 Agent 工作流規模化而生
3.5 Flash-Lite 專為低延遲任務和需要高吞吐量的開發場景設計,如 Agent 搜索和文檔處理。
3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根據 Artificial Analysis 的測量,運行速度可達每秒 350 個輸出 token。定價為每百萬輸入 token 0.3 美元、每百萬輸出 token 2.5 美元,且品質大幅優於 3.1 Flash-Lite,為運行高流量生產任務的開發者和客戶提供了出色的性價比。
3.5 Flash-Lite 支援 Agent 系統的高效擴展。在各個思考層級上,該模型顯著優於 3.1 Flash-Lite。開發者可根據工作負載配置模型:對大批量任務使用最小和低思考層級,以優先考慮低延遲、低成本執行;或啟用更高思考層級來處理多步驟子 Agent 工作負載。該模型現在也將電腦操作作為內建工具,可靠支援跨介面的 Agent 任務。
它在編碼和 Agent 任務上有顯著提升,例如 Terminal-Bench 2.1 得分 54%(3.1 Flash-Lite 為 31%),長上下文如 GDM-MRCR v2 得分 72.2%(3.1 Flash-Lite 為 60.1%),實際任務執行如 GDPval-AA v2 得分 1140(3.1 Flash-Lite 為 642)。
實際上,在許多 Agent 和編碼評測中,3.5 Flash-Lite 甚至超越了 3 Flash,包括 SWE-Bench Pro(54.2% vs 49.6%)和 OSWorld-Verified(74.0% vs 65.1%),成為 2.5 和 3 Flash 工作負載更快更強的選擇。
早期客戶強調 3.5 Flash-Lite 在擴展 Agent 工作流程和數據處理任務方面,具備速度、智能和成本效率的獨特組合。
Gemini 3.5 Flash Cyber in CodeMender:高效發現並修復漏洞
AI 模型發現安全漏洞的速度已超過當前系統修復它們的速度。應對這一日益嚴重的威脅,需要一種既高效又強大的軟體安全方法。
Flash 的性能和效率使其成為大規模檢測、驗證和修補代碼安全問題的理想基礎。Gemini 3.5 Flash Cyber 基於 3.5 Flash 構建,經過微調專門用於發現和修復網絡安全漏洞,且每 token 價格低於大型模型。
在 CodeMender 中,多個 3.5 Flash Cyber Agent 協同工作,生成單一綜合報告,在流行基準 CyberGym 上達到前沿競爭水平。
由於這項技術具有雙重用途的特性,我們採取了謹慎的部署方式。該模型將很快透過 CodeMender 以限制訪問的試點項目形式,專門提供給政府和可信夥伴。這將讓一線防禦者在關鍵漏洞被利用前率先發現並修復,同時減緩更廣泛的濫用風險。
立即開始使用
3.6 Flash 和 3.5 Flash-Lite 從今天起可用:
開發者可透過 Google AI Studio 和 Android Studio 的 Gemini API 使用。3.6 Flash 亦可在 Google Antigravity 中使用
企業可在 Gemini Enterprise Agent 平台上使用。3.6 Flash 亦可在 Gemini Enterprise 應用中使用
Everyone can access via the Gemini app. 3.5 Flash-Lite is also being rolled out on Google Search.
歡迎提供反饋以改進未來的 Gemini 模型,我們期待很快發布 3.5 Pro。
