Google 推出三款新的 Gemini 模型,以提升 AI 代理的效率與速度

iconTechFlow
分享
AI summary icon精華摘要
Google 已推出三款新的 Gemini 模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,以提升 AI Agent 的性能。3.6 Flash 模型將 token 使用量減少 17%,並提升編程與知識任務表現。3.5 Flash-Lite 達到每秒 350 個 token,為該系列中最快。3.5 Flash Cyber 專注於識別並解決代碼中的網絡安全問題。這些更新與 AI + 加密貨幣新聞相符,可能影響該領域的新代幣上線。

作者:Google DeepMind

編譯:深潮 TechFlow

深潮導讀:Google 這次發布的三款模型核心都在解決 AI Agent 商業化的真实痛點——成本和速度。3.6 Flash 比上代省 17% token、價格更低但質量更好;3.5 Flash-Lite 速度達到 350 token/秒,是目前最快的 3.5 系列模型;而專門的網路安全模型 Flash Cyber 則瞄準了代碼漏洞修復這個剛需市場。這不是性能跑分遊戲,是在為大規模部署 AI Agent 鋪路。

Google DeepMind 今日發布三款新 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。這些模型專為大規模構建 AI Agent 所需的效率、延遲和可靠性而設計。

Gemini 3.6 Flash:更高效、更優質

3.6 Flash 基於開發者對 3.5 Flash 的反饋進行了改進。它不僅在編碼和知識工作方面更進一步,還顯著提升了 token 效率。根據 Artificial Analysis 指數,3.6 Flash 比 3.5 Flash 減少 17% 的輸出 token 消耗。在某些基準測試中,如 Datacurve 的 DeepSWE,減少幅度高達 65%。完成多步驟工作流程所需的推理步驟和工具調用也更少。

這種效率提升還伴隨著更低的價格。定價為每百萬輸入 token 1.5 美元、每百萬輸出 token 7.5 美元,3.6 Flash 降低了每個 Agent 任務的總成本,讓建構和運行 Agent 更經濟。

即使更高效,3.6 Flash 在各類用例中的性能也優於 3.5 Flash:

代碼編輯更精準,減少了不必要的修改和執行迴圈,在 DeepSWE 上達到 49%(3.5 Flash 為 37%),在機器學習研究基準 MLE Bench 上顯著提升至 63.9%(3.5 Flash 為 49.7%)

電腦操作能力提升,OSWorld-Verified 得分為 83.0%(3.5 Flash 為 78.4%)。電腦操作現已透過 Gemini API 和 Gemini Enterprise 作為內建客戶端工具提供。

知識工作表現更佳,例如 GDPval-AA v2 基準得分為 1421(3.5 Flash 為 1349)。Hebbia 和 Harvey 等客戶發現,它在文件解析、圖表與數據分析、報告撰寫等多模態任務上尤其出色。

客戶反饋 3.6 Flash 在成本和質量上均有進步,在複雜工作流程和知識型任務中平衡了 token 效率、準確性和速度。

安全設計

3.6 Flash 配備了增強的前沿安全防護措施,涵蓋化學、生物、放射和核(CBRN)以及網絡攻擊濫用領域。這些防護使模型對越獄攻擊的抵抗力大幅提升。同時,模型經過訓練,盡量減少對有益用途的拒絕。

Gemini 3.5 Flash-Lite:為 Agent 工作流規模化而生

3.5 Flash-Lite 專為低延遲任務和需要高吞吐量的開發場景設計,如 Agent 搜索和文檔處理。

3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根據 Artificial Analysis 的測量,運行速度可達每秒 350 個輸出 token。定價為每百萬輸入 token 0.3 美元、每百萬輸出 token 2.5 美元,且品質大幅優於 3.1 Flash-Lite,為運行高流量生產任務的開發者和客戶提供了出色的性價比。

3.5 Flash-Lite 支援 Agent 系統的高效擴展。在各個思考層級上,該模型顯著優於 3.1 Flash-Lite。開發者可根據工作負載配置模型:對大批量任務使用最小和低思考層級,以優先考慮低延遲、低成本執行;或啟用更高思考層級來處理多步驟子 Agent 工作負載。該模型現在也將電腦操作作為內建工具,可靠支援跨介面的 Agent 任務。

它在編碼和 Agent 任務上有顯著提升,例如 Terminal-Bench 2.1 得分 54%(3.1 Flash-Lite 為 31%),長上下文如 GDM-MRCR v2 得分 72.2%(3.1 Flash-Lite 為 60.1%),實際任務執行如 GDPval-AA v2 得分 1140(3.1 Flash-Lite 為 642)。

實際上,在許多 Agent 和編碼評測中,3.5 Flash-Lite 甚至超越了 3 Flash,包括 SWE-Bench Pro(54.2% vs 49.6%)和 OSWorld-Verified(74.0% vs 65.1%),成為 2.5 和 3 Flash 工作負載更快更強的選擇。

早期客戶強調 3.5 Flash-Lite 在擴展 Agent 工作流程和數據處理任務方面,具備速度、智能和成本效率的獨特組合。

Gemini 3.5 Flash Cyber in CodeMender:高效發現並修復漏洞

AI 模型發現安全漏洞的速度已超過當前系統修復它們的速度。應對這一日益嚴重的威脅,需要一種既高效又強大的軟體安全方法。

Flash 的性能和效率使其成為大規模檢測、驗證和修補代碼安全問題的理想基礎。Gemini 3.5 Flash Cyber 基於 3.5 Flash 構建,經過微調專門用於發現和修復網絡安全漏洞,且每 token 價格低於大型模型。

在 CodeMender 中,多個 3.5 Flash Cyber Agent 協同工作,生成單一綜合報告,在流行基準 CyberGym 上達到前沿競爭水平。

由於這項技術具有雙重用途的特性,我們採取了謹慎的部署方式。該模型將很快透過 CodeMender 以限制訪問的試點項目形式,專門提供給政府和可信夥伴。這將讓一線防禦者在關鍵漏洞被利用前率先發現並修復,同時減緩更廣泛的濫用風險。

立即開始使用

3.6 Flash 和 3.5 Flash-Lite 從今天起可用:

開發者可透過 Google AI Studio 和 Android Studio 的 Gemini API 使用。3.6 Flash 亦可在 Google Antigravity 中使用

企業可在 Gemini Enterprise Agent 平台上使用。3.6 Flash 亦可在 Gemini Enterprise 應用中使用

Everyone can access via the Gemini app. 3.5 Flash-Lite is also being rolled out on Google Search.

歡迎提供反饋以改進未來的 Gemini 模型,我們期待很快發布 3.5 Pro。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露