Google 剛剛在一個已經飛速發展的市場中推出了兩款新的 AI 模型。Gemini 3.6 Flash 和 3.5 Flash-Lite 已於 2026 年 7 月 21 日透過 Gemini API、Google AI Studio 及相關平台上線,為開發者提供了另一個重新考慮其 AI 技術棧的理由。
Gemini 3.6 Flash 提供了與前代產品相似的智能,但速度顯著提升且成本更低。關鍵數據顯示,在某些基準測試中,其輸出令牌數量比 3.5 Flash 模型減少 17%。用英文來說,該模型能在完成相同任務的同時消耗更少的計算資源,這直接轉化為開發者更低的 API 費用。
3.5 Flash-Lite 模型採用不同的方法,專為純粹的吞吐量設計,每秒可輸出高達 350 個 token,使其成為整個 3.5 系列中最快的模型。代價是價格:在某些配置下,Flash-Lite 的成本高於基礎 Flash 模型,主要針對速度而非成本為瓶頸的代理型和高頻使用情境。
關於定價背景,截至 2026 年 5 月 19 日,3.5 Flash 模型的輸入代幣費用為每百萬代幣 $1.50,輸出代幣費用為每百萬代幣 $9。在某些情境下,Flash-Lite 版本的期權費更高,使其定位為專用工具,而非通用替代方案。
代幣使用量減少 17% 不只是一個基準簡報上的漂亮數字。對於每天需要處理數百萬次 API 調用來驅動自主交易代理或實時風險監控系統的加密貨幣項目來說,這意味著營運成本的顯著降低。
Flash-Lite 上每秒 350 個 token 的吞吐量對於代理式 AI 應用場景尤為重要。這些是能夠自主執行連續操作的系統,例如監控流動性池、分析市場狀況並執行交易。在這裡,速度至關重要。能夠更快思考的模型就能更快行動,而在加密貨幣市場中,更快行動往往意味著盈利與被搶跑之間的差異。
Google 對 Flash 等級的策略似乎旨在捕捉市場中高成交量、對成本敏感的用戶群體。3.6 Flash 面向追求最佳性價比的開發者,而 3.5 Flash-Lite 則針對需要純粹速度且願意為此付費的用戶。兩者共同覆蓋了廣泛的使用情境,同時不會侵蝕 Google 更強大(且更昂貴)的模型產品線。
