Claude 5.1 剛問世,另一邊 OpenAI Astra 馬上殺到。
現在,就連谷歌也有了新動作。最新爆料,Gemini 3.8 Flash 將於明日登場。


看來,AI 圈又要「過年了」。
Gemini 3.5 Pro 已取消,下一個大版本為 4.0
與 Gemini 3.8 Flash 的發布相比,更多人更好奇:Gemini 3.5 Pro 到底什麼時候來啊?!
對不起,不用等了,谷歌已放棄......

自今年5月I/O大會預告以來,已過去近4個月,Gemini 3.5 Pro的進化程度連Flash都比不上。
Google 也是迫不得已,直接「棄子」。
Good thing that Gemini 4.0 performed excellently in pre-training, and post-training is still progressing smoothly.


這篇來自 WSJ 的獨家爆料,還重磅預告了 Gemini 3.8 Flash(代號「Skimaki」)強大的編程實力。
據稱,在谷歌內部編碼工具 Jetski 的對比測試中,3.8 Flash 直接碾壓 Opus 模型。
而且,這款模型已研發數月,早在谷歌領導層「大地震」之前就已開始。
Hassabis 辭職,首席科學家 Jeff Dean 離職,令許多人對 Gemini 的未來感到擔憂。

不過,目前看來,一切都在內部有條不紊地進行中。
目前,谷歌計劃先推出 Gemini 3.8 Flash,是因為這款模型參數小,所需計算少,更容易出成果。
據內部人士透露,自今年初以來,谷歌已投入更多人力與算力,專門用於提升 Gemini 的程式碼撰寫能力。
In particular, increased investment in "reinforcement learning" enables AI to truly learn new skills through continuous trial and error.
而且谷歌 DeepMind 和其他實驗室同時推進多個項目,這樣一來即便是這個不行,另一個還能頂上。
Gemini 3.5 Pro 未達預期,但 Gemini 4.0 還未「出爐」。
如今,硅谷「御三家」OpenAI 和 Anthropic 已在前沿模型和程式設計 Agent 上表現非常出色。
Information 称,OpenAI 下一代 Astra 還採用了一種「循環深度」(recurrent depth)新型推理方法,讓思考 token 減少的同時,還大幅提升了性能。
This wild card will be revealed this week.

而此時此刻,谷歌總得交出點東西才行。
畢竟劈柴承諾之後的幾個月裡,除了發布一款 3.7 Flash 外,再沒有推出任何讓 AI 圈興奮的模型。
或許就在今晚,Gemini 3.8 Flash 要登場了。

Gemini 首次能自己看影片了
在發布之前,谷歌今天先來了一波預熱,為 Gemini 植入了一項新能力——
智能體視頻理解(Agentic Video Understanding)
This feature is a total game-changer.
上傳一段 I/O 大會影片,同一款模型 Gemini 3.7 Flash,Token 消耗直接下降 88%。

谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 三個模型都能使用 agentic 視頻理解能力,入口位於 Google AI Studio 和 Gemini Enterprise Agent Platform。
在標準視頻分析基準上開啟此開關,token 消耗最多降低 88%,分析成本最多降低 66%,準確率反而最高提升 7%。

而且不額外收取任何費用,仍沿用標準 API 的 token 定價。省錢和變準通常會衝突,但這次沒有發生。

因為 Gemini 學會了「拖進度條」。
過去的處理方式稱為「靜態」處理,模型被動接收固定幀率的畫面流,幀率由 API 參數固定,模型沒有話語權。
現在模型可以自行決定要看哪一段、以多快的速度觀看,是觀看畫面、聽音頻,還是直接閱讀轉錄文字。

這不是谷歌第一次這樣做了。
先前的 agentic vision 將代碼執行與 Gemini 原生的圖像理解結合在一起,模型能夠針對一張圖片自行編寫代碼以進行放大、裁剪和比對。
這次輪到影片了,思路不變,只是把工具換成了原生影片工具。
四件以前很難做的工作
官方博客中還列出了幾種高難度的應用場景。
亞秒級片段檢索。以往模型「看」視頻時,每秒只截取一幀圖像。問題是,很多內容在不到一秒內就閃過了。
現在可以精確到不到一秒來定位這些瞬間了。
這意味著「自動剪輯」這件事首次真正變得可行:過去剪輯師必須親自趴在時間軸上,一幀一幀地尋找下刀點,現在可以先讓模型掃描一遍,標出候選的切點,再由人工挑選。

在長影片中尋找針。在數小時的素材中提問複雜問題,無需耗盡數百萬個 token。
異常檢測。模型鎖定某個時間窗口後,可專門對這段提高幀率重新採樣,以清晰捕捉快速運動和細微畫面瑕疵。生產線檢測和安防監控最需要這項功能,因為異常本就只發生在那幾秒內。
數數。一個動作重複了多少次,畫面裡有幾個不同的物體,之類的問題,模型過去錯得很穩定,原因也很樸素,漏採的那幾幀裡正好有東西。

Agent 終於願意看影片了
視頻,一直是所有模態中最昂貴的那個。
文字便宜,圖片還行,影片又大又長,一分鐘就能頂掉一本書的 token。
所以這兩年,所有人談論 Agent 時,更多還是談它會讀、會寫、會調用工具。
問題是,一個主要靠文字理解世界的 Agent,看到的其實只是一個被人「轉述」過的世界。
攝像頭拍到的、會議錄下的、生產線上經過的,那些沒人願意花時間轉成文字的東西,它全都不知道。
現在,這條成本曲線被大幅削減。
如果一個 Agent 能自行完成數小時的監控、數十小時的課程和上百條素材的處理, yet 不至於耗盡預算,那麼它與世界互動的方式就已經改變了。
它不再需要等人將畫面轉述成文字喂給它,也不再需要在「看得起」和「看得準」之間做選擇。
Google 就先做了這個破局者。
AI 大戰,下一回合
這幾天,四家的發佈節奏幾乎撞在了一起。
Claude 5.1 剛到,OpenAI Astra 已在門口,谷歌憋了幾個月也終於推出 Gemini 3.8 Flash 迎戰。
此輪更新後,Claude 目前專注於兩個領域:程式設計 + 科研。
下一代 Astra 將變成一個「持續智能體」,用奧特曼的話來說,其電腦使用能力已達人類水平。

Gemini 3.8 Flash 也將在編程方面,有更大的躍升。
現在,OpenAI、Anthropic、谷歌,以及 SpaceXAI 已經同時開足馬力。

馬斯克預告 Grok 4.7 十天後發布
This brawl has just entered its most intense phase.
參考資料:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
本文來自微信公眾號「新智元」,作者:ASI啟示錄
