Claude 5.1が剛登場した一方で、OpenAI Astraが直ちに登場する。
今や、グーグルさえ新たな動きを見せています。最新のリークによると、Gemini 3.8 Flashが明日登場します。


AI業界もまた「お正月」になりそうだ。
Gemini 3.5 Proを終了し、次期大規模バージョン4.0をリリース
Gemini 3.8 Flashのリリースよりも、多くの人が気になっているのは:Gemini 3.5 Proは一体いつ来るのか?!
ごめんなさい、待つ必要はありません。グーグルは放棄しました......

今年5月のI/Oカンファレンスの予告以来、ほぼ4ヶ月が経過しましたが、Gemini 3.5 Proの進化はFlashにも及んでいません。
グーグルもやむを得ず、直接「棄権」した。
幸いにも、Gemini 4.0は事前学習で優れた評価を受け、後続の学習も順調に進んでいます。


WSJの独占報道では、Gemini 3.8 Flash(コードネーム「Skimaki」)の優れたプログラミング能力が大幅に予告されています。
Google内部のコーディングツールJetskiによる比較テストでは、3.8 FlashがOpusモデルを圧倒したとされている。
また、このモデルは数ヶ月にわたり開発されており、グーグルの経営陣の「大地震」以前から始まっていました。
ハサビスが退任し、チーフサイエンティストのジェフ・ディーンが退職したことで、多くの人がジェミニの将来を心配している。

しかし、現在のところ、すべては内部で順調に進行しています。
現在、GoogleがGemini 3.8 Flashを先にリリースする計画であるのは、このモデルがパラメータ数が少なく、必要な計算リソースが少なく、成果を出しやすいからです。
内部情報によると、今年の初めから、GoogleはGeminiのコード作成能力を向上させるために、より多くの人材と計算リソースを投入してきた。
特に、「強化学習」への投資を強化し、AIが試行錯誤を繰り返すことによって新しいスキルを真正に習得できるようにしました。
また、グーグルDeepMindや他の研究所は複数のプロジェクトを同時に推進しており、一つがうまくいかなくても、別のプロジェクトがそれを補うことができます。
Gemini 3.5 Proは期待に応えられなかったが、Gemini 4.0はまだ登場していない。
現在、シリコンバレーの「二大巨頭」であるOpenAIとAnthropicは、最先端のモデルやプログラミングエージェントにおいて非常に優れています。
情報によると、OpenAIの次世代Astraは、「循環厚さ」(recurrent depth)という新しい推論手法を採用しており、思考トークンを削減しながら性能を大幅に向上させています。
この切り札は、今週中に明らかになります。

そして今、グーグルは何かを提示しなければならない。
結局、劈柴が約束してから数ヶ月経過したが、AI業界を興奮させるようなモデルは、3.7 Flashをリリースした以外、一切発表されていない。
おそらく今夜、Gemini 3.8 Flashが登場します。

Geminiが初めて、自分で動画を見るようになりました
この発表の前に、グーグルは今日、Geminiに新しい機能を搭載するための予熱を実施しました——
エージェントによる動画理解(Agentic Video Understanding)
この機能は本当に素晴らしいです。
I/O大会の動画をアップロード。同じモデルGemini 3.7 Flashで、トークン消費量が直接88%減少。

Googleの公式ブログでは、Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3つのモデルがエージェント型動画理解機能を搭載しており、アクセスはGoogle AI StudioおよびGemini Enterprise Agent Platformから可能であると述べています。
標準的なビデオ分析ベンチマークでこのスイッチを有効にすると、トークン消費量は最大88%削減され、分析コストは最大66%削減され、精度は最大7%向上します。

さらに追加料金は一切かかりません。標準APIのトークン価格が適用されます。コスト削減と精度の向上は通常対立しますが、今回は両立しました。

なぜなら、Geminiが「進捗バーをドラッグ」を学んだからです。
過去の処理方法は「静的」処理と呼ばれ、モデルは固定フレームレートの映像ストリームを受動的に受け取るだけで、フレームレートはAPIパラメータで固定され、モデルには発言権がありません。
今やモデル自身が判断し、どの部分を、どの速さで、映像を見るか、音声を聞くか、または直接転写テキストを読むかを自由に決めることができます。

これはグーグルが初めてこのようなことをするわけではない。
以前のagentic visionは、コード実行とGeminiのネイティブな画像理解を組み合わせ、モデルが画像を見て自らコードを書いて拡大・切り抜き・比較を行った。
今回は動画の番で、アイデアは同じですが、ツールをネイティブな動画ツールに変更しました。
以前はとても大変な仕事でした
公式ブログには、いくつかの高難度のアプリケーションシナリオも掲載されています。
亜秒単位の映像検索。従来のモデルは動画を「見る」際に、1秒あたり1フレームしか抽出しなかった。問題は、多くの情報が1秒未満で流れてしまうことだ。
今では、これらの瞬間を1秒未満の精度で特定できます。
これにより、「自動カット」が初めて実用可能となった:以前は編集者がタイムラインに張り付き、1フレームずつ切り替える場所を手動で探す必要があったが、今ではモデルがまずスキャンして候補のカットポイントをマークし、その後人が選ぶことができる。

長編動画の中で針を探す。数時間の素材の中で複雑な質問に答え、何百万ものトークンを無駄に消費することなく。
異常検出。モデルがある時間窓を特定した後、その区間のフレームレートを上げて再サンプリングすることで、高速な動きや微細な映像の不具合を明確に確認できます。生産ラインの品質検査やセキュリティ監視では特に有効です。異常は通常、その数秒間にしか発生しないからです。
数えてみよう。一つの動作が何回繰り返されたか、画面にいくつの異なる物体が存在するかといった質問に対して、モデルは過去安定して間違えてきた。その理由はとても単純で、サンプリングされなかった数フレームにちょうど物が存在していたからだ。

エージェントがやっと動画を見始めた
動画は、すべてのモダリティの中で常に最も高価なものでした。
文字は便利だが、画像はまあまあ、動画はサイズが大きく、長く、1分で本1冊分のトークンを消費してしまう。
したがって、この2年間、誰もがエージェントについて話すとき、主にそれが読んだり書いたり、ツールを呼び出したりすることについて語っていました。
問題は、主に文字を通じて世界を理解するエージェントが見ているのは、誰かに「転述」された世界にすぎないということである。
撮影されたカメラ映像、会議の録音、生産ラインを通過するものなど、誰も文字に変換する時間を割きたくないものは、すべて知らない。
今、このコスト曲線が大幅に削減されました。
数時間の監視、数十時間の講義、数百本の素材を自力で翻訳でき、予算を大幅に使い切ることなく済むなら、そのエージェントが世界と接する方法は変わってしまう。
それは、誰かが画面を言葉に置き換えて与えるのを待つ必要もなく、「見られる」か「正確に見られる」かのどちらかを選ぶ必要もなくなった。
グーグルが、この打破者となった。
AI戦争、次ラウンド
この数日間、4社の発表スケジュールがほぼ重なった。
Claude 5.1が剛来、OpenAI Astraはすでに玄関に到着し、Googleは数ヶ月間我慢してやっとGemini 3.8 Flashを出して対戦した。
この更新後、Claudeは現在、プログラミングと科学研究の2つの分野に注力しています。
次世代のAstraは「継続的エージェント」になり、ウルトラマンの言葉を借りれば、そのコンピュータ使用能力は人間レベルに達した。

Gemini 3.8 Flashは、プログラミングにおいてもさらに大きな飛躍を遂げます。
現在、OpenAI、Anthropic、Google、そしてSpaceXAIが同時にフル稼働しています。

マスク氏、Grok 4.7を10日後に発表すると予告
この混戦は、いまだ最も激しい段階に入ったばかりだ。
参考資料:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
本文は微信公衆アカウント「新智元」より、著者:ASI启示録
