さっき、Googleが戻ってきました!
本夜、Googleは正式にGemini 3.8 Flashおよびサイバーセキュリティ専用のGemini 3.8 Flash Cyberをリリースしました。
これは、グーグルがわずか6週間のうちに発表した3つ目のFlashバージョンです。
前回の2回の更新は、あくまでウォームアップにすぎなかった。今回、グーグルは直接、コスパを最前線に押し出したのだ——
単一タスクのコストは0.58ドル!入力はたったの0.75ドル/百万トークン!
この「白菜価格」の小さなモデルが、複数の主要ベンチマークテストで、世界最強のフラッグシップモデルであるOpus 5、GPT-5.6 Sol、Grok 4.6のレベルにまで達した。
グーグルDeepMindのエキスパート、姚順宇は次のように評価した:モデルにとって、これはわずかな一歩にすぎないが、RSIにとっては大きな飛躍である。

X上で、開発者たちは大騒ぎになっています。
実際のテスト後、誰かがこう疑問を投げかけた:「まさか、グーグルが商品を間違えて届けたのか?これはずっとリリースされていなかったGemini 3.5 Proじゃないのか?Flashの価格でProの機能を果たしている!」


DeepMindのチームでは、7月からほとんど眠っていない人がいるかもしれない。
皆がFable 5.1を消化しきっていないうちに、グーグルは再びテーブルをひっくり返した。
Googleの「卷王」が帰還:コスパの王
長く沈黙していたグーグルが、極めて激しい競争を通じて世界に宣言した:大魔王が戻ってきた。

Gemini 3.8 Flashがもたらす衝撃を理解するには、まず現在のAI市場の状況を確認する必要があります。
元々、Artificial Analysisのテストでは、非常に厳格な壁が築かれていました。トップレベルの知性(Intelligence Indexが約60点)を得るには、高額なTokenコストが必要です。
その結果、Gemini 3.8 Flashはまるで暗殺者のようで、まったくルールを無視している。
Artificial Analysisのハイリーズニングモードで、Gemini 3.8 Flashの知能指数が59点に急上昇!

これはどのような概念ですか?これは最上位のGPT-5.6 SolやGrok 4.6と僅か一歩之差であり、一部の指標ではClaude Opus 5を上回っています!
しかし、これを実現するためのコストは?単一タスクのコストはわずか0.58ドルです。
具体的には、入力コストは0.75ドル/百万トークン、出力コストは3.75ドル/百万トークンです。
グーグルは図を作成しました:知性とコストのパレートフロンティア上で、Gemini 3.8 Flashを表す青い点は、ソフトウェア工学ベンチマークDeepSWEの右上に位置し、2位を大きく引き離しています。

Gemini 3.8 Flashは知能が高く、さらに驚異的に高速です。生成速度は驚異の305トークン/秒に達し、次世代のモデルはようやく154トークン/秒に到達するのみです。
もっと速く、もっと賢く、しかも無料のように安い。これが人々が日常的に使える本当のモデルだ。

特に長周期ソフトウェア工学ベンチマーク(DeepSWE v1.1)では、3.8 Flashが73.7%という驚異的な成績を記録しました。
この、AIが複雑なエンジニアリング問題を自ら解決し、エンドツーエンドでコードを書くテストにおいて、それは多くの高価な最先端大規模モデルを上回り、そのコストはそれらのほんの一部に過ぎない。
ご注意ください、これは「Flash」版であり、「Pro」でも「Ultra」でもありません。
今回は、Googleが再び小さなモデルにフラッグシップモデルの飯碗を奪われた。
誰かがGemini 3.8 FlashとOpus 5に同じタスクを実行させました。

このプログラミング能力の大幅な向上は偶然ではない。

このプログラミング能力の大幅な向上は偶然ではない。
報告によると、Google内部のコードツールJetskiのテストにおいて、GoogleのエンジニアたちはAnthropicのOpusモデルよりもむしろ3.8 Flashを好んでいる。

その背後には、年初からGoogleが強化学習に多大なリソースを投入しているという事実があります。つまり、モデルが試行錯誤を通じて実際に仕事を学ぶことができる、モデル訓練の「後期調整」段階です。
Google DeepMindは、プログラミングモデルの能力向上に専念するコードタスクフォースを設立し、このチームはDeepMindのCTOが率い、共同創設者のセルゲイ・ブリンが直接監督している。
彼らの目標は、再帰的な自己進化を引き出し、プログラミングモデルを強制的に自動化されたAI研究者に変革し、研究開発の全サイクルを完全に連携させることである。

内部メモでは、グーグルは直接言いました:
最後のスプリントを勝ち抜くために、エージェント実行のギャップを緊急に埋め、私たちのモデルを主力開発者にしなければなりません。

また、グーグルはThinking Machines Labの共同創設者で、かつてOpenAIのポストトレーニング責任者を務めたBarret Zophを招き入れ、研究副社長として強化学習とポストトレーニングの分野を統括させた。この動きは、徹底的に戦い抜く意図を明確に示している。
先月、共同創業者でノーベル賞受賞者のデミス・ハサビスがCEOを退任し、後任のコライ・カブクチュオグルは早速「スピードアップ、スピードアップ、さらにスピードアップ」と宣言した。
基準は「水増し」か、それとも実力が圧倒的か?
しかし、称賛の声の中、グーグルは早々にシャンパンを開け、喜びすぎていると広く指摘されている。

最も不満なのはMeta——
MetaのMuse Spark 1.3とGemini 3.8 Flashが対決し、前者はArtificial Analysisのインテリジェンススコアで62点を獲得し、Claude Fable 5と並んでトップクラスにランクインした。
また、Museの入力コストはFable 5より8倍低く、出力コストは約12倍低いです。コストパフォーマンスが最高です。
メタの最高AI責任者であるアレクサンドル・ワンは直接的に皮肉を込めて述べた:Artificial Analysisインテリジェントインデックスにおいて、Geminiは何の価値も持たず、他のモデルの排気ガスを吸うしかない。


Muse Spark 1.3はGPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flashを上回るスコアを記録していますが、現在は制限付きプレビュー段階です。
誰かが指摘したところによると、3.8 Flashのベンチマーク図は見栄えが良いが、実際の運用ではそうとは限らないという。
確かに、Gemini 3.8 FlashはTerminal-Bench 2.1やHLEなどのテストでGPT-5.6 SolやOpus 5を上回りましたが、TBench 2.1とTBench 4の間の大きなスコア差は、この結果に「ランキング操作」の要素が含まれている可能性を示しています。
つまり、トレーニングセットに含まれていない未知のリアルワールドのゼロショット課題に直面した場合、3.8 Flashは依然としてOpus 5のような大規模パラメータモデルに劣る可能性が高い。
しかし、グーグルの解決策は非常に賢明です——努力は才能を補う。
Googleの公式ブログで述べられているように、「これらのパフォーマンスの向上は、核心的な設計選択によるものです:3.8 Flashはより一生懸命に動作します。」
複雑なタスクに直面した際、3.8 Flashは追加の推論ステップを実行し、ツールを繰り返し呼び出すように設計されています。わからない問題に遭遇しても、そのまま放棄するのではなく、より多くのトークンを消費して内部で高速な自己検証と反省を行います。
複数のループ思考によりより多くのトークンを消費しても、その基本単価が非常に安価(100万トークンあたり0.75ドル)であるため、全体のコストを計算すると、GPT-5.6を直接呼び出すよりもはるかに安くなります!
この戦略は、過去の「大パラメータ=強力な能力」という単一の次元での競争を直接打破しました。
それは、完璧なエージェントループにおいて、速度と極めて低い推論コスト自体が強力な知性であることを示している。
なぜFlashを発行するのか?「廃止された」Pro版
今回は、グーグルが本当に間違った商品を発送しなかったのでしょうか?
Gemini 3.5 Proはまだ影も形もない。次世代の主力モデルであるGemini 4は事前学習データは非常に優れているが、後学習段階はまだ完了していない。

実際、グーグルがPro版を迟迟とリリースしない背后には、辛い歴史があります。
劈柴曾在今年5月夸口说「下个月」将推出更强大的Pro系列,但一直拖延未兑现。
実は、グーグル内部には当初いくつかの3.5 Proの候補モデルがありましたが、最終的にすべて却下されました——なぜなら、それらは現在のFlashシリーズよりも十分な差をつけることができなかったからです!
同時に、皆が待ち望んでいた次世代フラッグシップモデルGemini 4は、事前学習評価では良好な成績を収めていますが、現在最も重要な後学習段階で停滞しています。
結局、すべてが偶然の積み重ねによってFlashシリーズの激しい進化を生み出した。
2時間で数か月かかっても見つからなかった脆弱性を発見:ネットセキュリティ分野で話題沸騰
今回のGoogleは、3.8 Flashを通常のタスクで価格競争に巻き込んだだけなのか?
それだけではありません。
今回の発表の真の杀手は、その双子の兄弟であるGemini 3.8 Flash Cyberである。
開発者さえも驚きの声を上げている:「どのようなセキュリティタスクが、グーグルにフラッシュ専用のCyberバリアントを提供させるほど価値があるのか?」
Googleの答えは、将来のAIハッカーに対抗するためです。
ベンチマークプラットフォーム CyberGym で脆弱性を発見したところ、3.8 Flash Cyber は 86.2% のスコアを記録し、圧倒的な成績でトップに立ち、従来の大型モデルを大きく引き離した。
それだけでなく、現実世界のコードはC/C++だけではありません。
グーグル内の20種類のプログラミング言語で構成される複雑なコードベースでの総合テストにおいて、このモデルは広範な脆弱性を70%以上の成功率で発見しました。
さらに驚異的なのは、それが現実世界での実戦成績です。
Chromeのセキュリティチームがテストしたところ、このモデルが生成した正しい修正パッチの数は、これまで市場で最も優れていたがはるかに大きな商用モデルの2.6倍でした。
Wizセキュリティ社のテストによると、ペネトレーションテストにおける再現率が7.5~9.7%向上し、コストは2.3~5.2倍削減されました。
最も驚異的なのは、Google Cloudの脆弱性研究チームがこれを用いて、わずか2時間で重要な基盤的な脆弱性を発見したことです。従来、人間のトップエキスパートがこのような脆弱性を発見するには通常数ヶ月かかりました!
CWE-Bench(パッチ適用能力テスト)において、3.8 Flash Cyberの初回通過率は47.2%に達し、最前線の最先端大規模モデル(47.8%)とほぼ並ぶ水準ですが、価格はそのわずか一部です。

3.8 Flash Cyberのネットワーク攻防の破壊力が非常に顕著であるため、グーグルはこれを完全にオープンソース化せず、新たなFairwind計画を通じて信頼できる機関のみに開放しました。
OpenAI、Anthropic、Google:大規模モデルの三国志が分水嶺に差し掛かる
Gemini 3.8 Flashのリリースを通じて、現在のAI三大企業がそれぞれ異なる進化の道を歩んでいることが示されている。
Anthropic(Claudeシリーズ)は、「知識の信頼性と安定性」にこだわっています。
知識のカバー範囲と事実の正確性を重視するテスト(例:AA-Omniscience)において、Claudeは依然として圧倒的な優位性を示している。
上位7位はすべてClaudeシリーズであり、現在、企業向けタスクにおけるミスを減らし、安定した出力を目指しています。
OpenAI(GPTシリーズ)は、「深層推論と啓発」に賭けている。
物理的・数学的な推導を重視するCritPtテストにおいて、GPT-5.6 Solが圧倒的な差をつけてリードしています。
OpenAIは、モデルが誰にも答えを教えられずとも、科学者のように自ら「考え」出せるような純粋な知的湧出を追求しているようだ。
Google(Geminiシリーズ)は、「無限に繰り返される超高速労働者」を構築している。
グーグルは今回、第三の答えを提示した:最も難しい物理の問題を一度に解けないかもしれないが、私の反応は非常に速く、コストは極めて低い。
エージェントの時代には、1秒で100回考え、コードを書き、実行し、エラーを出し、修正し、極めて低コストで暴力的に反復して、正しい結果を導き出せる。
Agenが現実で直面する問題は、繰り返し試行錯誤し、ツールを呼び出し、動的に調整する必要がある。
そしてGemini 3.8 Flashは、まさにこの「長期ワークフロー」のために設計されています。
Google Antigravityで、1つのプロンプトとループ命令だけで、3.8 Flashがパズル、環境テクスチャ、3Dレベルを含む完全なゲームを自動生成できる。
これを使って、ストリートビューとナビゲーションを備えたDOS版Googleマップをワンクリックで生成できます。
明らかに、Gemini 3.8 Flashの使いやすさとコストは、ある特異点を突破した。
Gemini 3.8 Flashの登場は、Googleが業界全体に宣言するかのように、大規模モデルが「大手企業だけが利用できる」ものから、計算リソースの民主化へと急加速していることを示している。
かつて数万ドルの費用と数日間を要していたエージェントタスクが、今では数杯のコーヒー代で数分以内に完了できます。
一般の人々のスーパーアイビッド時代が、本当にやってきた。
これは小規模モデルの目覚めの瞬間です。
参考資料:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
編集:Aeneas デイビッド
本文は微信公众号「新智元」より、著者:ASI启示録
