Google、Gemini 3.8 Flashをリリースし、主力モデルとのパフォーマンス差を縮小

iconMetaEra
共有
AI summary icon概要
2026年9月2日、Googleは最新のオンチェーンニュースとして、Gemini 3.8 Flashとそのサイバーセキュリティ版であるGemini 3.8 Flash Cyberを発表しました。標準モデルは100万トークンをサポートし、DeepSWE v1.1で73.7%のスコアを記録し、Claude Opus 5にほぼ匹敵します。サイバーバージョンは、20言語で70%以上の成功率で脆弱性を自動検出・パッチ適用します。両モデルは現在、Gemini APIおよびGoogle AI Studioで利用可能であり、新規トークン上場の可能性もあります。
Googleは2026年9月2日、Gemini 3.8 Flashおよび信頼できるネットワーク防御機関向けのGemini 3.8 Flash Cyberをリリースしました。一般版は100万トークンのコンテキストを備え、プログラミング、エージェント、専門知識タスクに特化しています。Googleが公開したテストでは、長期的なソフトウェアエンジニアリングの成績が73.7%に達し、Claude Opus 5の74.0%に近づいており、金融エージェント、法律エージェント、一部の総合的推論では対象モデルを上回りました。Cyber版は脆弱性を自ら発見しパッチを生成できます。Google内部での20種類以上のプログラミング言語を対象としたテストでは成功率が70%を超え、Chromeチームが得た正しいパッチの数は大規模商業モデルの2.6倍に達しました。現在のAPI割引価格は、入力トークン100万あたり0.75ドル、出力トークン100万あたり3.75ドルですが、モデルはより多くの推論ステップとツール呼び出しを通じて性能を向上させるため、独立した評価では単一タスクあたりのコストが3.7 Flashより約40%高くなっています。今回のリリースの重要なシグナルは、かつて高価なフラグシップモデルに限定されていたエージェント機能が、低価格でスケーラブルに展開可能な「作業用モデル」へと移行していることです。ただし、その能力データは依然としてGoogleおよび協力先によるテストに基づいており、Cyber版は一般ユーザーには提供されていません。

文章作者、出典:DeepMind

6週間で3回更新、GoogleがFlashを主力モデルにした

Gemini 3.8 Flashは、3.7 Flashのリリースからわずか3週間後に登場し、Googleが6週間以内にリリースした3つ目のFlashバージョンです。

過去、「Flash」は高速で低コストだが、フラッグシップモデルに比べて能力が明らかに劣るという意味だった。しかし、Gemini 3.8の位置づけは変わりつつある:Googleは依然としてこれを大規模展開向けの「作業モデル」と呼んでいるが、主な能力をチャットや要約などの軽量タスクから、長期間のプログラミング、連続的なツール呼び出し、専門的分析へとシフトさせている。

新しいモデルは、テキスト、画像、音声、動画、PDFの入力をサポートし、100万トークンのコンテキストと6.4万トークンの最大出力に対応しています。検索、関数、およびコンピュータ操作ツールを呼び出すことができます。これはテスト版やプレビューではなく、正式に公開されており、Gemini API、Google AI Studio、Gemini Enterprise、Google Antigravity、Geminiアプリ、検索AIモード、およびGoogle Sheetsから利用できます。

GoogleのホストエージェントAntigravityもデフォルトで3.8 Flashを採用しています。これは、このモデルが単発の質問応答ではなく、反復的な計画、ツールの呼び出し、結果の確認、継続的な修正を必要とするエージェントをターゲットとしていることを示しています。

プログラミングの成績が高価なフラグシップモデルに迫っています

Googleが公開したDeepSWE v1.1の長期ソフトウェアエンジニアリングテストにおいて、Gemini 3.8 Flashは73.7%のスコアを記録し、3.7 Flashの65.3%およびGPT‑5.6 Solの72.7%を上回り、Claude Opus 5の74.0%と0.3ポイント差で並んだ。

この種のテストでは、モデルが実際のコードベースに入り、複数のファイル間の関係を理解し、問題を特定し、テストを通過する修正を完了することが求められます。これは、単独で関数を生成するよりも、実際のプログラミングエージェントの作業に近いものです。

Vals Finance Agent v2において、3.8 Flashは61.4%を獲得し、テストされた3.7 Flash、Claude Opus 5、GPT‑5.6 Solはそれぞれ59.0%、58.6%、53.8%でした。

Harvey法律Agentテストにおいて、3.8 Flashは10.0%と、3.7 Flashの8.8%、Claude Opus 5の6.7%、GPT‑5.6 Solの2.5%を上回りました。ただし、すべてのモデルがこの評価で得点が非常に低く、「最も高い順位」であっても、複雑な法律業務を信頼できるレベルで処理できるとは限りません。

多学際推論テストHLE-Verifiedにおいて、3.8 Flashは54.9%を記録し、GPT‑5.6 SolとClaude Opus 5はそれぞれ54.5%および54.4%を記録した。三者の差は非常に小さく、いずれかのモデルが安定した全般的な優位性を有しているとは言えない。

これらの結果は主にGoogleが自身の設定に基づいて公開したものである。モデル、エージェントフレームワーク、推論強度、ツール権限、テスト予算が最終的な成績に影響を与えるため、より妥当な結論は、Flash級モデルが一部の高価なフラッグシップモデルに近づいているということであり、Geminiがすべてのタスクで全面的にリードしているわけではない。

「より努力する」ことは、より賢くすることを意味し、またより高価になることを意味するかもしれない

Googleは、3.8 Flash能力の向上を、モデルを「より一生懸命にさせる」という明確な設計選択に帰因させている。

複雑なタスクに直面した際、それはより多くの中間推論ステップを採用し、ツールを繰り返し呼び出し、完了した作業を自発的に確認します。開発者は低、中、高の3つの思考レベルから選択でき、中レベルがデフォルト設定です。高レベルは困難なプログラミングや複数ステップの推論に適しており、低レベルはリアルタイムチャット、ドラフト生成、遅延に敏感なタスクに適しています。

これにより、エージェントが早期に停止したり、ステップを省略したり、1回のツール呼び出しに失敗した後に目標から完全に逸脱したりする確率が低下しますが、より多くのトークンを消費します。

Artificial Analysisの独立テストにおいて、3.8 Flashは高思考レベルでの知能スコアが59点で、3.7 Flashより3点向上し、GPT‑5.6 Solの非最上位推論設定とほぼ同等のレベルとなった。平均出力速度は約300トークン/秒で、単一テストを完了する平均時間は2.5分である。

しかし、3.8 Flashの平均出力トークン数は約30%増加し、エージェント評価における実行ラウンドもより多くなりました。1トークンあたりの価格は上昇していませんが、平均タスクコストは3.7 Flashの0.40ドルに対して約40%高い0.58ドルです。

したがって、「低価格」は「各タスクが必ずしも安価である」という意味ではありません。タスク自体が複雑な推論を必要としない場合、3.8 Flashを高強度で動作させると、時間とコストが増加するだけです。Googleは、効率を優先するワークフローで思考レベルを下げること、または引き続きサポートされている3.7 Flashを使用することを推奨しています。

現在の低価格は限定オファーです

2026年12月31日まで、Gemini 3.8 Flashの割引価格は、入力トークン100万あたり0.75ドル、出力トークン100万あたり3.75ドルで、3.7 Flashの現在の価格と同額です。

2027年1月1日から、標準料金は入力トークンあたり100万単位で1.50ドル、出力トークンあたり7.50ドルに変更され、ちょうど2倍になります。開発者が長期コストを評価する際には、リリース期間の料金を永久的な価格と見なしてはなりません。

将来の標準価格で計算しても、それは一部のフラッグシップモデルよりも低価格であるが、数万トークンを生成し、数十回のツール呼び出しを実行するエージェントにとっては、価格表の100万トークンあたりの数字だけでなく、完全なタスクコストを比較すべきである。

Cyber版の目標は脆弱性を説明することではなく、パッチを直接提供することです。

GoogleはGemini 3.8 Flash Cyberを同時にリリースしました。これは一般版と基礎能力を共有していますが、より集中したサイバーセキュリティトレーニングを受けており、一般的なモデルが拒否する可能性のある脆弱性分析タスクを実行できるように、やや緩和されたサイバーセキュリティ制限を採用しています。

CyberGym脆弱性発見ベンチマークにおいて、Googleはその水準が最先端であると評価しました。CyberGymは主にCおよびC++プロジェクトに焦点を当てているため、同社は20種類のプログラミング言語をカバーし、複雑な実際のコードベースを含む内部テストを設計しました。3.8 Flash Cyberの脆弱性発見成功率は70%を超えています。

脆弱性の発見は最初のステップにすぎません。Googleは特に、Cyber版のトレーニングの重点が攻撃の悪用コードを生成することではなく、問題を修正することであると強調しています。

Collinearが運営するCWE-Benchパッチテストにおいて、3.8 Flash Cyberの初回通過率は47.2%であり、比較対象の主要なフラッグシップモデルは47.8%でした。両者の成績は近いですが、GoogleはFlash Cyberの実行コストが低いと述べています。

これは、ネットワークセキュリティエージェントの目標が「エンジニアにここに問題の可能性があることを通知する」から、脆弱性を理解し、パッチを作成し、テストを実行して変更を検証することへと移行していることを意味します。結果が十分に信頼できる場合、セキュリティチームが脆弱性を発見してから修正を展開するまでの時間を短縮できる可能性があります。

Chromeは2.6倍の正しいパッチを獲得しましたが、まだメーカーおよび提携先によるテスト中です。

GoogleはFlash Cyberを内部コードセキュリティ作業に使用しています。

Chromeのセキュリティチームは、同社が生成した正しい脆弱性パッチの数が、より大規模な商用モデルの2.6倍であると述べている。サイバーセキュリティ企業のWizは、自社のペネトレーションテストベンチマークにおいて、Flash Cyberの脆弱性再現率が他の最先端モデルより7.5~9.7ポイント高く、コストは2.3~5.2倍低いと述べている。

Google Cloudの脆弱性研究チームは、このモデルが2時間以内に重要な基盤脆弱性を発見したと述べており、類似の研究は通常数か月かかる可能性がある。

これらの結果は現実的な参考価値を持ちますが、独立した再現可能な公開評価とは見なせません。Googleはその重要な脆弱性の詳細、比較モデルの一覧、および完全な実行トレースを公開しておらず、ChromeのデータはGoogle内部のものであり、WizもFairwindのパートナーです。したがって、これらの結果はモデルが実際のセキュリティ作業に参加できるようになったことを示していますが、すべてのコードベースや脆弱性タイプにおいて同等の効果を安定して達成できることを証明するものではありません。

最強のネットワークセキュリティ機能は信頼できる機関にのみ開放されます。

Flash Cyberは、Googleが新設したFairwind Programを通じて提供されており、現在の参加者は650社以上に上り、主に政府のサイバーセキュリティ機関、重要インフラ運営者、ソフトウェア保守業者、大手セキュリティ企業が含まれています。

参加機関は、内部アクセス権限を制限し、多要素認証などのセキュリティ対策を採用する必要があります。モデルとCodeMender Agentを統合することで、機関の独自のクラウド環境内で脆弱性を検出し、検証し、修正できます。

一般的なGoogle Cloudの顧客は、公開版GeminiモデルとCodeMenderを引き続き使用できますが、Flash Cyberの完全な機能には直接アクセスできません。

この「1つの基礎モデル、2つの権限レベル」のリリース方式は、Anthropicが以前にClaudeをFableとMythosに分けたアプローチと非常に類似しています。汎用的なプログラミングおよび分析機能は市場に開放され、より攻撃的な能力に転用されやすいサイバーセキュリティ機能は、認証、アクセス制御、継続的な監視によって提供されます。

セキュリティに明確な向上は見られませんが、一部の非英語表現が低下しています。

通常版3.8 Flashは、化学、生物学、放射性、核関連およびネットワーク攻撃に対してセキュリティ制限を設けています。サイバーバージョンは専門的な防御タスクを実行する必要があるため、ネットワークセキュリティ制限が緩和されており、審査を通過した機関にのみ提供されます。

Googleのモデルカードによると、3.8 Flashは、3.7 Flashと比較して、企業の最先端セキュリティフレームワークが注目する高リスク分野において本質的な新機能を備えておらず、したがってより高いリスクレベルはトリガーされていない。また、Gray Swan間接プロンプトインジェクションテストにおける保護機能も改善されている。

ただし、モデルカードでは、3.8 Flashが自動化された多言語セキュリティテストにおいて、3.7 Flashより5.4ポイント低下したことが明示されています。Googleは人間によるチェックの結果、大部分の差異は誤検出または軽微なコンテンツであると評価していますが、完全なサンプルおよび言語別データは公開されていません。

モデルは、幻覚、偶発的な応答遅延またはタイムアウト、およびパフォーマンス向上のための過剰なトークン使用といった大規模言語モデルの一般的な問題を依然として抱えています。知識の截止日は2026年3月とされていますが、Googleによると、一部の分野における信頼できる知識は2025年1月頃までしか更新されていない可能性があります。最新情報については、オンラインで確認する必要があります。

真の競争は「誰が最も賢いか」から「誰を大規模に利用できるか」へと移行している。

Gemini 3.8 Flashで最も注目すべき点は、あるベンチマークでわずか数パーセントリードしていることではなく、Googleが長期間のプログラミング、専門的分析、および自律的なツール呼び出し機能をFlashの価格帯に組み込んでいることである。

フラグシップモデルは高価値で低頻度の複雑なタスクに適しているが、実際の企業カスタマーサポート、プログラミングパイプライン、財務分析、セキュリティスキャンで動作するエージェントは、1日あたり数百万回の呼び出しを処理する可能性がある。これらのシナリオでは、ランキング1位よりも速度、単価、単一タスクの成功率が重要である。

3.8 Flashはこの路線の矛盾も示している:モデルが繰り返しチェックし、継続的に作業する能力が高いほど、より多くのトークンを生成し、「安価なモデル」の単一タスクコストが上昇する可能性がある。したがって、今後のエージェントの競争の核心は、誰が最もよく回答するかだけでなく、いつ思考を継続し、いつツールを呼び出し、いつ停止すべきかを判断できるかにもある。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。