著者:Google DeepMind
翻訳:深潮 TechFlow
深潮導読:Googleが今回発表した3つのモデルは、AIエージェントの商業化における真の課題であるコストと速度の解決に焦点を当てている。3.6 Flashは前世代よりトークンを17%削減し、価格は低く、品質は向上している。3.5 Flash-Liteは秒間350トークンの速度を実現し、現在最も速い3.5シリーズモデルだ。また、専用のサイバーセキュリティモデルFlash Cyberは、コード脆弱性の修正という必須市場にターゲットを絞っている。これはパフォーマンススコアの競争ではなく、大規模なAIエージェントの展開を支えるための道を切り開く取り組みである。
Google DeepMindは本日、新しいGeminiモデル3つを発表しました:3.6 Flash、3.5 Flash-Lite、および3.5 Flash Cyber。これらのモデルは、大規模なAIエージェント構築に必要な効率性、遅延、信頼性を目的として設計されています。
Gemini 3.6 Flash:より効率的で、より高品質
3.6 Flashは、開発者からの3.5 Flashに対するフィードバックを基に改善されています。コード作成と知識作業においてさらに進化し、トークン効率も大幅に向上しました。Artificial Analysis Indexによると、3.6 Flashは3.5 Flashと比較して出力トークンの消費量を17%削減します。DatacurveのDeepSWEなどの一部のベンチマークでは、最大65%の削減が実現されています。複数ステップのワークフローを完了するために必要な推論ステップやツール呼び出しも減少しています。
この効率の向上に伴い、コストも低下しました。入力トークン100万に対して1.5ドル、出力トークン100万に対して7.5ドルの価格設定により、3.6 Flashはエージェントタスクあたりの総コストを削減し、エージェントの構築と実行をより経済的にします。
より効率的であっても、3.6 Flashはさまざまなユースケースで3.5 Flashを上回る性能を発揮します:
コード編集がより正確になり、不要な変更と実行ループが削減され、DeepSWEでは49%(3.5 Flashは37%)、機械学習研究ベンチマークMLE Benchでは63.9%まで大幅に向上(3.5 Flashは49.7%)
コンピュータ操作能力が改善され、OSWorld-Verified スコアは83.0%(3.5 Flashは78.4%)。コンピュータ操作は、今後Gemini APIおよびGemini Enterpriseに内蔵されたクライアントツールとして提供されます。
GDPval-AA v2 ベンチマークスコアが1421(3.5 Flashは1349)と、知識作業においてより優れたパフォーマンスを発揮します。HebbiaやHarveyなどの顧客は、ドキュメント解析、チャートおよびデータ分析、レポート作成などのマルチモーダルタスクで特に優れていることを確認しています。
顧客のフィードバック:3.6 Flashは、コストと品質の面で進歩を遂げており、複雑なワークフローと知識ベースのタスクにおいて、トークン効率、正確性、速度のバランスを実現しています。
セキュリティ設計
3.6 Flashは、化学、生物、放射性および核(CBRN)およびサイバー攻撃の悪用分野をカバーする強化された最先端セキュリティ対策を備えています。これらの対策により、モデルのジャイル攻撃に対する耐性が大幅に向上しました。同時に、モデルは有益な用途に対する拒否を最小限に抑えるよう訓練されています。
Gemini 3.5 Flash-Lite:Agentワークフローのスケーリングのために設計
3.5 Flash-Liteは、Agent検索やドキュメント処理などの低遅延タスクおよび高スループットを必要とする開発シナリオ向けに設計されています。
3.5 Flash-Liteは3.5シリーズで最も高速なモデルです。Artificial Analysisの測定によると、毎秒350トークンの出力速度を達成しています。入力トークン100万に対して0.3ドル、出力トークン100万に対して2.5ドルと、3.1 Flash-Liteと比較して品質が大幅に向上しており、大規模な本番タスクを実行する開発者および顧客にとって優れたコストパフォーマンスを提供します。
3.5 Flash-Liteは、Agentシステムの効率的な拡張をサポートします。各思考レベルにおいて、このモデルは3.1 Flash-Liteを大幅に上回ります。開発者はワークロードに応じてモデルを構成できます:大量タスクには最小限かつ低思考レベルを使用し、低遅延・低コストの実行を優先するか、複数ステップのサブAgentワークロード処理のためにより高い思考レベルを有効化できます。このモデルは、今後、コンピュータ操作を組み込みツールとして搭載し、インターフェース間のAgentタスクを安定してサポートします。
コーディングおよびエージェントタスクにおいて顕著な改善が見られ、Terminal-Bench 2.1 のスコアは54%(3.1 Flash-Liteは31%)、長文コンテキストではGDM-MRCR v2のスコアが72.2%(3.1 Flash-Liteは60.1%)、実際のタスク実行ではGDPval-AA v2のスコアが1140(3.1 Flash-Liteは642)です。
実際、多くのエージェントおよびコーディング評価において、3.5 Flash-Lite は 3 Flash を上回り、SWE-Bench Pro(54.2% 対 49.6%)や OSWorld-Verified(74.0% 対 65.1%)でも優れた性能を発揮し、2.5 および 3 Flash のワークロードに対してより速く、より強力な選択肢となっています。
早期の顧客は、3.5 Flash-Lite がエージェントワークフローとデータ処理タスクの拡張において、速度、知性、コスト効率の独自の組み合わせを強調しました。
Gemini 3.5 Flash Cyber in CodeMender:効率的に脆弱性を発見し修正
AIモデルは、現在のシステムがそれらを修正する速度を上回ってセキュリティ脆弱性を発見している。この深刻化する脅威に対応するには、効率的で強力なソフトウェアセキュリティ手法が必要である。
Flash の性能と効率性により、大規模なコードセキュリティ問題の検出、検証、修正に理想的な基盤となります。Gemini 3.5 Flash Cyber は 3.5 Flash をベースに構築され、ネットワークセキュリティの脆弱性を特定して修正するために微調整されており、1トークンあたりのコストは大規模モデルよりも低くなっています。
CodeMenderでは、複数の3.5 Flash Cyber Agentが協力して単一の総合レポートを生成し、人気のベンチマークCyberGymで最先端の競争レベルを達成しています。
この技術の二重利用性を踏まえ、私たちは慎重な導入アプローチを採用しています。このモデルは、まもなくCodeMenderを通じて、政府および信頼できるパートナー向けにアクセス制限されたパイロットプロジェクトとして提供されます。これにより、第一線の防御者が重要な脆弱性が悪用される前にそれらを特定・修正でき、広範な悪用リスクを軽減できます。
すぐに開始する
3.6 Flash および 3.5 Flash-Lite が今日より利用可能になります:
開発者はGoogle AI StudioおよびAndroid StudioのGemini APIを通じて利用できます。3.6 FlashはGoogle Antigravityでも利用可能です。
企業はGemini Enterprise Agentプラットフォームで利用できます。3.6 FlashはGemini Enterpriseアプリでも利用可能です。
すべてのユーザーがGeminiアプリを通じて利用できます。3.5 Flash-LiteはGoogle検索でも提供開始中です。
今後のGeminiモデルの改善のため、フィードバックをお寄せください。3.5 Proのリリースをお待ちください。
