1か月で9つの主力AIモデルがローンチされ、「使い捨て」時代の到来を示唆

iconMetaEra
共有
AI summary icon概要
2026年7月、Tencent Hunyuan Hy3、Kimi K3、Qwen3.8-Maxを含む9つの主力AIモデルが市場に登場しました。急速なリリースは、競争の激化とイノベーションの加速を示しています。Kimi K3はCode Arenaのフロントエンドランキングで1位を獲得し、Hy3はより少ないアクティブパラメーターを使用しました。現在、純粋な性能だけでなく、価格とコードパフォーマンスも同様に重要です。トレーダーたちは、これらの変化がフィアンドグリードインデックスやトップアルトコインにどのような影響を与えるかを注目しています。
「最強モデル」の賞味期限が短くなっている。

記事執筆者、出典:定焦

1か月以内に9機種のフラグシップモデルが相次いで発表され、これは大規模モデル業界では珍しいことです。

月初にテンセントの混元Hy3が正式版としてリリースされオープンソース化され、月末にはAnthropicがClaude Opus 5を発表するまでに、Kimi K3、Qwen3.8-Maxプレビュー版、Grok 4.5などのモデルが次々と登場した。7月は、最近1年でまれなリリースのピークとなった。

各社が選択したタイミングは異なります。あるメーカーは競合製品の更新後の隙を狙って発表し、あるメーカーは世界人工知能大会前後に発表し、またあるメーカーは価格調整を通じて市場競争に応じています。

しかし7月はモデルの発表数が多かっただけでなく、この一連の発表に見られる2つの変化がより注目されます。

まず、モデル間の能力差が縮小しています。Artificial Analysisの最新の総合知能指数によると、トップモデル間の差は明確に狭まっています。バージョンの高速な反復により、「最強モデル」の地位は長期的に維持しづらくなっており、各社は単一の次元での絶対的リードを追求するのではなく、異なるタスクごとに優位性を見出そうとしています。

第二に、オープンソースモデルがトップクラスに進出しています。7月に発表された新モデルのうち、テンセントのHunYuan Hy3やKimi K3などは、重みをオープンに(モデルパラメータを公開し、開発者が自由にダウンロード・デプロイできるように)しています。その中で、Kimi K3はCode Arenaのフロントエンドプログラミングランキングで1位となり、GPT-5.6 SolやClaude Fable 5を上回りました。過去2年間、オープンソースモデルは主にクローズドソースモデルの追従者と見なされてきましたが、今回の競争では、オープンソースモデルが一部の開発シナリオでクローズドソースモデルと直接競合し始めていることが示されています。

それでは、この1か月間の集中したリリースはどのような変化をもたらし、何を意味しているのでしょうか?

01. もはや誰がより賢いかだけを競わない

過去数年間、大規模モデル業界は汎用能力を競い合い、誰がより広範な知識を持ち、より正確な回答を提供できるかが焦点でした。しかし、現在では競争の軸が変わりました。

今回のラウンドでは、コーディング能力が最も顕著な競争の焦点となった。

OpenAIはプログラミングと複雑な推論をさらに強化し、Codexエコシステムを継続的に拡張することで、開発者ユーザーをツールに束縛することを目指している。Anthropicはコードの理解とセキュリティ監査に注力し、開発者が大規模プロジェクト内の複雑なエンジニアリング課題に対処できるように支援している。Grok 4.5は速度と低コストを重視し、AIプログラミングツールのCursorと連携して、日常的な開発シーンをカバーしている。

大規模モデル研究者の姚宇航は「定焦One」に、各社がプログラミング能力に重点を投入しており、差も急速に縮まっていると語った。例えば、Kimi K3のコード能力は顕著に向上し、トップレベルのクローズドモデルに近づきつつある。

画像提供:Pexels

エージェントは各社が競い合う別の方向性である。GPT-5.6 SolはCodexと連携して自動プログラミングを探索し、Opus 5は長期タスクの実行を強調し、Kimi K3は連続運用による複雑なタスク完了能力を示している。腾讯混元Hy3は微信エコシステムと統合してエージェントアプリケーションを模索しようとしている。

しかし、エージェントは実際の作業においてまだ未熟である。独立開発者である北城は、現在の一部のエージェント製品の課題はツールを呼び出せるかどうかではなく、タスクスケジューリング能力にあると指摘する。たとえば、CodexのUltraモードでは多くのサブエージェントが起動され、異なるサブエージェントが同じファイルを繰り返し読み取り、類似の分析を実行するため、Token消費量は増加するが、実質的な有効な作業量は増えていない。彼の見解では、エージェントの能力向上はサブエージェントの数を増やすことだけでは実現できず、どのタスクを分析する価値があるか、どのステップを省略できるかを判断できるかどうかが鍵である。

姚宇航の見解も同様である。彼は、エージェントが現在最も注目すべき分野であると考えているが、本格的に成熟するにはまだ距離があると述べている。彼の見方では、医療や金融などの垂直分野におけるエージェントにはまだ大きな機会が残されている。次段階で差が開く鍵は、モデルの能力そのものだけでなく、エージェントが具体的なシナリオで使いやすいかどうか、そして顧客が支払う意欲を持つかどうかにある。

国内モデルは、異なる能力の強化を通じて突破口を探している。Kimi K3は、長文コンテキスト、フロントエンドプログラミング、製品設計能力の強化に焦点を当て、複数のプログラミングテストでトップクラスの位置を獲得し、その能力は海外の閉源型フラグシップモデルに近づいている。

パラメータ規模と推論効率との間の競争は、もう一つの主要な軸となっている。

7月にリリースされた複数のモデルが兆単位、さらには数兆パラメータの領域に入りましたが、パラメータ規模はもはや性能の高低を単純に示すものではありません。MoEアーキテクチャの発展により、モデルはより大きなパラメータ容量を有しつつ、推論時にその一部のみを活性化することで、実際の計算コストを削減できます。

業界はこれにより二つの路線を形成しています。一つは規模をさらに拡大し、より大きなパラメータでより強力な能力を実現する方法。もう一つは効率を重視し、より小さな活性化パラメータでフラグシップモデルに近い効果を実現する方法です。

価格は7月のモデル競争における最も直接的な変数也成为。

海外のベンダーはより差別化された価格戦略を採用している。OpenAIは市場をさらに細分化し、GPT-5.6を複数のバージョンに分割して、ユーザーがタスクの複雑さに応じて適切なモデルを選択できるようにした。Anthropicは引き続き高性能なフラグシップモデル路線を維持し、Opusシリーズで高価値な開発およびエンタープライズシーンをカバーしている。一方、Grok 4.5は低価格戦略を採用し、出力価格はOpusシリーズの4分の1に設定し、Cursorとの連携を通じて開発者を引き付けている。

国内のメーカーはコスト優位性をより強調しています。過去半年間、複数の国内モデルメーカーがAPI価格を継続的に引き下げ、低コストによって利用のハードルを下げ、開発者および企業ユーザーの規模を拡大することを目指しています。

7月の大規模モデルの競争は、単一の能力の競い合いから、コード、エージェント、パラメータ効率、価格の複数の次元に拡大した。

02. 誰が期待を上回り、誰が評価が分かれる?

前世代との変化、ランキングの成績、開発者のフィードバックを総合的に比較すると、7月にリリースされたモデルのレベルは大きく三つに分類できる。

まず期待を上回ったものを見てみましょう:Kimi K3、Grok 4.5、混元Hy3。

最も注目されたのはKimi K3です。このモデルはMoEアーキテクチャを採用し、総パラメータ規模は兆レベルに達し、長文コンテキスト、フロントエンドプログラミング、製品設計の能力に重点を強化しています。リリース当日、Kimi K3は1679点でCode Arenaのフロントエンドプログラミングランキング1位となり、前世代のKimi K2.6の18位から17位向上しました。1週間後のArena総合ランキングでは、Kimi K3は初めて世界トップ10入りを果たしました。

しかし、Kimi K3にも明確な能力の限界があります。Artificial Analysisの知識信頼性テストでは、幻覚率がKimi K2.6の39%から51%に上昇し、出力速度は約33 Token/sと、同類のモデルに比べてはるかに遅いです。

開発者の実際の使用感も、この「偏科」を裏付けている。北城は、Kimi K3が前世代と比較して明確な改善を遂げていると感じており、その優位性は主にフロントエンド開発、UIデザイン、製品表現に集中している。たとえば、ウェブサイトUIの最適化やアプリインターフェースの設計といったタスクでは、Kimi K3はより優れた成果を生み出すが、複雑なエンジニアリングタスクでは安定したパフォーマンスを発揮できない。

画像提供:Pexels

注目されているのはGrok 4.5です。7月9日のリリース後、Artificial Analysisインテリジェント指数で上位にランクインし、一部のツール呼び出しテストで優れたパフォーマンスを発揮し、多くの開発者からコストパフォーマンスの高い選択肢と見なされています。

北城の実感はこれと一致しており、彼はGrok 4.5の最大の利点は速度であると考えている。同じ要件をGrok 4.5で処理すれば3〜5分で完了するが、GPT-5.6では20分から30分かかることもある。さらに価格が低いため、迅速な開発が必要な場面で適している。姚宇航は、Grok 4.5のプログラミング能力が特別に最適化されており、Cursorと組み合わせた全体的な体験が非常に良いと評価している。背景として、SpaceXは以前、Cursorの親会社であるAnysphereを買収すると発表しており、取引は第3四半期に完了する見込みである。また、xAIとCursor間のデータ協力は、Grok 4.5のプログラミング体験の最適化に寄与しているとされている。

混元Hy3は効率路線の突破を示しています。このモデルの総パラメータ数は295Bで、活性化パラメータはわずか21Bですが、フラグシップモデルの5分の1以下のパラメータ規模で、複数の公開ベンチマークにおいて、より大規模な競合モデルに近い成績を収めています。ただし、SWE-Bench Proでは、混元Hy3の57.9点がClaude Opusの69.2点と明確な差があり、複雑なコード修正能力の面ではまだ追いついていないことを示しています。

ヤオ・ユーハンは、混元Hy3が腾讯の以前のモデルと比較して進歩しており、オープンソース化と小型設計を加味すると、中規模規模においても優れた選択肢であると評価している。

安定してトップタイヤに位置するが、驚きに乏しいタイプ:GPT-5.6 SolとClaude Opus 5。

GPT-5.6 SolとClaude Opus 5は依然として第一線の位置を維持しているが、大きな変化はなかった。GPT-5.6 Solは複雑な推論とエージェントプログラミングの能力を強化し、Terminal-Bench(モデルがコマンドライン環境で実際のタスクを完了する能力を評価するベンチマーク)2.1テストで88.8%を達成し、Ultraモードではさらに91.9%まで向上した。Claude Opus 5は複雑なタスクにおける優位性を維持し、複雑なエンジニアリング、コード理解、セキュリティ分析などのシナリオにおける信頼性をより重視している。Opus 5の利点は、Fable 5に近い性能を実現しながら、価格はその半分である点である。

两款モデルは依然として第一線に位置していますが、大きな進展は見られませんでした。

北城は、GPT-5.6が彼の大部分の日常的な開発要件をカバーできるが、特に複雑な問題に直面した際にはOpus 5を活用すると述べた。しかし、より強力な機能はより高いコストを意味する。彼にとって、Opus 5は重要な問題を解決する際に呼び出す「専門家」に近い存在である。

最後に、フィードバックが分かれ、まだ検証が必要なタイプです:Gemini 3.6 Flash および Qwen3.8-Max プレビュー版。

最も代表的なのはGemini 3.6 Flashです。このモデルはArtificial Analysisインテリジェント指数ランキングで50点を獲得し、前世代の3.5 Flashと同等です。開発者コミュニティからの一般的なフィードバックは、この世代が前世代と比較して明確な改善が見られず、同時期の競合製品に劣っているというものです。ただし、軽量モデルとして、Gemini 3.6 Flashの出力品質は概ね十分であるという意見もあります。

独立開発者であるカプディムによると、Gemini 3.6 Flashの日常利用体験は良好で、プログラミング能力は目立たないものの、マルチモーダル理解は依然として優れている。あらゆる形式のファイルを入力でき、日常会話の文体や体験も多くの競合製品を上回っている。

Qwen3.8-Maxプレビュー版は7月にリリース後、モデルの性能が不安定で、市場の反応も異なっていました。北城の最も強い印象は、Qwen3.8-Maxプレビュー版の思考深度が非常に高い一方で、長時間の推論に陥り、「自分自身で自分を巻き込んでしまう」ような状況になり、最終的に有効な解決策を提示できなかったことです。カプディムは、Qwen3.8-Maxプレビュー版が期待を下回ったと感じており、自身のフロントエンド審美基準セットで評価したところ、実際の能力と宣伝内容に明確な差があることを発見しました。このプレビュー版はまだ調整中の製品であるため、最終的なパフォーマンスは正式版のリリースを待ってから検証する必要があります。

7月は、すべての次元で優位なモデルは現れず、異なるモデルが具体的なシナリオに基づいて役割分担を始めました。

北城の例では、タスクに応じてツールを選択します:日常の開発にはGPT-5.6、要件の迅速な実行にはGrok 4.5、製品およびフロントエンドのシナリオにはKimi K3、複雑な問題の解決にはClaude Opus 5を使用します。一方、カプディムの組み合わせは異なり、計画にはClaudeのFable 5またはOpus 5モデルを使用し、その後GPT-5.6 Solで実行します。

03. リリースの頻度がますます高まり、オープンソースとクローズドソースの議論が激化

この一連の集中リリースの背後には、以下の点を分析する価値があります:モデルのイテレーションがなぜ急速に加速しているのか、なぜそれが7月に集中しているのか、そしてオープンソースが既存のビジネスモデルにどのような影響を与えるのか。

まず、モデルの反復方式が変化しています。過去には、大規模モデルの能力向上は主により大規模なモデルを再学習することで実現され、サイクルが長く、コストが高かったです。しかし、強化学習や後学習(基礎モデルの学習完了後に、微調整や強化学習などの方法でモデルの性能をさらに最適化する)などの技術が成熟するにつれ、モデルのアップグレードは学習後の最適化にますます依存するようになっています。

姚宇航は「定焦One」に、過去2年でモデルのリリース速度が明らかに加速したと語り、その主な理由は業界がより成熟した後学習手法を習得したためだと述べた。現在、多くのモデルの性能向上は新しいモデルを再訓練するのではなく、既存のベースモデルを強化学習や自己反復などの方法で継続的に最適化することで実現されている。

これは、モデル間の競争サイクルが短縮されていることを意味します。過去には、リーディングモデルが数か月にわたり優位を保つことがありましたが、現在では、バージョンアップによる優位性の期間は数週間程度にまで短くなっています。リリースのペースに遅れれば、すぐに新しいバージョンに覆されてしまう可能性があります。メーカーにとって、モデルのリリースは技術的なデモンストレーションだけでなく、リリースタイミングそのものが競争の一部となっています。

画像提供:Pexels

また、7月は複数の節点が重なる時期です。国内メーカーにとっては、世界人工知能大会(WAIC)が7月に開催され、メーカーはこの前後でモデルを発表し、技術進展を披露します。海外メーカーにとっても、複数のトップ企業がこの時期にモデルを更新し、開発者エコシステムや商業的競争で優位性を確保しようとしています。

さらに、業界の競争ルールが変化しています。モデルの能力が十分であることはもはや唯一の目標ではなく、競争はモデルの使い方や収益化の方法にまで拡大しています。

これが、7月にオープンソースとクローズドソースの議論が再び盛り上がった理由です。長年にわたり、オープンソースモデルとクローズドソースモデルの間には能力の差がありました。しかし、一部のオープンソースモデルがトップグループに進出することで、より現実的な問題が浮上しました。高性能モデルが無料で手に入るようになった場合、モデル企業のAPI呼び出しやサブスクリプション収入は分流されないでしょうか?

オープンソースを支持する側は、オープンな重みが技術の障壁を下げ、より多くの企業や開発者がAIイノベーションに参加できるようにすると考えています。オープンソースとは、技術提供者が一部の利益を自発的に譲渡し、エコシステムの発展を促進することを意味します。一方、クローズドソース側は、自社のユーザーがオープンソースモデルによって分流される可能性を懸念しています。Anthropicなどの企業は、モデルの能力が向上するにつれて、オープンな重みがセキュリティリスクをもたらす可能性があり、より厳格なガバナンスが必要だと考えています。

この議論の背後には、異なる企業の利益が反映されている。英語のインフラ企業であるNVIDIAなどにとっては、モデルのオープン化はより多くのデプロイ需要を生み出し、より大きな計算能力市場を意味する。一方、OpenAIやAnthropicなどのモデル企業にとっては、クローズドソースモデルがAPI呼び出しやサブスクリプション収入を維持する手段となる。しかし、もう一方の側面としても、オープン化は確かにデプロイ需要を拡大するが、パラメータ効率の向上に伴い、単位タスクあたりの計算資源消費量も削減される可能性があり、計算能力市場の増加がモデルのオープン化程度と必ずしも比例するわけではない。中国の企業にとって、重みのオープン化は単なる技術的選択肢ではなく、開発者エコシステムやクラウドサービス、その後の商業化へのアクセスを獲得する機会でもある。

7月以降、大規模モデルの競争は継続する。開発者コミュニティは、DeepSeek V4正式版、Fable 5.1、GPT-6などの新モデルが8月に順次リリースされると広く予想している。

モデルの能力差は縮小しており、単により強力なモデルをリリースするだけでは、長期的な優位性を築くのがますます難しくなっている。次に注目すべきは、いくつかの具体的な指標だ:DeepSeek V4の正式版がオープンソースモデルの能力上限をどこまで引き上げるか、API価格がさらに低下するか、エージェントに安定した有料利用シーンが登場するか、そしてオープンソースモデルが企業のプライベートデプロイメントにさらに広がるか。これらの質問への答えは、ランキングの順位よりも、この一連の混戦が実際に何を変えたかをよりよく示すだろう。

*サムネイル画像はPexelsより。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。