整理・編集:深潮 TechFlow

ゲスト:Jordan および Max、SemiAnalysis アナリスト
ホスト:ジョーダン(SemiAnalysis 内部対話)
ポッドキャスト元:SemiAnalysis
元のタイトル:[Emergency Episode] MoonshotのKimi K3が登場!中国にフロンティアモデルが登場
放送日:2026年7月18日
要点まとめ
Moonshot(月之暗面)がKimi K3をリリースし、複数の総合ベンチマークでGoogleとMetaを上回り、AnthropicのFableとOpenAIのSoul 5.6に次いで世界第3位のモデルとなりました。SemiAnalysisのアナリスト、JordanとMaxは緊急番組でこのリリースの意味を分析しました:2.8Tパラメータのモデルは、Sonnetと同等の価格(100万トークンあたり3/15)でサービスを提供しており、これが最先端のクローズドモデルと同等の規模であるなら、Anthropicが10/50の利益率を稼いでいることは驚異的レベルである可能性があります。
ジョーダンによるより鋭い判断では、最先端の差が縮小しているのは、米国政府がAnthropic/OpenAIの最強モデルの公開を制限したことで、後追いからの追いつきに時間的余裕を与えたためだとされる。オープンソースは実際に追いついていない。一方、西洋のオープンソースは完全な真空状態であり、米国企業のオープンソースモデルは中国の5番目に優れたモデルにも及ばない。モデル競争は、ツールの活用と地政学的競争へと変化している。
エッセンスの要約
Kimi K3の位置づけについて
- すべての主要ベンチマークの総合ランキングを見ると、今日のトップ3は明確にFable、Soul 5.6、Kimi K3です。これらはDeepSeekを含め、Google、Meta、xAIをも上回っています。
- Googleは非常に恥ずかしい思いをすべきだ。2025年11月、12月には、誰もがAIの三大企業をGoogle、Anthropic、OpenAIだと信じていた。今日、ある「古参」たちと話すと、彼らはまだそう思っているが、明らかにそれはもう違う。
- それは世界で二番目に優れたモデルかもしれない。なぜなら、Fableで少し真面目なことをしようとすると常に拒否され、Opusに振り返られるからだ。それがOpusより優れているかどうかは不明だが、少なくとも拒否されることはない。
フロントランナーモデルの利益率について
- Kimiが3/15の価格でK3を損失を出して提供していないとすれば、規模がほぼ同じで10/50を徴収するFableは、AIラボが利益を上げられないビジネスであるという懸念を完全に払拭すべきだ。トークンをAPI価格で販売することは、SaaSよりも利益が大きい可能性がある。
- K2.7からK3まで価格は3倍以上上昇し、0.95/4から3/15まで上がりました。しかし、多くのタスクにはGLMやMiniMax M3で十分なので、これ以上の値上げ余地はあまりないと思います。
米国政府と格差について
- この差が縮小したのは、米国政府がAnthropicを制限したおかげで、これらの企業が持つ本当の最強モデルにアクセスできなくなったからだと私は信じています。彼らは人為的に追いついてきたのです。
- 私たちは、先進的な知能が許可された場合にのみ、それにアクセスできます。これは、後続の4位から7位のプレイヤーにとって実際の機会です。
关于西方开源真空
- 市場がまだこれほど非効率であることに、米国企業が中国で5番目に優れた企業にも及ばないという事実に私は驚かされます。
- たとえ中国政府が中国のオープンソースモデルを禁止しなくても、一般の米国大企業は自社の機密データを中国のオープンソースモデルに与えることを望まない。たとえ気密データセンターに重みをロードしたとしても、CCPがあなたのデータを見ることはできないが、経営陣は納得しない。
Harnessについて
- Kimi K3のテストにより、初めてOpen Code、Hermes、Piを真剣に検討しました。Harnessはまだ製品の一部です。
- シンプルな要素だけで、このモデルを選んであのモデルを却下することができる:リモートSSHサーバーにインストールできるか?ショートカットキーは使いやすいか?これらのハーネス内の細部が、実際に私がトークンをどこに送るか、つまり予算をどこに配分するかに影響する。
「まだ早い」について
- 先週、私はICMLに行きました。その前の週はAI Engineerカンファレンスに行きました。これは名目上のAIカンファレンスで、80%以上の人々がSemiAnalysisを聞いたことがありません。あなたはAI業界で働いていると称していますが、SemiAnalysisを読んだことがないのですか?まだ時期が早すぎます。
Kimi K3は世界で3番目に優れたモデルですか
ジョーダン:速攻コメント、Kimi K3は今や世界で3番目の優れたモデルですか?
Max:答えは明確な「はい」です。誰もがベンチマークを批判しますが、ベンチマークには確かに問題があります。しかし、主要なベンチマーク全体の総合ランキングを見ると、その指向は常に正しいです。今日、明確なトップ3が存在します:Fable、Soul 5.6、Kimi K3。これらはDeepSeekなどのオープンソースプレイヤーを含む他のすべてのプレイヤーを上回っており、Google、Meta、xAIをはるかに上回っています。これは月の暗面チームにとって非常に素晴らしい成果です。
Googleは非常に恥ずかしい気持ちであるべきだ。2025年11月、12月には、誰もがAIの三大企業をGoogle、Anthropic、OpenAIだと考えていた。今日、ある「古参」たちと話すと、彼らはまだそう思っているが、明らかにそれはもう違う。
全体として、私は依然としてこれがFableとSoul 5.6よりも劣ると感じています。面白いことに、彼ら自身のモデル発表ブログでも明確にそのように述べています。これは古い中国式の謙虚さかもしれませんし、Fable 5.6の発表時に一部遅れがあったことから、米国政府の監視を避けようとしているのかもしれません。しかしいずれにせよ、非常に印象的です。
ジョーダン: 彼らのブログの「制限事項」セクションには、「K3は全体的に非常に競争力のあるモデルであるが、ユーザー体験においてFable 5およびGPT 5.6との間には明確な差異が存在する」と記されている。私の個人的な使用体験では、確かに優れているが、非常に遅く、これが非常に煩わしい。このため、初めてオープンソースのharnessを試す動機が生まれた。正直なところ、私はモデルについてより多くのことを学んだというより、harnessについて学んだ気がする。なぜなら、現在私が行っている基本的なタスクをこなすには、これらのすべてのモデルが十分に優れており、私が達成できない複雑なタスクを見つけるのが難しいからだ。
これは私にとって世界で二番目に良いモデルかもしれません。なぜなら、Fableで真面目なことをしようとすると常に拒否され、Opusに振り分けられるからです。FableがOpusより優れているかどうかはわかりませんが、拒否されないという点だけでもストレスが減ります。ただし、APIキーを使って従量課金で利用する場合は拒否されず、webコンソールやdeep researchを使用する場合にのみ利用制限に引っかかります。彼らはこのモデルが引き起こす需要に十分なGPUを備えていないようです。以前はこの問題をオープンソース戦略で解決し、重みを公開して他の人がサービスを提供するようにしていましたが、今回はまだ重みを公開しておらず、10日後に公開すると述べています。
なぜ重みを10日遅れてオープンソースにするのですか?
ジョーダン:この遅延の戦略とは何だと思いますか?
Max:はっきり言って、これはすべて私の純粋な推測です。大きな理由の一つは、vLLMやSGLangなどの推論エンジンチームに十分な時間を与え、このモデルを高性能で提供できるようにするためでしょう。今日いきなり重みを公開して、すべての人が提供しようとしても、たった20トークン/秒しか出せないなら、彼らのブランド獲得にとって非常に良くありません。彼らは今、大量のPRと採用を得る絶好の機会にいます。もしリリース直後にパフォーマンスに引っ張られてしまうと、かえって勢いを損なうことになります。
もう一つの可能性は、Together AI、Fireworks、Nebius、Groq といった推論サービスプロバイダーと、GB300などの最新チップを用いて増分容量を提供するためのライセンス契約を交渉していることである。これらが10日間の遅延の主な理由である。
最先端モデルの巨額利益
ジョーダン:モデルアーキテクチャについて話しましょう。これは2.8Tパラメータで、B200には収まりません。単一の8スロットHGXサーバーでサービス提供するには、B300、GB300、またはAMD MI355Xが必要です。もちろん、ノード間のパイプライン並列化を行うことは可能ですが、それによりパフォーマンスが大幅に低下します。したがって、最新のチップを所有している人だけがこのモデルをサービス提供できます。
先ほどGoogleの話題に戻ると、このモデルは2.8Tのパラメータで最先端の競争力を達成しており、これは閉源の最先端モデルがどの程度の規模であるかについていくつかの手がかりを给我们ています。もし彼らが10Tのパラメータモデルでこれと比較しているなら、もっと恥ずかしいことになります。我々はこれがSoulやFableと同レベルであると仮定する必要があります。
Max: そうだ、君の言う通りだ。私は依然としてAnthropicの研究チームの能力と鋭敏さを信じている。もしTwitterで誰かが、現在のクローズドソースモデルが10Tのパラメータを持っているなどと言っているなら、それが本当なら、友達、荷物をまとめるべきだ。NVIDIAの株価は明日50%下落し、すべてが終わるだろう。
私はKimi K3が現在のリーディングな閉源モデルよりも大きくない、むしろ少し大きい可能性が高いと確信しています。もしそうなら、これはSemiAnalysisで一貫して強調してきた見解、すなわちこれらの閉源ラボの利益率はとてつもなく高いことをさらに裏付けることになります。Kimiが3/15の価格でK3を提供している際に赤字になっていない、Sonnetの価格設定と同じであれば、Fableと同程度の規模なのに10/50を請求していることから、AIラボが利益を上げていないという懸念は完全に払拭されるべきです。今日の時点で、API価格でトークンを販売することは、SaaSよりもさらに利益率が高い可能性があります。
ジョーダン:従業員コストはなく、GPUのみです。以前の価格と比べるとどうですか?3/15と言っていますが、前のMoonshotの直接価格は0.95/4だったので、K2.7からK3まで価格は3倍以上上がりました。まだどの程度値上げの余地がありますか?
Max: 彼らがさらに価格を引き上げる余地はそれほどないと思う。3/15という価格でも、多くの人が高すぎると思うだろう。彼らのタスクはGLMやMiniMax M3で十分だ。ここに興味深い分岐がある:私たちSemiAnalysisのようなDylanのトークンを気にしないユーザーは、ほぼすべてのタスクにFableを使い続ける一方、TeslaやUberのような週に200ドルしかトークンを使わない極めてコスト感度の高いユーザーはGLMの価格層を選ぶだろう。では、Kimi K3に切り替える真正のユーザーは誰か?おそらく、オープンソースを哲学的に愛し、新しいモデルを支援したいという人々だろう。大企業が本当にこのモデルを採用するかについては、答えが否定的であっても驚かない。
新しいアーキテクチャと次なるステップ
ジョーダン:これは全新的アーキテクチャです。2.8Tのパラメータで、Kimiのdelta attention、potential residuals、stable latentを搭載しており、基本的に以前のモデルの約2倍のサイズに拡張されたものです。以前のK2.5では、Cursorがcontinued pre-trainingとMRLに基づいてcomposerとして使用し、その後2.5、2.6、2.6.7などのチェックポイントがリリースされました。これは新しいベースモデルですが、すでに非常に完成度が高く、従来のモデルで見られた粗いエッジがほとんど見られません。次は?3.1はいつリリースされるのでしょうか?価格は変わるのでしょうか?K3に基づくcomposerは登場するのでしょうか?
Max:K3に基づくComposerは登場しないでしょう。Cursorのチームはすでに自社モデルをゼロから訓練することを決定しました。K3.1やK3.2については、今後1〜2ヶ月のうちに2〜3回の更新が行われ、継続的なポストトレーニングが行われると思われます。価格については、今後2〜3ヶ月の間、新しいハードウェア上で動作させられないため、スループットの向上がなく、価格を下げることは不可能だと考えられます。非常に優れたカーネルエンジニアがコストをDeepSeek V4並みに抑える可能性はありますが、3Tパラメータのモデルでそれを実現するのは疑問です。現在のGLMやMiniMaxの価格は、すでに1T〜1.5Tモデルが提供できる限界ではないかと思います。
オープンソースはクローズドソースに追いつくでしょうか
Max: もう一つ興味深い質問は、オープンソースとクローズドソースの差が今後さらに縮小するかどうか、そしてオープンソースが真に最先端レベルのパリティに到達できるかどうかです。もしそれが実現すれば、私たちの業界全体に大きな影響を与えるでしょう。あなたの見解は?
ジョーダン: 私の見解では、現在その差は縮小しており、その原因は米国政府がAnthropicを制限したことで、我々がこれらの企業が持つ最も強力なモデルを利用できなくなったことに squarely 起因しています。彼らは人為的に追いつかれているのです。
Mythos と Fable の比較が見られます。Mythos は使用できませんが、Fable は頼み込んでようやくたまに使える程度です。5.6 Soul について、内部的には OpenAI が訓練した最大のモデルではないと判断されており、4.5 よりも小さいです。彼らはそれより大きなモデルを保有しています。その結果、私たちがそれにアクセスできるのは、先進的な知能が政府の許可を得た場合に限られます。
これは、後続の第4、5、6、7位のプレイヤーにとって、ある上限内で自由に行動し、ユーザーシェアを奪う機会となるが、真のフロンティアに触れることは決してできない。私は、フロンティアが今年の夏末にもう一歩前進する可能性があると考えている。あるいは、政治的な風向きがさらに変わる可能性もある。また、私たちがコード以外のモダリティを見出し、それらの分野を真正に探求できるようになる可能性もある。
ちなみに、Thinking MachinesのInklingのリリースについて言及すると、ネイティブなオーディオ入力は非常に興味深く、未来のシグナルだと思います。
Max:Inklingに関して、西側には本当に本当に本当に信頼できるオープンソースモデルが欠けています。市場がこれほど非効率であるにもかかわらず、米国企業が中国で5番目に優れたモデルにも追いつけていないことに私は驚いています。一方で、米国政府が中国のオープンソースモデルを全面的に禁止するのは時間の問題かもしれません。他方、たとえ禁止しなくても、一般の米国大企業は自社の機密データを中国のオープンソースモデルに与えることを好みません。気密データセンターに重みをロードしたとしても、CCPがあなたのデータを見ることはなくても、経営陣は納得しません。多くの企業はトークン予算を気にし、西側のモデルや中国以外のモデルのみを実行したいと考えています。Inklingは現在手に入る最良の西側OSSですが、オープンソースの最前線からまだ遠く、これに私は驚いています。
ジョーダン:以前はNeotronで、今はInkling。Inklingの戦略には二つの機会があると思う。第一に、中国のオープンソースよりも優れていないと参入できないこと。第二に、最先端のラボの2次・3次モデルやSonnetよりも優れていないといけないこと。なぜなら、BedrockやFoundryを使えば、最先端に近い知能を手に入れられ、閉源の2次モデルでコストを抑えられるからだ。西洋のオープンソースが「人を節約する」という観点は、私はいつも理解できなかった。モデルをFireworks、Together、Base10といったエコシステムに導入することは確かに良いことだが、市場の大部分は政府レベルにある。
中国製アクセラレーターのために
ジョーダン: もう一つ言えるのは、K3ブログでSFT段階で量化が行われ、ネイティブにMXFP4とMXFP8が重みとアクティベーションに使用されていることですが、公式には「広範なハードウェア互換性」とされています。ムーンショットは他のハードウェアにも気を遣っていると思いますか?
Max: 私は中国のアクセラレーター11種類のリストを持っています。SemiAnalysisのアクセラレーターモデルを購読して、さらに詳しく学ぶべきです。Huawei Ascend、Baidu Kunlun、Cambricon、Moore Threadsなど、さまざまなチップが論文やコードで登場しています。最先端のモデルを中国製アクセラレーターで動かすことは、すでに中国の国家優先事項となっています。2025年末までにGoogleを最先端のラボと呼ぶなら、今やMoonshotも最先端のラボと呼ぶべきです。
ジョーダン:話はそれますが、父が中国で出張中で、習近平がAIを中国の最優先課題として発表するというので、宿泊施設がすべて満室だと言っています。あなたが言ったことの多くは正しいです。
Harnessが製品そのものである
ジョーダン:これらのモデルを使用する中で最も感じたことは、まず、絶対的な最先端モデルにmax thinking modeを組み合わせたものと、中程度の努力で行ったものとの差がますますわかりにくくなっていることです。日常的なタスクでは、これらのモデルが対応できないことを見つけることができません。私の行動のデフォルトは、常に最大で最も難しいモードを起動することです。なぜなら、ダイランの予算は気にしていないからです。
しかし、一つの層として、Harness自体が製品の一部である。Kimi K3を試して、初めてOpen Code、Hermes、Piを真剣に検討した。Harnessは完全に製品の一部である。些細な詳細一つで、このモデルを選んであのモデルを避けることになる:リモートSSHサーバーにインストールできるか?ショートカットキーは使いやすいか?以前のコマンドを編集できるか?これらのHarness内の細部が、実際に私がトークンをどこに送るか、つまり予算をどこに割り当てるかに影響する。
Max:多くの人がトークン予算について語っていますが、あなたのワークフローの説明を見ると、GLMで対応可能なタスクであっても、Max Intelligenceを活用するためにFableにルーティングしたいと考えています。なぜなら、ROIはその価値があるからです。ベンチマークでは多くのタスクをGLMに移行できるとされていますが、あなたは依然としてAnthropicまたはOpenAIのモデルに留まりたいと考えています。
ジョーダン:基本的にそうです。しかし、私は多くのSlackボットを使用しており、その背後でどのモデルが動いているかはわかりません。たとえば、PerplexityのSlack統合がK3やGLM、Sonnetにルーティングし始めたとしても、私は気になりません。以前、使用量を確認して初めて、OpenAIモデルがどれほど使われているかがわかりました。これは、システム自身が下した決定だからです。その部分の正当化は、ハーネスが決定しているのです。
Max: これはむしろ成果ベースの価格設定の入り口です。ある研究室が成果ベースの価格設定を採用すれば、安定価格で支払われるタスクは今日ではわずかな金額で済むため、毛利95%以上を獲得できる可能性があります。
ジョーダン:第二に、これらの研究所がもうアイデアを尽くしたとは思えません。彼らはコーディング側のRSIを攻略するための驚異的なモデルの訓練を続け、それを私たちに解放せず、「永久的な下層階級」を維持できます。彼らは蒸留を続け、私たちに少し味わわせながら、動画生成、音声から音声への変換、ディープリサーチなど、コーディングとは異なる他の用途をさらに探求できます。ロボティクスやワールドモデルは単純な方向性の一つです。もしAnthropicが知識労働から肉体労働へ目標をシフトしたらどうでしょうか?彼らが世界で最も優れた技術を使って持続可能な高いROIのビジネスを構築できないとは、私は信じません。
まだ早すぎます
マックス: これらを除いても、私は毎日これらのモデルを非常に頻繁に使用しており、私のソフトウェアエンジニアの友人たちは私よりも10倍少なく使い、10倍少ない費用をかけている。Fableを使っている人とSonnetを使っている人は同じくらい使っているが、Fableを使っている人は10倍の費用をかけ、90%の粗利を生み出し、ビジネスの大部分を支えている。これらのユーザーがより大きなモデルを使い始め、使用頻度が高まれば、需要はさらに増大する。モデル自体はさらに良くなる必要すらない。そして、私はテクノロジーに詳しくない隣人とも話さなければならないが、彼らの中では私が0.1%、あるいは0.01%に過ぎず、1000倍の成長空間があるかもしれない。マサ・サン(孫正義)の「金のガチョウ指数曲線」に戻ろう。
ジョーダン:彼女が言う「まだ早すぎる」は完全に正しい。だから私は、Kimi K3 が Anthropic や OpenAI のネット増加 ARR を鈍化させないと考えている。今日 Fable や 5.6 を使っているユーザーの一部が、Kimi K3 に切り替わったとしても、その人数は、まだこの技術を本格的に試していないユーザーの数に完全に圧倒される。そうしたユーザーたちは、毎日新しい高 ROI の使用事例を発見しており、これらの新しいシナリオを解鎖するには依然として 5.6 Soul や Fable 5 をデフォルトで使うだろう。ARR の成長率が鈍化する様子は見られない。
Max: まだこのポッドキャストを購読していない人、SemiAnalysisをフォローしていない人がどれだけいるか考えてみてください。先週私はICMLに行き、その前の週はAI Engineerカンファレンスに行きました。これは名目上のAIカンファレンスですが、80%以上の人々はSemiAnalysisを聞いたことがありません。あなたはAI業界で働いていると自称しているのに、SemiAnalysisを読んだことがないのですか?私たちはまだ早すぎます。
ジョーダン:これはあなた自身へのエゴチェックだよ、マックス。落ち着いて。
