MiniMax、売上高283.1%増を報告、コスト効率の高いAIの画期的進展を主張

iconMetaEra
共有
AI summary icon概要
MiniMaxは、AIおよび暗号通貨ニュースの需要の後押しにより、上半期の売上高が283.1%成長したと発表。半期売上高は2025年予測の1.5倍に達し、粗利益は464.8%増加した。8月にはARRが8億ドルを突破し、その80%はB2Bからの収益。7月にはトークン利用が20倍に急増。創設者の閻俊傑氏は、MSAアーキテクチャを活用して長文計算コストを従来モデルの1/20まで削減した、コスト効率の高いAIの画期的進展を強調。B2B採用が加速する中、エコシステムの成長が明らかになっている。
MiniMaxは香港上場後、初の半期決算を発表。収益は前年同期比283.1%増加し、2025年通年の1.5倍に達し、毛利益は464.8%増加。8月のARRは8億ドルを突破し、B2B収益の割合は80%。7月のToken消費量は1月の20倍に達した。創業者の閻俊傑は「推理コストを最小化し、知能を最大化する」という技術路線を提唱。自社開発のMSAアーキテクチャにより、百万字級の長文における単位Token計算コストを従来の完全アテンションメカニズムの約1/20まで削減。限られた計算リソースの下で知能とコストの両立を実現し、中国製大規模モデルがグローバル競争に参戦する新たな道を切り開いた。

記事執筆者、出典:智東西

8月26日、中国のAI大規模モデルのリーディングカンパニーであるMiniMax(希宇科技)は、香港株式市場への上場以来初の半期決算を発表しました。

財務報告によると、MiniMaxの収益は前年同期比283.1%増加し、半年間の収益は2025年通年の収益の1.5倍に達した。粗利益は前年同期比464.8%増加した。

画像

財務説明会で、MiniMaxの創設者で取締役会議長、CEO、CTOの閻俊傑は、8月にMiniMaxのARRが8億ドルを突破し、B2B収益の割合が80%に達したことを明らかにした。7月のトークン消費量は1月の20倍だった。

データを除外して、私が注目したのは、閆俊傑が昨夜の業績説明会で言った一言です。彼は「最小単位の知能コストを削減することで、ようやく知能レベルを最大化できる。」と述べました。

過去2年間、大規模モデルは基本的に2つの道しかありませんでした。一つはスケーリング法則に従ってパラメータを増やして知能を高める方法で、その代償は高コストです。もう一つは効率を下げて汎用性を高める方法ですが、知能レベルはいつもやや劣ります。

業界では、これは魚と熊掌で両立できないものと默认されています。

MiniMaxはなぜ業界の「直感に反する」道を選んだのか?この道は本当に通じるのか?

知能とコスト、なぜ両立が難しいのか?

スケーリング法則は、過去数年間のAIのナラティブを駆動してきた:パラメータが大きくなるほど、知能が高くなる。

スケーリング法則に従い、現在のモデルのパラメータは2〜3Tのレベルにまで積み上げられ、モデルの知能もそれに応じて向上し、AGIの到来が叫ばれています。

繁栄の裏側で、このルールは一つの雷を埋め込んだ:モデルが兆パラメータ規模に達すると、推論コストが無視できなくなる。

エヌビディアのCEO、ジェンセン・ホアンは2026年GTCカンファレンスで、「トレーニング支出が主要なコスト要因だった時代は終わった。現在のワークロードは推論であり、急速に拡大している。」と判断した。

推論コストの膨張とエージェントのワークロードの台頭により、AIは一問一答から複数ステップの自律実行へと移行しています。単一のユーザー要求の背後には、十数回、あるいは数十回のモデル呼び出しが隠れており、これにより業界全体の計算リソースコストが指数的に上昇しています。

その結果、業界は次のように二分されていきました:

一方は高速で低コストだが、知能のパフォーマンスは並平均の小型モデル。

グーグルはこの道の典型例である。2026年7月から8月にかけて、グーグルはGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyberの4つの軽量モデルを一斉にリリースした。

画像

3.5 Flash-Liteは、3.5シリーズの中で最も高速でコストが低いモデルであり、高スループットワークロードや大規模AIエージェントシステム内の小さなタスク向けに設計されています。Gemini 3.6 Flashの出力トークン使用量は、前世代と比較して17%削減されています。

しかし、その代償は明確です。Googleはまだ、5月のI/Oカンファレンスで発表される予定だったフラッグシップモデル「Gemini 3.5 Pro」をリリースしていません。

一方は知能は高いが、導入コストが高く、コストが増加している大規模モデル。

中国の大規模モデル企業がこの道を駆け抜けている。2026年7月、月之暗面はKimi K3をリリースし、パラメータ規模は約2.8兆に達し、現在世界で最もパラメータ数が多いオープンソースモデルとなった。

アリババはその後、Qwen3.8 Maxをリリースし、パラメータ数は約2.4兆。百度の文心5.0も2.4兆パラメータに達した。DeepSeek V4-Proのパラメータ数は1.6兆。

パラメータ規模による知能の向上は目に見える。Kimi K3は複数のAgentランキングでClaude Fable 5やGPT-5.6 Solを上回った。Qwen3.8 Maxは「パラメータ規模が最大で、性能が最も優れたオープンソースモデルの一つ」と評されている。

しかしコストも上昇しています。

Kimi K3のAPI料金は、キャッシュされていない入力が100万トークンあたり6.5元から20元に、出力が27元から100元にそれぞれ上昇し、それぞれ208%、270%の増加となります。公式では、64枚以上のアクセラレーターカードを用いたスーパーノードのデプロイを推奨しています。

リリースからたった2日後、月の裏側はC端新規ユーザーのサブスクリプションを一時停止し、すべての計算リソースを既存ユーザーのサポートに充てると発表しました。

スマートさが進化するほど、モデルのパラメータは大きくなり、呼び出しコストは高くなり、導入のハードルは上がり、計算リソースはますます逼迫する……これは解けないように見えるジレンマだ。

MiniMax、選択しない

コストとスマートの二択という課題に対して、MiniMaxの選択は:両方とも手に入れる。

閆俊傑は決算説明会で、MiniMaxの全体的なロジックをほぼ明確に説明した。

計算リソースは各企業にとって限られています。私たちは「推論コストを最小化し、知性を最大化する」ことで「誰もが使える知性」を実現したいと考えています。これは私たちが一貫して貫いてきた技術路線であり、起業の原点でもあります。

「推論コストを最小化し、知性を最大化する」は、「推論コストを最小化し、知性を最大化する」という意味です。MiniMaxは、コスト削減と知性の向上を同じナラティブの枠組みに置きました。

なぜこの二つのことを一緒に言えるのか?それはMiniMaxが「推論」を異なるように理解しているからである:

第一に、推論は次世代の知性を生産するための生産資料である。

かつては推論は「モデルを使う」、トレーニングは「モデルを作る」と考えられてきた。しかし現在では、合成データ、強化学習のロールアウト、モデルの評価と検証、エージェントと環境の相互作用などの核心的なプロセスは、本質的にすべて推論負荷を実行している。

後トレーニングフェーズの全体のトレーニング計算リソースに占める割合がますます高まっている。推論は、トレーニング終了後に発生する作業量ではなく、トレーニングの全過程にわたって消費されるものとなっている。

したがって、推論効率はAPIの価格設定空間だけでなく、次世代モデルをどの程度訓練できるかを決定します。

第二に、推論コストの最適化は、知的進化の必要条件である。

計算能力には物理的な上限があり、モデル規模は継続的に拡大し続けている。推論コストを下げなければ、今後ますますコストが知能の向上を制約するようになる。

限られた計算リソース予算の中で、1ドルをいかに有効な知的生産に変換できるかが、モデルの反復をどれだけ進められるかを決定する。

第三に、最低の単位コストで最高の知能レベルを追求することは、同じ目標の両面である。

業界ではかつて、「知能優先」と「コスト優先」を二つの異なる道筋として扱ってきた。しかし、推論コストを下げられなければ、どれほど高い知能も実現できない。

簡単に言えば、MiniMaxのアプローチは、コスト最適化と知能の向上を同じこととして扱うことです。モデル設計の初日から推論効率を核心指標として、開発の全プロセスに貫いています。

閻俊傑の言葉を借りれば、「MiniMaxが目指すのは、知能とコストの間での妥協ではない。より高度な知能を追求することが目的であり、推論コストと効率の継続的な最適化を通じて、より高いコストパフォーマンスを実現することが手段である。」

コストを1/20に削減。MiniMaxは「コスト削減と知能向上」を技術的サイクルにした

MiniMaxは、このような初心に従い、一貫した技術基盤を築いてきました。

最も核心的なのは、独自開発したMSA(スパースアテンション)アーキテクチャである。簡単に言えば、このアーキテクチャは、従来のフルアテンションメカニズムと比較して、百万文字の長文における1トークンあたりの計算コストを約1/20に削減している。つまり、M3は1Mのコンテキストにおいて、1トークンあたりの計算量が前世代の1/20である。

画像

このブレイクスルーの鍵は:総パラメータ数がモデルの知識容量の上限を決定する一方で、活性化パラメータ数が単一トークンの推論コストを決定するということです。これらは分離可能です:パラメータ規模を拡大しても、推論コストが比例して上昇するとは限りません。

したがって、M3は価格を据え置きながら知能レベルを向上させることができ、M3 Proは約3兆パラメータ規模を実現しつつ、強化学習と長期タスクの訓練を推進できます。

インフラレベルで、MiniMaxのETTR(有効トレーニング時間比率)は97%を実現しており、国内で最初の規模化され、長期的に安定した計算能力システムを構築した独立した大規模モデル企業の一つである。

自社クラスタ、クラウドプロバイダー、およびTokenFactoryとの協力により算力供給ネットワークを構築し、現在および計画中の算力は、3T級のテキストモデルとビデオモデルの継続的なイテレーションを支えることができます。

まとめ:計算能力で劣る中、中国製モデルはどのように追いつくのか?

中国と米国の大規模モデルの差について語る際、ハードウェアは常に避けられない話題である。

かつては、より先進的なチッププロセスとより高い計算能力を持つ者が優れたモデルを構築できると広く信じられてきた。この論理に従えば、中国のAIは米国のAIと常に数ヶ月から半年の差を保つことになる。

これしか方法がないのでしょうか?

MiniMaxは新たな道を示した:推論コストを最小化し、知性を最大化する。

単位あたりの知能コストを削減することは、知能の上限を引き上げることでもある。今日の後学習、合成データ、強化学習は本質的に推論負荷を実行しているため、推論効率が高ければ、同じ計算リソースでより多くの実験が可能になり、知能の天井も高くなる。

より低いコストでより高い知能を生み出せる者が、限られた計算リソースの中でより広い境界を切り拓き、より高い知能をより広範な生活に導くことができる。

これは、中国製の大規模モデルがグローバル競争に参加する際に、最も有望な道かもしれない。そして、MiniMaxはすでにその検証を始めている。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。