Mind Labは、748Bパラメータと4つの独立したLoRAを組み合わせたMixture-of-LoRAアーキテクチャを採用したMacaron-V1モデルを発表し、SWE-bench Verified評価で85.6点を記録してコード能力で1位を獲得しました。設立から1年にも満たないこの中国のラボは、5000万ドルの資金調達で、シリコンバレーの20億ドル規模のチームと同等の技術水準を実現しました。そのLoRA強化学習のアプローチは、チューリング賞受賞者であるRichard Sutton氏やDeepSeekの梁文鋒氏など業界リーダーから支持されています。Mind Labは同時に「継続的学習」と「群知能」の概念を提唱し、モデルがラボを離れた後も実環境で継続的に学習し協力できると主張しています。商業化からわずか2週間で1000万ドルのARRを達成し、この技術路線が実際の課題を解決できることを検証しました。記事執筆者、出典:新智元
先週、AI業界ではある話題が話題になりましたが、多くの人がその半分しか見ていませんでした。
7月15日、前OpenAI CTOのミラ・ムラティがサンフランシスコでThinking Machines Labの最初のモデル“Inkling”を発表しました。
20億ドルの資金調達、9750億パラメータ、100人のエリートチーム——シリコンバレーで最も注目を集めるAIスタートアップがついに正体を明かした。


ほぼ同じ日に、強化学習の父であるリチャード・サットン、2024年チューリング賞受賞者で、70歳近い年齢の彼は、Oak Labを設立すると発表した。
老人の元の言葉は、「現在のディープラーニング手法は脆弱で非効率であり、修正や補強ではなく、根本から再構築する必要がある。」

Suttonだけでなく、DeepSeekの創設者である梁文鋒もほぼ同じ判断を示した。
彼はAIの発展を段階的な階段に例えた:言語モデル、CoT、エージェント……そしてエージェントの次に必ず乗り越えなければならない階段は、継続的な学習である。
彼の見解では、次世代モデルの核心的な能力は継続的な学習能力であり、それがないと次世代モデルとは呼べない。もし継続的な学習を先に実現すれば、汎用知能は容易に達成できるだろう。
ある技術路線が、チューリング賞受賞者、シリコンバレーで最も注目されるAIスタートアップ、そして中国で最も革新的な大規模モデルの創設者によって同時に支持されるとき、それは単なる技術的選択ではなく、業界のコンセンサスとなる。
風向きがすでに変わった。
すべての人がシリコンバレーに注目している中、太平洋のこちら側では、設立から1年にも満たない中国の研究室が、同じ競技分野で驚きの成果を静かに提示した。
Mind Lab、正式にMacaron-V1をリリース。
Mind Labは2025年10月に設立され、Mindverse(心洲科技)傘下の先端研究ラボです。チームは30人以上で、メンバーはxAI、DeepMind、DeepSeek、字節Seed、MIT、清華大学出身です。年初に5,000万ドルのAラウンド資金調達を完了し、美团がリードインベスターを務め、蚂蚁、紅杉中国、真格などが参画しました。
この数字に注意してください:5000万ドル。後ほど再び使用します。
748Bパラメータの直接強化学習
4つのLoRAがそれぞれ担当する
まずモデルを見てください。
Macaron-V1は2つのバージョンがあります:
- フラッグシップ版Venti、748Bパラメータは、744BのGLM-5.2ベースに4つの1B LoRAを組み合わせ、ネイティブで2Mの超長コンテキストをサポートします;
- 標準版Tall、35B、Qwen-3.7に基づく後学習モデルで、Macでも実行可能。
しかし重要なのはパラメータではなく、その4つのLoRAです。
過去、LoRAはフルパラメータ微調整の「エコノミー版代替策」だった。コストを抑えられるが、性能は劣る。
Mind Labはそれを再定義しました:ベースモデルは「共通性」であり、LoRAは「個性」です。
意味は?すべてのiPhoneが同じiOSシステムを使用していますが、あなたがインストールしたアプリ、入力法の習慣、頻繁に行う操作によって、あなたのiPhoneは「あなたのiPhone」になります。
チャットは自然で共感的で、プログラミングは厳密に正確で、エージェントは複数ステップの計画を立て、ジェネレーティブUIはインタラクションを設計する——これらを一つのパラメータセットで訓練すると、互いに衝突する。
Macaron-V1のアプローチはシンプルで強引です:分解する。
4つの独立したLoRAが、チャット、Agent、プログラミング、GenUIをそれぞれ担当し、それぞれ訓練され、評価され、ロールバックされます。
実行中にルーターが動的に切り替わる——「スケジュールを手伝って」と言えばAgent LoRAを、このコードにバグがある」と言えばCoding LoRAに切り替わる。ユーザーには完全に透明である。
このアーキテクチャには正式な名前があります:Mixture-of-LoRA(MoL)——異なる能力を共有ベース上にて独立に学習し、柔軟に組み合わせ、必要に応じて呼び出します。1つのモデルにすべてをさせようとするのではなく、専門家たちが協力して働くのです。

効果面では、Macaron-V1はまだすべての機能において最強の閉源モデルには達していませんが、一連の評価において、生活シーン、コード能力、生成型UIの分野で特に優れた性能を発揮し、Opus 4.8、GPT-5.5、Gemini 3.1 Proと同等、あるいはそれ以上を達成しています。

SWE-bench認証済み——業界で最も信頼されるコード能力評価の一つ。Macaron-V1-Ventiが85.6点で第1位に輝き、第2位を3点差で上回り、DeepSeek-V4-Pro(80.6点)、MiniMax-M3(80.5点)、Kimi-K2.6(80.2点)をすべて上回りました。

さらに、Deep-SWEは長距離複雑なソフトウェア工学タスクに特化してテストされています。Macaron-V1-Ventiは58.4点を獲得し、2位はそのベースモデルであるGLM-5.2の46.2点です。同じベースモデルにLoRA強化学習を適用しただけで、12ポイントも上回りました。これが後学習がもたらす追加価値です。

さらに重要なのは、オープンウェイトでプライベートデプロイが可能であることです。閉源モデルは、たとえ性能が高くても、データは他者のサーバーを経由しなければなりません。Macaron-V1を使えば、モデルを自宅に移動させることができ、データは1バイトも外部に渡す必要がありません。
AndrewはWAICでのスピーチで、ユーザーが混ぜられたルービックキューブの写真を送ると、モデルが状態を認識し、アルゴリズムで解法を導き出し、インタラクティブな3D復元ガイドを生成する事例を紹介しました。これは、視覚理解、アルゴリズム、Agentツールの呼び出し、GenUIの4つの能力が連携する必要があります。

また、見落とされがちだが非常にハードコアな設計:ModelとHarnessの共設計。
意味は?多くのモデルのトレーニングと実際のデプロイは別々の環境です——トレーニング時に使用するツールインターフェースや実行フローが、本番環境と一致せず、パフォーマンスが低下します。
Macaron-V1は、モデルと本番環境のHarnessを最初から一緒に訓練・最適化し、訓練中にツールをどのように呼び出し、ターミナルをどのように操作し、長時間タスクをどのように実行するかを、本番リリース後もそのまま再現します。
対応するREPL Harnessにより、モデルはコードでツールを組み合わせ、中間状態を保存し、有効なプロセスを再利用できるため、毎回最初から始める必要がなく、繰り返しの呼び出しやコンテキストの無駄を削減できます。
これは単に会話するだけのモデルではなく、実行できるエージェントです。
なぜそれが「世界で唯一の2つ」なのですか?
あなたは言うかもしれない:LoRAファインチューニングに何がすごいの?至るところに溢れている。
素晴らしい点は二つの文字に集約される:規模。
30BモデルでLoRA強化学習を行うのは、多くのチームが可能である。しかし、パラメータ数が兆レベルに達すると、難易度は指数的に上昇する。
核心の課題はトレーニングと推論の不一致である。強化学習では、トレーニング中に推論を実行しフィードバックを収集する必要があるが、兆単位のパラメータを有するMoEモデルが数十枚のGPUに分割して分散された場合、トレーニング精度と推論精度にわずかな差異が生じると勾配がずれ、トレーニング曲線は収束しなくなる。
たとえば、30人の室内オーケストラが演奏する場合、少し音程がずれても何とかカバーできる。しかし、百人の交響楽団になると、どの楽器でもわずかに音程がずれただけで、全体が大惨事になる。
万亿パラメータ規模でLoRA強化学習を実行可能なチームは、世界でたった2つだけである。
一つはMira MuratiのThinking Machines Lab、もう一つはMind Labである。
第三者はいません。
2025年12月、Mind Labは、総パラメータ数1.04兆の超大規模スパースMoEモデルであるKimi K2上でLoRA強化学習を実現しました。計算リソースはフルパラメータ微調整の1/10であり、訓練曲線は安定して収束しました。
今月のLongStrawは、固定GPU算力下で強化学習後の訓練を2Mコンテキストまで推し進めました。Macaron-V1は、これらの蓄積の集大成です。
この道を歩んでいるのはMind Labだけではない。TMLのチーフサイエンティストで、OpenAIの共同設立者であり、PPOアルゴリズムの発明者であるJohn Schulmanは、2025年に『LoRA without Regret』を発表し、実験によりLoRAがほとんどの後学習シナリオでフルファインチューニングと同等の性能を発揮することを実証した。彼はこれを「低後悔領域」と呼んでいる。

業界も真の資金で投票しています。先週15億ドルのDラウンドを完了したFireworks AIは、175億ドルの評価額で、数百のLoRAをホスティングできます。Together AIは8億ドルのCラウンドを完了し、既にLoRAをデフォルトの微調整方式として採用しています。
シリコンバレーは20億を基盤に投資したが、それはその1/10で巨人の肩の上に立った
ここには非常に興味深い比較があります。
Mind LabとTMLは同じ技術路線を歩んでいるが、基盤戦略はまったく異なる。
TMLはさまざまな理由から、自らゼロからベースモデルを訓練することを選択しました。Inklingは975Bパラメータ、45兆トークンですが、Murati自身も公に認めています:「これは現在最も強力なモデルではありません。」
評価によると、InklingはGLM、Kimiなどの中国のオープンソースモデルに比べて明らかに劣っています。ゼロからベースを構築することで、大量の労力と計算リソースを消費しました。
Mind Labは逆のアプローチを取る。自らベースモデルを訓練するのではなく、中国のオープンソースモデルエコシステムの上に構築している。
Kimi K2は兆パラメータLoRA RLを検証、V1-PreviewはGLM-5.1を基盤とし、正式版VentiはGLM-5.2を使用、TallはQwen-3.7を採用——基盤モデルの毎回のアップグレードにより、後続のトレーニングのスタートラインが一段階高くなる。
中国のオープンソースモデルは、すでに世界レベルでSOTAに近い水準に達しています。このような限界に近いベースモデルに、LoRA強化学習を適用して、重要な機能を真のSOTAまで引き上げます。
あなた自身で麦を育てなくても、最高のパンを焼くことができます。
どれほど残酷でしょうか?
TML:20億ドルの資金調達、100人チーム、NVIDIAのギガワット級計算リソースと提携——しかし、Inklingの能力はGLM-5.2に劣る。
Mind Lab:30人以上、5000万ドル未満の資金調達で、Chat、Agent、Codingなど複数の分野でより強力なモデルを実現。
LoRA強化学習において、Mind Labは世界で最も効率の高いチームである。他に例はない。
継続的な学習:なぜモデルは使い続けるほど賢くなるのか?
技術と比較を説明した後、最も核心的な問題に突入します:Mind Labは一体何を狙っているのでしょうか?
答えは、リチャード・サットンとAlphaGoの元首席研究員であるデイビッド・シルバーが共同で発表した論文のタイトルに隠されている——Welcome to the Era of Experience。

プリトレーニングは「データの時代」です:モデルは人間が既に作成したテキストから学習します。
次の時代は「経験の時代」である:AIの能力は既存のデータではなく、エージェントがリアルな環境で長期的に行動し、フィードバックを受け取り、継続的に学習することから生まれる。
今日の大規模モデルの根本的な矛盾はここにある——トレーニングが完了したら凍結されるという点だ。
あるユーザーが同じエラーを10回修正したが、次回もモデルはチャット履歴を再読み込みしなければならない。あるコーディングエージェントが同じコードベースで繰り返し失敗し、失敗は新たな能力に変わらない。モデルは毎日膨大なタスクを処理するが、その経験はすべて失われてしまう。
それはただ無限に繰り返す推論エンジンであり、成長するエージェントではない。
Mind Labが目指すのは、この悪循環を断ち切ることです。彼らの目標は、「経験型インテリジェンスマシン」を構築すること——モデルがラボから出た後も、現実世界で継続的に学習し続けることです。
経験が新しい能力を生み、その新しい能力がより難しい問題を解決し、より難しい問題がさらに豊かな経験をもたらす。
知能は一度の学習の結果ではなく、継続的な成長プロセスとなる。
LoRAはもはや「コスト削減ツール」ではなく、書き込み可能でロールバック可能、独立して進化する永続的な状態である。
ベースは汎用知識を担い、LoRAはあなたの好み、コードスタイル、ビジネスロジックを担います。静的なパッチではなく、やり取りとともに成長する記憶です。
実験により、軽量アダプターモジュールをベースモデルのパラメータの0.5%以下に圧縮しても、安定して信頼性が高いことが証明されました——ベースモデルが強ければ強いほど、小規模な更新の方がより効果的です。
Mind Labはこの道を3年かけて歩んできた。2023年、創設者のAndrewはGPT-1の著者であるKarthik Narasimhanと姚順雨と共同で、FireActを発表した。これは、パラメータ学習によってエージェントの能力を向上させる最初の研究である。エージェントのトラジェクトリをパラメータに書き込むことで、1回の実行時間が9.0秒から2.7秒に短縮された。

一度の学習コストを支払えば、その後の使用はすべてリターンとなります。FireActからMacaron-V1まで、このロジックは兆パラメータのスケールに拡大されました。
群知能:第3のスケーリング曲線
継続的な学習は物語の半分に過ぎません。Macaron-V1が示すもう一つの核心的な理念、より革新的なのは、群知能です。
各モデルは自身の経験に沿って継続的に学習し、異なるインスタンスは異なる方向に進化します。異なるユーザーのフィードバック、異なるタスク、異なるデータが、それぞれ異なる能力を形作ります。同じ基盤から出発しても、時間が経つと「異なる人物」のように成長します。
この多様性はバグですか、それとも機能ですか?実験結果は非常に衝撃的です。
同じQwen3-30Bベースから出発し、学習目標とアルゴリズムは完全に同一で、データの順序とマスキングのみを変更します。
AIME24における単一のアダプターの精度:36.44%。198個の異なるアダプターによる多数決:48.67%。同じアダプターを198回繰り返しサンプリングした場合の最高精度:43.78%。
異なる「経験」が、単一のモデルでは得られない補完性をもたらす。これは「何度か試す」ことではなく、多様な学習パス間で真の協働効果が生じているのだ。

アンドリューはWAICでこれを第3のスケーリング曲線と呼びました。
第一条:GPT-3形式のスケールパラメーター——より大きなパラメーターがより高い知能をもたらす。
第2条:DeepSeek R1スタイルのScale Thinking Tokens——より多くの推論トークンでより高い知能を実現。
第3条:モデルのスケール数——より多くのモデル間の協力により、より高い知能の上限が実現します。
実験では、モデル数を数個から200個に増やしたところ、対数座標上で性能が線形的に向上した。この曲線が成り立つならば、次は200から2万、200万へと拡大する。
Mind Labが自社開発したMinTプラットフォームは、百万レベルのアドレス可能なLoRAディレクトリを構築しました。100万のLoRAが同じ兆パラメータのベースモデルを共有しています。
注意——これは100万の小さなモデルではなく、100万の1兆パラメーターを持つ大規模モデルです。
人間は99%以上を遺伝子組成を共有しているが、ほぼ同じ生物的基盤が同じ心を生み出すことはない。正是智能的多样性及其协作,带来了人类文明最伟大的成就。
2周で1000万ドルのARR:最速の商業化検証
技術路線がどれほど優れていても、市場が買わなければただのPPTに過ぎない。Mind Labは7月初めにAPIの商業化を開始する。
2週間で1,000万ドルのARR。

これは、最初のモデルリリース以来、最も速く1,000万ドルのARRを達成したモデル企業の記録である可能性があります。
数字は重要だが、より重要なのは速度である。ある技術路線がこれほど早く顧客から実際の資金による投票を受けているということは、それが真の問題、痛い問題を解決していることを示している。
Mind Labが販売しているのは、トークンだけではありません。その核心的なビジネスロジックは、顧客が自らのシナリオでモデルが継続的に学習し、進化させる能力を購入することです。
スマホメーカーは製品知識を専用LoRAに学習させ、ヘッドホンメーカーはインタラクションの好みをモデルの状態に組み込む——コアデータをベースモデル企業に渡して再学習させる必要はなく、顧客自身がコントロールを掌握する。
Shaoyin Technology、AIハードウェアスタートアップのOdyss、ある大手スマートフォンメーカーが、協力先リストに含まれています。
API呼び出しの構成も問題を示している:チャットが20%、エージェントワークフローが30%、コード生成が30%、残りはGenUIからのもの——シナリオの分布は均衡しており、単一のヒット製品に頼った偽の繁栄ではない。
エリート版は100万トークンあたり6ドル、スタンダード版は4ドル、エクスプレス版は2ドルです。
Mind Labのビジョンは一文だけです:トークンを使えるなら、トークンをトレーニングできる。
モデルの訓練は、モデルの呼び出しと同じくらい簡単であるべきです。大量の営業支援やカスタム人材は不要です。継続的な学習自体が、スケーラブルなモデルの能力です。
ドアが開いた
リチャード・サットンはトロントで「経験の時代」を叫んだ。梁文鋒は、次世代モデルと呼ぶには継続的な学習能力が必要だと考えている。ミラ・ムラティはサンフランシスコで兆パラメータのLoRA強化学習インフラを構築した。Fireworks AIの評価額は175億ドル。
すべての人が同じ方向に押している:モデルはデプロイ後も学習を継続すべきである。LoRAは、兆パラメータ規模でこれを可能にする鍵となる技術である。
Mind Labはこの分野で最も若いプレイヤーだ。しかし、そのスタートの姿勢はおそらく最も効率的だ——基盤を構築せず、中国のオープンソースエコシステムの上に立ち、30人弱と5,000万ドル未満の資金調達で、シリコンバレーの百億ドル級チームと同等の技術力を実現した。
その背後には、シンプルだが深い判断があります:
大規模モデルの競争の最終形は、「誰が最大のベースを訓練するか」ではなく、「誰がモデルを継続的に賢くできるか」にある。
プリトレーニングは一回限りのインフラです。継続的な学習こそが真の競争優位です。
Mind Labが目指すのは、経験型の知的マシン——モデルがラボを離れても、現実世界で継続的に学習し、使用するほどに賢くなるものだ。このような知能が十分に多く協力し始めると、より高度な知能への新たな道が開かれる。
Muratiは、20億ドルと100人のチームを率いて、サンフランシスコでこのドアを押し開けます。
そして、まずドアを少し開けたのは、太平洋のこの側にあり、中国のオープンソースエコシステムの上に立つ若いラボである。
