Mind Lab melancarkan model Macaron-V1, yang menggunakan arsitektur Mixture-of-LoRA dengan 748B parameter dan 4 LoRA terpisah, mencapai skor 85.6 dalam penilaian SWE-bench Verified, menempati peringkat teratas dalam kemampuan kod. Laboratorium China yang baru berdiri kurang dari setahun ini mencapai tingkat teknologi setara dengan pasukan senilai $2 miliar di Silicon Valley dengan pendanaan $50 juta, dengan jalan pembelajaran penguatan LoRA mereka mendapat sokongan daripada pemimpin industri seperti penerima Hadiah Turing Richard Sutton dan Liang Wenheng dari DeepSeek. Mind Lab juga mengusulkan konsep "pembelajaran berterusan" dan "kecerdasan kumpulan", menyatakan bahawa model tersebut masih boleh belajar dan bekerjasama secara berterusan dalam persekitaran sebenar selepas meninggalkan laboratorium. Dalam masa hanya dua minggu komersialisasi, ia telah mencapai ARR $10 juta, membuktikan bahawa jalan teknologi ini menyelesaikan masalah sebenar.Penulis artikel, sumber: NewZe Yuan
Minggu lepas, komuniti AI semua membincangkan satu perkara, tetapi kebanyakan orang hanya melihat separuhnya.
Pada 15 Julai, Mira Murati, CTO terdahulu OpenAI, melancarkan model pertama Thinking Machines Lab, Inkling, di San Francisco.
Pembiayaan US$2 bilion, 975B parameter, pasukan elit 100 orang—syarikat rintisan AI paling diperhatikan di Silicon Valley, akhirnya menunjukkan kartunya.


Hampir pada hari yang sama, bapa pembelajaran penguatan, Richard Sutton, penerima Hadiah Turing 2024, yang hampir tujuh puluh tahun, mengumumkan pendirian Oak Lab.
Kata-kata asal nenek moyang itu: "Kaedah pembelajaran mendalam semasa ini adalah rapuh dan tidak cekap; yang diperlukan bukanlah pembaikan separa, tetapi bermula semula dari asasnya."

Bukan hanya Sutton yang berfikir begitu. Pendiri DeepSeek, Liang Wenhong, memberikan penilaian yang hampir sama.
Dia membandingkan perkembangan AI seperti anak tangga: model bahasa, CoT, agen... dan selepas agen, anak tangga seterusnya yang mesti dilalui ialah pembelajaran berterusan.
Pandangannya ialah, kemampuan inti model generasi seterusnya ialah ia mesti mempunyai kemampuan pembelajaran berterusan, baru ia boleh dipanggil model generasi seterusnya. Jika pembelajaran berterusan dibuat terlebih dahulu, kecerdasan am mungkin akan menjadi mudah.
Apabila satu jalan teknologi didukung oleh penerima Anugerah Turing, syarikat rintisan AI paling diperhatikan di Silicon Valley, dan pendiri model besar paling inovatif di China, ia bukan lagi sekadar pilihan teknologi, tetapi satu konsensus industri.
Arah angin telah berubah.
Sementara semua orang memperhatikan Silicon Valley, di sisi Pasifik, sebuah laboratorium Cina yang baru berdiri kurang dari setahun, di lintasan yang sama, secara diam-diam menghasilkan jawapan yang mengejutkan.
Mind Lab, secara rasmi melancarkan Macaron-V1.
Mind Lab didirikan pada Oktober 2025, merupakan laboratorium penelitian canggih di bawah Mindverse. Seluruh tim terdiri dari lebih dari tiga puluh orang, dengan anggota berasal dari xAI, DeepMind, DeepSeek, ByteDance Seed, MIT, dan Tsinghua. Pada awal tahun, mereka menyelesaikan pembiayaan Seri A senilai $50 juta, dipimpin oleh Meituan, dengan partisipasi dari Ant Group, Sequoia Capital China, ZhenFund, dan lainnya.
Sila perhatikan nombor ini: $50 juta, ia akan digunakan lagi.
748B parameter direct reinforcement learning
4 LoRA masing-masing mengurus satu urusan
Lihat model terlebih dahulu.
Macaron-V1 mempunyai dua versi:
- Venti Edisi Unggul, 748B parameter, dibina daripada dasar GLM-5.2 744B ditambah empat LoRA 1B, dengan konteks panjang asli 2M;
- Versi Standard Tall, 35B, dilatih semula berdasarkan Qwen-3.7, boleh dijalankan di Mac.
Tetapi yang penting bukan parameter—tetapi 4 LoRA itu.
Dahulu, LoRA adalah versi bajet bagi penyesuaian penuh parameter. Hemat duit, tetapi kurang optimum.
Mind Lab mendefinisikan semula ia: model dasar adalah「kesamaan」, LoRA adalah「peribadi」.
Apakah maksudnya? Seperti semua iPhone menggunakan sistem iOS yang sama, tetapi aplikasi yang anda pasang, kebiasaan papan kekunci anda, dan tindakan sering anda lakukan, menjadikan iPhone anda sebagai “iPhone anda”.
Percakapan perlu alami dan empatik, pemrograman perlu tepat dan ketat, agen perlu perancangan langkah berbilang, antaramuka generatif perlu direka bentuk interaksinya—mengemas semuanya dalam satu set parameter untuk dilatih, ia akan saling bertembung.
Pendekatan Macaron-V1 adalah ringkas dan langsung: bongkar.
Empat LoRA bebas, masing-masing mengurus perbualan, Agent, pengaturcaraan, dan GenUI, dilatih secara berasingan, dinilai secara berasingan, dan dipulihkan secara berasingan.
Peralihan dinamik penerus semasa berjalan—anda katakan “bantu saya atur jadual”, gunakan Agent LoRA; anda katakan “kod ini ada bug”, alihkan ke Coding LoRA. Sepenuhnya telus kepada pengguna.
Arsitektur ini mempunyai nama rasmi: Mixture-of-LoRA (MoL) — kemampuan yang berbeza dilatih secara berasingan di atas asas bersama, digabungkan secara fleksibel, dan dipanggil mengikut keperluan. Bukan memaksa satu model menjadi ahli segala bidang, tetapi membolehkan sekumpulan pakar bekerja sama.

Dari segi prestasi, Macaron-V1 belum mencapai tahap model tertutup terkuat dalam semua kemampuan. Namun, dalam keseluruhan penilaian, ia telah mampu menyamai atau bahkan melampaui Opus 4.8, GPT-5.5, dan Gemini 3.1 Pro dalam kebanyakan tugas—terutama dalam skenario kehidupan harian, kemampuan kod, dan arah antaramuka generatif.

SWE-bench Disahkan—salah satu ujian kemampuan kod yang paling diiktiraf dalam industri, Macaron-V1-Venti memuncaki dengan skor 85.6, mengungguli pesaing kedua sebanyak 3 mata, mengalahkan DeepSeek-V4-Pro (80.6), MiniMax-M3 (80.5), dan Kimi-K2.6 (80.2).

Yang lebih mengejutkan ialah Deep-SWE, yang secara khusus menguji tugas kejuruteraan perisian jangka panjang yang kompleks. Macaron-V1-Venti mendapat skor 58.4, manakala tempat kedua ialah model asasnya, GLM-5.2, pada skor 46.2. Dengan asas yang sama, selepas dilatih dengan LoRA reinforcement learning, ia langsung meningkat sebanyak 12 poin. Inilah nilai tambah yang boleh dibawa oleh pasca-pelatihan.

Yang lebih penting: bobot terbuka, boleh dideploy secara persendirian. Walaupun model tertutup sangat kuat, data anda tetap harus melalui server orang lain. Macaron-V1 membolehkan anda membawa model kembali ke rumah anda sendiri, tanpa perlu menyerahkan sebarang bit data.
Andrew menunjukkan satu kes semasa ucapan WAIC: pengguna mengambil gambar rubik yang kacau dan menghantarnya, model mengenali keadaan, algoritma menyelesaikan, dan menghasilkan panduan 3D yang boleh diinteraktifkan—ini memerlukan empat kemampuan bekerjasama: pemahaman visual, algoritma, pemanggilan alat Agent, dan GenUI.

Satu lagi reka bentuk yang sering diabaikan tetapi sangat canggih: reka bentuk Model dan Harness secara bersamaan.
Apakah maksudnya? Kebanyakan latihan model dan pelaksanaan sebenar adalah dua persekitaran berbeza—alat dan prosedur yang digunakan semasa latihan tidak sepadan dengan persekitaran sebenar selepas pelancaran, menyebabkan prestasi menurun.
Macaron-V1 telah melatih dan mengoptimumkan model bersama Harness dalam persekitaran pengeluaran sejak awal, bagaimana alat dipanggil, bagaimana terminal dioperasikan, dan bagaimana tugas jangka panjang dijalankan semasa latihan, akan sama persis apabila dilancarkan.
REPL Harness yang disediakan membolehkan model menggabungkan alat melalui kod, menyimpan keadaan sementara, dan menggunakan semula proses yang berkesan—tanpa perlu bermula dari awal setiap kali, mengurangkan panggilan berulang dan pembaziran konteks.
Ini bukan model yang hanya boleh berchit-chat, ini adalah agen pintar yang boleh melakukan tugas.
Mengapa ia merupakan «satu-satunya di dunia»?
Anda mungkin berkata: Apa istimewanya fine-tuning LoRA? Semuanya ada di mana-mana.
Tempat yang luar biasa terletak pada dua kata: skala.
Melatih LoRA untuk model 30B, ramai pasukan mampu melakukannya. Tetapi apabila jumlah parameter meningkat ke tahap trilion, kesukaran meningkat secara eksponen.
Tantangan utama ialah ketidakselarasan antara latihan dan inferens. Pembelajaran penguatan perlu melakukan latihan dan inferens secara serentak untuk mengumpul maklum balas; apabila model MoE dengan trilion parameter dipotong dan disebarkan ke puluhan GPU, sedikit perbezaan dalam ketepatan latihan dan ketepatan inferens akan menyebabkan gradien melintang, menjadikan lengkung latihan tidak menumpu.
Sebagai perbandingan: dalam orkestra室内 beranggotakan 30 orang, sedikit ketidakakuratan nada masih boleh ditolong. Tetapi apabila menjadi orkestra simfoni seratus orang, sebarang alat muzik yang tidak selaras akan menjadikan keseluruhan pertunjukan sebagai bencana.
Hanya dua pasukan di seluruh dunia yang mampu menjalankan LoRA reinforcement learning pada skala parameter triliunan.
Satu ialah Thinking Machines Lab milik Mira Murati. Satu lagi ialah Mind Lab.
Tidak ada pihak ketiga.
Pada Disember 2025, Mind Lab berjaya menjalankan LoRA reinforcement learning pada Kimi K2—model MoE jarang super besar dengan parameter sebanyak 1.04 trilion—dengan hanya sepuluh peratus tenaga pengiraan yang diperlukan untuk fine-tuning penuh, dan lengkung latihan menunjukkan konvergensi yang stabil.
LongStraw bulan ini, sekali lagi mendorong latihan setelah pembelajaran penguatan hingga 2M konteks di bawah kekuatan GPU yang tetap. Macaron-V1 adalah persembahan terkumpul daripada semua pencapaian ini.
Jalan ini bukan hanya dilalui oleh Mind Lab. John Schulman, ilmuwan utama TML, penemu algoritma PPO dan salah seorang pendiri OpenAI, menerbitkan "LoRA without Regret" pada 2025, membuktikan melalui eksperimen bahawa LoRA dalam kebanyakan skenario pasca-pelatihan, prestasinya serupa dengan fine-tuning penuh. Beliau menyebutnya sebagai "kawasan kesilapan rendah".

Industri juga sedang memberikan suara dengan uang sungguhan. Fireworks AI, yang baru menyelesaikan putaran D sebesar US$1.5 bilion minggu lalu, memiliki valuasi US$17.5 bilion dan mampu menampung ratusan LoRA; Together AI menyelesaikan putaran C sebesar US$800 juta dan telah menjadikan LoRA sebagai cara fine-tuning bawaan.
Silicon Valley menghabiskan $2 bilion untuk membangun dasar, ia hanya menghabiskan sepuluh peratus untuk berdiri di atas bahu raksasa
Di sini ada satu perbandingan yang sangat menarik.
Mind Lab dan TML mengikuti jalan teknologi yang sama, tetapi strategi dasarnya berbeza sama sekali.
TML kerana pelbagai sebab, memilih untuk melatih model dasar sendiri dari awal. Inkling, 975B parameter, 45 trilion token—tetapi Murati sendiri secara terbuka mengakui: "Ini bukan model terkuat pada masa ini."
Ulasan menunjukkan bahawa Inkling jelas lebih lemah berbanding model open-source China seperti GLM dan Kimi. Membina asas dari sifar telah menghabiskan banyak tenaga dan kuasa pengiraan mereka.
Mind Lab sebaliknya. Ia tidak melatih model dasar sendiri, tetapi berdiri di atas bahu ekosistem model sumber terbuka China.
Kimi K2 mengesahkan LoRA RL dengan triliunan parameter, V1-Preview berasaskan GLM-5.1, versi rasmi Venti menggunakan GLM-5.2, Tall menggunakan Qwen-3.7—setiap peningkatan basis, garis permulaan latihan lanjutan menjadi lebih tinggi.
Model terbuka China telah mencapai tahap hampir SOTA secara global. Dengan menggunakan dasar yang hampir mencapai batas maksimum ini, kemampuan penting dapat ditingkatkan ke SOTA sejati melalui pembelajaran penguatan LoRA.
Anda tidak perlu menanam gandum sendiri untuk membuat roti terbaik.
Seberapa kejam perbandingan itu?
TML: Pendanaan US$2 bilion, pasukan 100 orang, kerjasama dengan kuasa komputasi gigawatt NVIDIA—kemampuan Inkling masih ketinggalan daripada GLM-5.2.
Mind Lab: Lebih daripada tiga puluh orang, pembiayaan kurang daripada 50 juta dolar AS—menghasilkan model yang lebih kuat dalam pelbagai aspek seperti Chat, Agent, dan Coding.
Dalam hal LoRA reinforcement learning, Mind Lab mungkin merupakan pasukan dengan nisbah input kepada output tertinggi di dunia. Tiada yang lain.
Pembelajaran berterusan: Mengapa model menjadi semakin pintar semakin kerap digunakan?
Setelah membincangkan teknologi dan perbandingan, tiba lah soalan paling penting: Apakah sebenarnya yang sedang dimainkan oleh Mind Lab?
Jawapannya tersembunyi dalam tajuk artikel yang diterbitkan bersama oleh Richard Sutton dan David Silver, penyelidik utama sebelumnya untuk AlphaGo — Welcome to the Era of Experience.

Pra-pelatihan adalah "era data": model belajar daripada teks yang sudah ada oleh manusia.
Era seterusnya ialah "Era Pengalaman": kemampuan AI bukan lagi berasal daripada data yang sudah ada, tetapi daripada tindakan jangka panjang, maklum balas, dan pembelajaran berterusan agen dalam persekitaran sebenar.
Perkara utama model besar hari ini ialah di sini—setelah dilatih, ia terkunci.
Seorang pengguna memperbaiki kesalahan yang sama sepuluh kali, dan model perlu membaca semula rekod perbualan setiap kali. Seorang Agen Pengekodan gagal berulang kali dalam repositori kod yang sama, dan kegagalan tidak menjadi kemampuan baru. Model mengendalikan ribuan tugas setiap hari, tetapi semua pengalaman hilang.
Ia hanyalah sebuah enjin inferensi yang mengulangi tanpa henti, bukan agen yang berkembang.
Yang perlu dilakukan oleh Mind Lab ialah memutuskan lingkaran setan ini. Mereka bertujuan untuk mencipta sebuah "mesin kecerdasan pengalaman" — model yang terus belajar di dunia nyata selepas meninggalkan makmal.
Pengalaman menjadi kemampuan baru, kemampuan baru membolehkannya menyelesaikan masalah yang lebih sukar, dan masalah yang lebih sukar membawa pengalaman yang lebih kaya.
Kecerdasan bukan lagi hasil sekali latihan, tetapi menjadi proses pertumbuhan berterusan.
LoRA di sini bukan lagi alat untuk menjimatkan kos, tetapi satu keadaan kekal yang boleh ditulis, dikembalikan, dan berkembang secara berasingan.
Basis membawa pengetahuan umum, LoRA membawa preferensi anda, gaya kod anda, logik perniagaan anda. Bukan pampas statik, tetapi ingatan yang berkembang bersama interaksi.
Eksperimen membuktikan bahawa modul penyesuaian ringan yang dikompresikan kepada kurang daripada 0.5% parameter model asas masih stabil dan boleh dipercayai—semakin kuat model asas, semakin berkesan kemas kini berskala kecil.
Mind Lab telah menempuh jalan ini selama tiga tahun. Pada 2023, pendiri Andrew bekerja sama dengan Karthik Narasimhan, penulis GPT-1, dan Yao Shunyu untuk menerbitkan FireAct—karya pertama yang meningkatkan kemampuan Agen melalui pembelajaran parameter. Setelah trajektori Agen ditulis ke dalam parameter, masa eksekusi sekali jalan turun dari 9.0 saat menjadi 2.7 saat.

Bayar sekali untuk pembelajaran, setiap penggunaan seterusnya adalah pulangan. Dari FireAct hingga Macaron-V1, logik ini diperbesarkan kepada skala trilion parameter.
Kecerdasan kumpulan: Lengkung Scaling ketiga
Pembelajaran berterusan hanyalah separuh cerita. Konsep inti kedua yang ditunjukkan oleh Macaron-V1, mungkin lebih revolusioner—kecerdasan kumpulan.
Setiap model terus belajar berdasarkan pengalaman sendiri, sehingga contoh yang berbeza akan bergerak ke arah yang berbeza. Umpan balik pengguna yang berbeza, tugas yang berbeza, dan data yang berbeza membentuk kemampuan yang berbeza. Bermula dari asas yang sama, setelah masa yang panjang, ia akan tumbuh menjadi “orang yang berbeza”.
Keragaman ini, adakah ia bug atau ciri? Keputusan eksperimen sangat mengejutkan.
Dari pangkalan Qwen3-30B yang sama, tujuan dan algoritma latihan adalah sama, hanya mengubah urutan data dan masking.
Kejituan satu adapter pada AIME24: 36.44%. 198 adapter berbeza melakukan undian majoriti: 48.67%. Pengambilan sampel berulang sebanyak 198 kali dengan adapter yang sama, maksimum hanya: 43.78%.
Pengalaman yang berbeza membawa kekomplemen yang tidak dapat diberikan oleh model tunggal. Ini bukanlah “cuba beberapa kali” — tetapi efek kolaboratif sejati yang timbul antara laluan pembelajaran yang pelbagai.

Andrew memanggil ini sebagai lengkung penskalaan ketiga di WAIC.
Peraturan pertama: Parameter Skala seperti GPT-3—parameter yang lebih besar membawa kecerdasan yang lebih tinggi.
Perkara kedua: Token Pemikiran Skala seperti DeepSeek R1—lebih banyak token penalaran membawa kecerdasan yang lebih tinggi.
Perkara ketiga: Skala Bilangan Model — Kerjasama antara lebih banyak model membawa had kecerdasan yang lebih tinggi.
Dalam eksperimen, jumlah model meningkat dari beberapa menjadi 200, dan performa meningkat secara linear pada paksi logaritma. Jika lengkung ini berlaku, langkah seterusnya adalah menggandakan dari 200 kepada 20,000, 2 juta.
Platform MinT yang dikembangkan sendiri oleh Mind Lab telah membina katalog LoRA yang boleh dialamatkan sebanyak jutaan. Sejuta LoRA berkongsi asas parameter trilion yang sama.
Perhatian—ini bukan 1 juta model kecil, tetapi 1 juta model besar dengan satu triliun parameter.
Manusia berkongsi lebih daripada 99% genom, tetapi asas biologi yang hampir sama tidak mencipta minda yang sama. Justeru, kepelbagaian kecerdasan dan kerjasama membawa kepada pencapaian terbesar tamadun manusia.
ARR US$10 juta dalam 2 minggu: Pengesahan komersial paling pantas
Walaupun jalan teknikal seindah apa pun, jika pasaran tidak membeli, ia hanyalah PPT. Mind Lab membuka komersialisasi API pada awal Julai.
Hasil 2 minggu, ARR 10 juta dolar AS.

Ini kemungkinan besar rekod terpantas untuk sebarang syarikat model dalam mencapai ARR sepuluh juta dolar AS sejak pelancaran model pertama.
Angka itu penting, tetapi yang lebih penting lagi ialah kelajuan. Sebuah jalan teknologi yang dapat dinyatakan oleh pelanggan dengan wang sungguhan secepat ini menunjukkan bahawa ia menyelesaikan masalah yang sebenar dan masalah yang mendesak.
Mind Lab bukan hanya menjual Token. Logik perniagaan intinya ialah: pelanggan membeli kemampuan model untuk terus belajar dan beriterasi dalam skenario mereka sendiri.
Pembuat telefon bimbit melatih pengetahuan produk ke dalam LoRA khas, syarikat earphone memasukkan preferensi interaksi ke dalam status model—data utama tidak perlu diberikan kepada syarikat model asas untuk dilatih semula, pelanggan mengawal sendiri.
Shaoyin Technology, AI hardware startup Odyss, dan sebuah pengeluar telefon terkemuka telah berada dalam senarai kerjasama.
Struktur panggilan API juga menunjukkan masalah: 20% perbualan, 30% alur kerja Agent, 30% penghasilan kod, baki daripada GenUI—persebaran senario seimbang, bukan kemakmuran palsu yang didorong oleh satu kejayaan besar.
Versi Unggul: US$6 per juta token, Versi Standard: US$4, Versi Cepat: US$2.
Visi yang diberikan oleh Mind Lab hanyalah satu ayat: Jika anda boleh menggunakan Token, anda boleh melatih Token.
Menglatih model seharusnya seringan memanggil model. Tidak memerlukan banyak jualan pra-penjualan, tidak memerlukan sumber daya manusia yang disesuaikan. Pembelajaran berterusan itu sendiri adalah kemampuan model yang boleh diskalakan.
Pintu topik dibuka
Richard Sutton di Toronto menyerukan "Zaman Pengalaman". Liang Wenfeng berpendapat bahawa kemampuan pembelajaran berterusan diperlukan untuk memanggil model generasi seterusnya. Mira Murati di San Francisco membina infrastruktur pembelajaran penguatan LoRA dengan trilion parameter. Penilaian Fireworks AI ialah US$17.5 bilion.
Semua orang mempertaruhkan arah yang sama: model harus terus belajar selepas dideploy. LoRA adalah teknologi kunci yang menjadikan perkara ini mungkin pada skala triliun parameter.
Mind Lab adalah peserta paling muda di litar ini. Tetapi posisi permulaannya mungkin paling efisien—tidak membuat dasar, berdiri di atas ekosistem sumber terbuka China, dengan lebih daripada tiga puluh orang dan pembiayaan kurang daripada $50 juta, mencapai kemampuan teknikal yang setara dengan pasukan bernilai puluhan miliar dolar di Silicon Valley.
Di sebaliknya adalah satu penilaian yang ringkas tetapi mendalam:
Titik akhir persaingan model besar bukan pada "siapa yang melatih dasar terbesar", tetapi pada "siapa yang boleh membuat model terus menjadi lebih pintar".
Pra-pelatihan adalah infrastruktur sekali jadi. Pembelajaran berterusan adalah parit pertahanan sebenar.
Mind Lab ingin menciptakan mesin kecerdasan pengalaman—model yang terus belajar di dunia nyata selepas meninggalkan makmal, menjadi semakin pintar semakin banyak digunakan. Apabila cukup banyak kecerdasan seperti ini bekerjasama, satu jalan baru menuju kecerdasan yang lebih tinggi akan terbuka.
Murati membuka pintu ini di San Francisco dengan dana US$2 bilion dan pasukan 100 orang.
Namun, yang terlebih dahulu mendorong sedikit pintu itu ialah sebuah laboratorium muda di sisi Pasifik, yang berdiri di atas bahu ekosistem sumber terbuka China.
