MiniMax menerbitkan laporan separuh tahun pertama selepas pencatatan di pasaran saham Hong Kong, pendapatan meningkat 283.1% kepada 1.5 kali pendapatan tahunan 2025, keuntungan kasar meningkat 464.8%. ARR pada bulan Ogos melepasi US$800 juta, pendapatan B2B menyumbang 80%, dan penggunaan Token pada bulan Julai mencapai 20 kali ganda pada bulan Januari. Pencipta Yan Junjie mengusulkan garis panduan teknologi "meminimumkan kos inferens, memaksimumkan kecerdasan", dengan menggunakan arsitektur MSA buatan sendiri untuk mengurangkan kos pengiraan Token per unit teks panjang sebanyak satu juta kata kepada kira-kira 1/20 mekanisme perhatian penuh tradisional, mencapai keseimbangan antara kecerdasan dan kos dalam kekuatan pengiraan yang terhad, memberikan laluan baharu kepada model besar tempatan untuk bersaing secara global.Penulis artikel, sumber: Zhixidong
Pada 26 Ogos, pemimpin model AI besar China, MiniMax (Xiyu Technology), mengumumkan laporan separuh tahun pertama sejak penyenaraian di pasaran saham Hong Kong.
Laporan kewangan menunjukkan bahawa pendapatan MiniMax meningkat 283.1% secara tahunan, dengan pendapatan separuh tahun telah mencapai 1.5 kali ganda pendapatan keseluruhan tahun 2025; keuntungan kotor meningkat 464.8% secara tahunan.

Dalam sidang laporan keuangan, Yan Junjie, pendiri, ketua pihak berkuasa, CEO, dan CTO MiniMax, mengungkapkan bahawa pada bulan Ogos, ARR MiniMax melepasi 800 juta dolar AS, peratusan pendapatan B2B mencapai 80%, dan penggunaan token pada bulan Julai adalah 20 kali ganda berbanding Januari.
Selain data, perkataan yang dikatakan oleh Yan Junjie dalam sidang prestasi semalam juga menarik perhatian saya. Beliau berkata: “Hanya dengan meminimumkan kos pintar per unit, kita boleh memaksimumkan tahap kecerdasan.”
Perlu diketahui, dalam dua tahun terakhir, model besar pada dasarnya hanya memiliki dua jalan: either memperbanyak parameter mengikut hukum penskalaan untuk meningkatkan kecerdasan, dengan harga yang tinggi; atau mengurangkan kecekapan untuk membuatnya lebih boleh diakses, tetapi tahap kecerdasannya selalu kurang sedikit.
Industri ini seolah-olah menganggap ini seperti ikan dan beruang, tidak boleh didapat sekaligus.
Mengapa MiniMax memilih jalan yang "bertentangan dengan intuisi industri"? Adakah jalan ini benar-benar boleh dilalui?
Kecerdasan dan kos, mengapa sukar dicapai secara bersamaan?
Hukum Penskalaan mendorong naratif AI dalam beberapa tahun terakhir: semakin besar parameter, semakin tinggi kecerdasannya.
Mengikuti Hukum Penskalaan, parameter model kini telah ditingkatkan ke tahap 2-3T, dan kecerdasan model pun meningkat seiring itu, menyebabkan semua orang berseru bahawa AGI akan segera tiba.
Di sebalik kemakmuran, peraturan ini juga menanamkan satu ranjau: apabila model memasuki tahap parameter triliunan, kos inferens mula menjadi tidak boleh diabaikan.
CEO NVIDIA, Jensen Huang, membuat penilaian di Konvensyen GTC 2026: "Zaman di mana perbelanjaan pelatihan sebagai faktor pendorong kos utama telah berakhir. Inferens adalah beban kerja sekarang, dan ia sedang berkembang pesat."
Peningkatan kos penghujahan, ditambah dengan bangkitnya beban kerja Agent, AI sedang bergerak daripada satu soalan-jawapan kepada pelaksanaan autonomi berperingkat. Di sebalik satu permintaan pengguna, mungkin terdapat puluhan kali panggilan model, menyebabkan bil kuasa komputasi industri ini meningkat dengan laju eksponen.
Hasilnya, industri perlahan-lahan terbahagi kepada dua faksi:
Di satu sisi, model kecil dengan kelajuan pantas dan kos rendah, tetapi prestasi pintar biasa-biasa saja.
Google adalah contoh klasik jalan ini. Pada Julai hingga Ogos 2026, Google melancarkan tiga model ringan secara berturut-turut: Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, dan Gemini 3.5 Flash Cyber.

3.5 Flash-Lite adalah model paling pantas dan paling murah dalam siri 3.5, direka khas untuk beban kerja throughput tinggi dan tugas-tugas kecil dalam sistem agen AI besar. Penggunaan Token output Gemini 3.6 Flash berkurang 17% berbanding generasi sebelumnya.
Tetapi harganya juga jelas. Google masih belum melancarkan model unggulan Gemini 3.5 Pro, produk yang asalnya dijadwalkan dilancarkan pada konvensyen I/O Mei, tetapi sehingga kini belum pernah diperkenalkan.
Di sisi lain ialah model besar yang cerdas, tetapi perlu peruntukan mahal dan kos mulai meningkat.
Pembangun model besar tempatan sedang berlari pantas di jalan ini. Pada Julai 2026, Moonshot melancarkan Kimi K3 dengan skala parameter sebanyak kira-kira 2.8 trilion, menjadikannya model open-source dengan parameter terbesar di dunia semasa ini.
Ali kemudian melancarkan Qwen3.8 Max dengan jumlah parameter sekitar 2.4 trilion; Baidu Wenxin 5.0 juga mencapai 2.4 trilion parameter; DeepSeek V4-Pro mempunyai jumlah parameter 1.6 trilion.
Peningkatan kecerdasan akibat skala parameter jelas kelihatan. Kimi K3 mengatasi Claude Fable 5 dan GPT-5.6 Sol dalam pelbagai senarai agen. Qwen3.8 Max digambarkan sebagai "salah satu model sumber terbuka dengan skala parameter terbesar dan prestasi terkuat".
Tetapi kosnya juga meningkat.
Harga API Kimi K3, input bukan cache naik dari RM6.5 per juta Token menjadi RM20, dan output naik dari RM27 menjadi RM100, masing-masing meningkat 208% dan 270%. Pihak rasmi mencadangkan penggunaan 64 atau lebih kad akselerator untuk membina super-node.
Hanya dua hari selepas pelancaran, Moonshot mengumumkan penangguhan langganan pengguna baharu C-end, dengan seluruh kuasa pengiraan dialihkan untuk menjamin pengguna sedia ada.
Semakin canggih kecerdasan, semakin besar parameter model, semakin mahal panggilannya, semakin tinggi rintangan pelaksanaan, semakin langka kuasa pengiraan… Ini nampak seperti simpul yang sukar dipecahkan.
MiniMax, tidak membuat pilihan
Untuk masalah pilihan antara kos dan kecerdasan, pilihan MiniMax adalah: Saya ingin keduanya.
Yan Junjie menjelaskan keseluruhan logik MiniMax dengan jelas dalam sidang laporan keuangan:
Kuasa pengiraan adalah terhad untuk setiap syarikat. Kami berharap untuk mencapai “Intelligence with Everyone” melalui “Minimize the Inference Cost, Maximize the Intelligence”. Ini adalah jalan teknologi yang terus kami pegang, serta hasrat asal kami sebagai usahawan.
“Minimize the Inference Cost, Maximize the Intelligence” bermaksud “Meminimumkan kos inferens, memaksimumkan kecerdasan”. MiniMax meletakkan pengurangan kos dan peningkatan kecerdasan dalam kerangka naratif yang sama.
Mengapa dua perkara ini boleh disebut bersama? Kerana MiniMax memahami “penalaran” dengan cara yang berbeza:
Pertama, penalaran adalah alat produksi untuk menciptakan kecerdasan generasi seterusnya.
Dahulu, inferens dianggap sebagai “menggunakan model”, manakala latihan adalah “membina model”. Tetapi sekarang, elemen-elemen utama seperti data sintetik, Rollout pembelajaran penguatan, penilaian dan pengesahan model, serta interaksi agen dengan persekitaran, semuanya pada dasarnya menjalankan beban inferens.
Peranan fasa selepas latihan semakin meningkat dalam jumlah kuasa pengiraan keseluruhan. Inferens bukan lagi beban kerja yang muncul selepas latihan selesai, tetapi merupakan penggunaan yang berterusan sepanjang keseluruhan proses latihan.
Oleh itu, kecekapan inferens tidak hanya menentukan ruang penetapan harga API, tetapi juga menentukan sejauh mana model generasi seterusnya boleh dilatih.
Kedua, pengoptimuman kos inferens adalah syarat perlu untuk iterasi pintar.
Kuasa pengiraan mempunyai had fizikal, tetapi saiz model terus membesar. Jika kos inferens tidak dapat dikurangkan, semakin ke belakang, kos akan semakin membelenggu peningkatan kecerdasan.
Dalam anggaran kuasa pengiraan yang terhad, keupayaan untuk menukar setiap ringgit menjadi output pintar yang berkesan menentukan sejauh mana iterasi model boleh berjalan.
Ketiga, mengejar tahap kecerdasan tertinggi dengan kos kecerdasan terendah dalam unit asas—kedua-dua perkara ini adalah dua sisi daripada satu matlamat yang sama.
Industri sebelum ini biasa memandang “keutamaan pintar” dan “keutamaan kos” sebagai dua jalan yang berbeza. Tetapi jika kos inferens tidak dapat diturunkan, kecerdasan seberapa tinggi pun tidak akan dapat dilaksanakan.
Secara ringkas, pendekatan MiniMax adalah menganggap pengoptimuman kos dan peningkatan kecerdasan sebagai perkara yang sama. Dari hari pertama reka bentuk model, kecekapan inferens dijadikan indikator utama dan dipertimbangkan sepanjang kitaran pembangunan.
Menurut Yan Junjie: "MiniMax tidak mencari kompromi antara kecerdasan dan kos. Mencapai kecerdasan yang lebih tinggi adalah tujuan, sementara mencapai nilai yang lebih baik melalui pengoptimuman berterusan terhadap kos dan kecekapan inferens adalah cara."
Kos pengiraan diturunkan menjadi 1/20, MiniMax menjadikan "kurangkan kos, tingkatkan kecerdasan" sebagai lingkaran teknologi yang tertutup
MiniMax selalu memegang prinsip ini dalam membina satu asas teknologi.
Yang paling penting ialah arsitektur MSA (Sparse Attention) buatan sendiri. Dengan ringkas, ia mengurangkan kos pengiraan Token untuk teks panjang berjuta-juta perkataan kepada kira-kira 1/20 mekanisme perhatian penuh tradisional, iaitu jumlah pengiraan setiap Token M3 dalam konteks 1M hanya 1/20 generasi sebelumnya.

Kunci kepada tembusan ini ialah: jumlah parameter keseluruhan menentukan had kapasiti pengetahuan model, tetapi jumlah parameter yang diaktifkan menentukan kos inferen setiap Token. Kedua-duanya boleh dipisahkan: pengembangan skala parameter tidak semestinya membawa peningkatan kos inferen secara proporsional.
Oleh itu, M3 boleh meningkatkan tahap kecerdasan tanpa mengubah harga, manakala M3 Pro mampu mencapai skala parameter sekitar 3T sambil memajukan pembelajaran penguatan dan latihan tugas jangka panjang.
Pada peringkat infrastruktur, ETTR (nisbah masa latihan berkesan) MiniMax mampu mencapai 97%, menjadikannya salah satu syarikat model besar bebas pertama di negara ini yang membina sistem kuasa pengiraan berskala besar dan stabil jangka panjang.
Menggunakan kombinasi kerjasama antara kluster sendiri, penyedia awan, dan TokenFactory untuk membina rangkaian bekalan kuasa pengiraan, kuasa pengiraan semasa dan yang dirancang sudah mampu menyokong iterasi berterusan model teks dan video berskala 3T.
Penutup: Tanpa keunggulan dalam kekuatan pengiraan, model tempatan bergantung pada apa untuk mengejar?
Setiap kali membincangkan perbezaan antara model besar China dan Amerika Syarikat, perisian sentiasa menjadi topik yang tidak boleh dielakkan.
Dahulu, orang secara default menganggap bahawa siapa yang memiliki proses pembuatan cip yang lebih canggih dan kekuatan pengiraan yang lebih tinggi, akan mampu mencipta model yang lebih baik. Mengikut logik ini, AI China kelihatannya akan sentiasa berada sejauh beberapa bulan hingga separuh tahun di belakang AI Amerika.
Adakah ini sahaja yang boleh dilakukan?
MiniMax memberikan jalan baharu: Minimize the Inference Cost, Maximize the Intelligence.
Mengurangkan kos unit cerdas juga secara tidak langsung meningkatkan had cerdas. Kerana latihan selepas ini, data sintetik, dan pembelajaran berpenguatan pada hari ini pada dasarnya menjalankan beban inferens. Semakin tinggi kecekapan inferens, semakin banyak eksperimen yang boleh dijalankan dengan kekuatan pengiraan yang sama, dan semakin tinggi had cerdasnya.
Siapa yang mampu menghasilkan kecerdasan yang lebih tinggi dengan kos yang lebih rendah, akan mampu mendorong batas yang lebih jauh dalam pengiraan yang terhad, seterusnya membawa kecerdasan yang lebih tinggi ke dalam kehidupan yang lebih luas.
Ini mungkin merupakan satu-satunya jalan paling berpotensi bagi model besar buatan tempatan untuk bersaing secara global. Dan MiniMax sudah mulai menguji keberkesanannya.
