Sebuah model dengan hanya 2 bilion parameter telah mendapat tempat pertama di antara model terbuka di bawah 4 bilion parameter di Indeks Kecerdasan Artificial Analysis v4.2, dengan skor 15 mata. MiniCPM5-2B buatan OpenBMB, yang dibangun bersama lab NLP Universiti Tsinghua dan ModelBest, direka untuk berjalan di telefon, komputer riba, dan peranti lain di mana sumber pengkomputan adalah kemewahan, bukan sesuatu yang dijamin.
Apa yang sebenarnya diukur oleh tolok ukur itu
Artificial Analysis melancarkan versi 4.2 Indeks Kecerdasannya pada 4 September 2026, hanya tiga hari sebelum MiniCPM5-2B dilancarkan. Indeks yang dikemas kini memperkenalkan perubahan bermakna kepada cara model AI dievaluasi.
Set ujian peribadi kini menempati 40% daripada berat keseluruhan, meningkat daripada versi sebelumnya. Ini penting kerana ujian peribadi sukar untuk dimanipulasi. Apabila pembangun model tidak dapat melihat soalan peperiksaan terlebih dahulu, skor menjadi isyarat yang lebih boleh dipercayai terhadap kemampuan sebenar.
Kemas kini v4.2 juga menambahkan dua komponen penilaian baharu: penilaian agen AA-Briefcase dan ujian konteks panjang GDP.pdf milik Surge. Penambahan ini mencerminkan minat industri yang semakin meningkat terhadap model yang mampu bertindak secara autonomi dan memproses dokumen yang sangat panjang, bukan sekadar menjawab soalan fakta dengan baik.
Di puncak papan pemimpin keseluruhan, model propietari masih mendominasi. Claude Fable 5.1 daripada Anthropic memimpin. Tetapi dalam kategori parameter kurang daripada 4B, di mana kecekapan dan aksesibiliti lebih penting daripada kuasa mentah, MiniCPM5-2B berada di puncak peringkat terbuka.
Model kecil, ambisi luas
MiniCPM5-2B adalah transformer padat, bermaksud setiap parameter aktif semasa inferens, bukan melalui arsitektur campuran pakar. Model padat cenderung lebih boleh diramalkan dalam penggunaan sumbernya, yang tepat apa yang anda inginkan apabila melaksanakan AI ke peranti hujung.
Model ini menyokong jendela konteks dari 131K hingga 512K token bergantung pada konfigurasi. Sebagai rujukan, 512K token kira-kira setara dengan memproses sebuah buku 1,000 muka surat dalam satu laluan.
OpenBMB telah mengoptimumkan MiniCPM5-2B untuk cip dari AMD, Intel, MediaTek, dan Qualcomm.
Dari segi kemampuan, pasukan mengklaim prestasi terkini dalam julat parameter mereka dalam pengkodean, matematik, pemahaman konteks panjang, penggunaan alat, dan alur kerja agen.
Latihan model tersebut menggabungkan penyesuaian pembelajaran penguatan dan apa yang dinyatakan oleh OpenBMB sebagai trajektori berkualiti tinggi, teknik yang direka untuk meningkatkan cara model menangani pengambilan keputusan kompleks dan berurutan.
Garisan MiniCPM
MiniCPM5-2B membina atas rekod yang telah ada. Pendahulunya, MiniCPM5-1B, sebelum ini mendapat 17.9 pada versi sebelum ini bagi Indeks Analisis Artifisial, memegang kedudukan teratas di kalangan model di bawah 2 bilion parameter.
Perbezaan penilaian antara dua model, 17.9 untuk versi 1B dan 15 untuk versi 2B, mencerminkan perubahan dalam metodologi indeks bukan langkah mundur. Ketergantungan yang lebih besar pada set ujian peribadi dan kategori penilaian baharu dalam versi 4.2 bermakna skor di antara versi tidak boleh dibandingkan secara langsung.
Apa yang ini maksudkan untuk AI pada peranti
Lanskap persaingan untuk model kecil semakin sesak. Model siri Llama Meta, model Phi Microsoft, dan pelbagai Gemma Google semua bersaing dalam julat parameter yang serupa. Kepimpinan MiniCPM5-2B dalam ujian prestasi kategori bawah 4B adalah ketara, tetapi keunggulan dalam ujian prestasi dan kegunaan dunia nyata tidak selalu bergerak serentak.
Pengesahan bebas terhadap prestasi yang diklaim oleh model belum lagi didokumenkan secara awam. Dalam penilaian AI, pengulangan hasil oleh pihak ketiga adalah perbezaan antara siaran pers dan kemampuan yang telah terbukti.
