Модель з лише 2 мільярдами параметрів зайняла перше місце серед відкритих моделей з менше ніж 4 мільярдами параметрів у Індексі штучного аналізу інтелекту v4.2, набравши 15 балів. MiniCPM5-2B від OpenBMB, розроблена у співпраці з лабораторією NLP Університету Цинхуа та ModelBest, створена для роботи на телефонах, ноутбуках та інших пристроях, де обчислювальні ресурси — це роскош, а не даність.
Що фактично вимірює базовий показник
Artificial Analysis випустила версію 4.2 свого Індексу Інтелекту 4 вересня 2026 року, за три дні до запуску MiniCPM5-2B. Оновлений індекс ввів значущі зміни до способу оцінки моделей ШІ.
Приватні тестові набори зараз становлять 40% загальної ваги, що на відміну від попередніх версій. Це має значення, бо приватні тести складніше обійти. Коли розробники моделей не можуть бачити питання екзамену заздалегідь, результати стають більш надійними сигналами справжніх здібностей.
Оновлення v4.2 також додало два нові компоненти оцінки: агентну оцінку AA-Briefcase та довгоконтекстний тест Surge’s GDP.pdf. Ці додавання відображають зростаючий інтерес галузі до моделей, які можуть діяти автономно та обробляти дуже довгі документи, а не лише добре відповідати на питання-головоломки.
На вершині загального рейтингу все ще домінують власні моделі. Anthropic’s Claude Fable 5.1 лідирує. Але в категорії з менше ніж 4 млрд параметрів, де важливішою є ефективність і доступність, ніж сирою потужністю, MiniCPM5-2B посідає перше місце в рейтингу відкритих ваг.
Мала модель, широкі амбіції
MiniCPM5-2B — це щільна трансформерна модель, що означає, що під час висновку активними є всі параметри, а не здійснюється маршрутизація через архітектуру змішаної експертної системи. Щільні моделі зазвичай більш передбачувані щодо споживання ресурсів, що саме потрібно при розгортанні ШІ на крайових пристроях.
Модель підтримує вікна контексту від 131K до 512K токенів залежно від конфігурації. Для порівняння, 512K токенів приблизно відповідає обробці книги з 1000 сторінок за один прохід.
OpenBMB оптимізував MiniCPM5-2B для чіпів від AMD, Intel, MediaTek та Qualcomm.
Щодо здібностей, команда стверджує, що досягає найсучасніших результатів у межах свого діапазону параметрів у таких галузях, як програмування, математика, розуміння довгих контекстів, використання інструментів та агентні робочі процеси.
Навчання моделі включало вирівнювання за допомогою підсиленого навчання та те, що OpenBMB описує як високоякісні траєкторії — методи, призначені для покращення того, як модель обробляє складне послідовне прийняття рішень.
Лінійка MiniCPM
MiniCPM5-2B базується на успішній історії. Його попередник, MiniCPM5-1B, раніше отримав 17.9 балів на попередній версії Індексу штучного аналізу, посівши перше місце серед моделей з менше ніж 2 мільярдами параметрів.
Різниця у балах між двома моделями: 17,9 для версії 1B і 15 для версії 2B, відображає зміни у методології індексу, а не відкат назад. Більша залежність версії 4.2 від приватних тестових наборів і нових категорій оцінки означає, що бали між версіями не є прямо порівнянними.
Що це означає для штучного інтелекту на пристрої
Конкуренція на ринку малих моделей стає все більш заповненою. Серія Llama від Meta, моделі Phi від Microsoft та варіанти Gemma від Google всі конкурують у схожих діапазонах параметрів. Лідерство MiniCPM5-2B у тестах у категорії менше 4B є помітним, але домінування у тестах і реальна корисність не завжди йдуть рука об руку.
Незалежна перевірка заявленої продуктивності моделі ще не була публічно задокументована. У бенчмаркингу ШІ третіми сторонами відтворення результатів — це різниця між прес-релізом і доведеною здатністю.
