MiniCPM5-2B від OpenBMB посідає перше місце серед відкритих моделей з менше ніж 4 млрд параметрів за індексом Artificial Analysis v4.2

iconCryptoBriefing
Поділитися
AI summary iconКороткий зміст
MiniCPM5-2B від OpenBMB набрав 15 балів за індексом штучної аналітичної інтелігентності v4.2, посівши перше місце серед відкритих моделей з параметрами менше 4B. Розроблена спільно з лабораторією NLP університету Цінхуа та ModelBest, модель підтримує контекстні вікна до 512K токенів і оптимізована для пристроїв на краю. Аналіз у ланцюзі показує зростаючий інтерес до легковагих рішень з штучного інтелекту. Індекс страху та жадоби щодо прийняття моделей штучного інтелекту має тенденцію до зростання.

Модель з лише 2 мільярдами параметрів зайняла перше місце серед відкритих моделей з менше ніж 4 мільярдами параметрів у Індексі штучного аналізу інтелекту v4.2, набравши 15 балів. MiniCPM5-2B від OpenBMB, розроблена у співпраці з лабораторією NLP Університету Цинхуа та ModelBest, створена для роботи на телефонах, ноутбуках та інших пристроях, де обчислювальні ресурси — це роскош, а не даність.

Що фактично вимірює базовий показник

Artificial Analysis випустила версію 4.2 свого Індексу Інтелекту 4 вересня 2026 року, за три дні до запуску MiniCPM5-2B. Оновлений індекс ввів значущі зміни до способу оцінки моделей ШІ.

Приватні тестові набори зараз становлять 40% загальної ваги, що на відміну від попередніх версій. Це має значення, бо приватні тести складніше обійти. Коли розробники моделей не можуть бачити питання екзамену заздалегідь, результати стають більш надійними сигналами справжніх здібностей.

Оновлення v4.2 також додало два нові компоненти оцінки: агентну оцінку AA-Briefcase та довгоконтекстний тест Surge’s GDP.pdf. Ці додавання відображають зростаючий інтерес галузі до моделей, які можуть діяти автономно та обробляти дуже довгі документи, а не лише добре відповідати на питання-головоломки.

На вершині загального рейтингу все ще домінують власні моделі. Anthropic’s Claude Fable 5.1 лідирує. Але в категорії з менше ніж 4 млрд параметрів, де важливішою є ефективність і доступність, ніж сирою потужністю, MiniCPM5-2B посідає перше місце в рейтингу відкритих ваг.

Реклама

Мала модель, широкі амбіції

MiniCPM5-2B — це щільна трансформерна модель, що означає, що під час висновку активними є всі параметри, а не здійснюється маршрутизація через архітектуру змішаної експертної системи. Щільні моделі зазвичай більш передбачувані щодо споживання ресурсів, що саме потрібно при розгортанні ШІ на крайових пристроях.

Модель підтримує вікна контексту від 131K до 512K токенів залежно від конфігурації. Для порівняння, 512K токенів приблизно відповідає обробці книги з 1000 сторінок за один прохід.

OpenBMB оптимізував MiniCPM5-2B для чіпів від AMD, Intel, MediaTek та Qualcomm.

Щодо здібностей, команда стверджує, що досягає найсучасніших результатів у межах свого діапазону параметрів у таких галузях, як програмування, математика, розуміння довгих контекстів, використання інструментів та агентні робочі процеси.

Навчання моделі включало вирівнювання за допомогою підсиленого навчання та те, що OpenBMB описує як високоякісні траєкторії — методи, призначені для покращення того, як модель обробляє складне послідовне прийняття рішень.

Лінійка MiniCPM

MiniCPM5-2B базується на успішній історії. Його попередник, MiniCPM5-1B, раніше отримав 17.9 балів на попередній версії Індексу штучного аналізу, посівши перше місце серед моделей з менше ніж 2 мільярдами параметрів.

Різниця у балах між двома моделями: 17,9 для версії 1B і 15 для версії 2B, відображає зміни у методології індексу, а не відкат назад. Більша залежність версії 4.2 від приватних тестових наборів і нових категорій оцінки означає, що бали між версіями не є прямо порівнянними.

Що це означає для штучного інтелекту на пристрої

Конкуренція на ринку малих моделей стає все більш заповненою. Серія Llama від Meta, моделі Phi від Microsoft та варіанти Gemma від Google всі конкурують у схожих діапазонах параметрів. Лідерство MiniCPM5-2B у тестах у категорії менше 4B є помітним, але домінування у тестах і реальна корисність не завжди йдуть рука об руку.

Незалежна перевірка заявленої продуктивності моделі ще не була публічно задокументована. У бенчмаркингу ШІ третіми сторонами відтворення результатів — це різниця між прес-релізом і доведеною здатністю.

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.