Tinatapos ni OpenBMB's MiniCPM5-2B ang mga open model na mas mababa sa 4B parameters sa Artificial Analysis Index v4.2

iconCryptoBriefing
I-share
AI summary iconSummary
Nakakuha ang MiniCPM5-2B ng OpenBMB ng 15 puntos sa Artificial Analysis Intelligence Index v4.2, nasa unang puwesto sa mga open model na mas mababa sa 4B parameters. Ipinagawa kasama ng NLP lab ng Tsinghua University at ModelBest, suportahan ng model ang 512K token context windows at optimal para sa edge devices. Ipinapakita ng on-chain analysis ang pagtaas ng interes sa mga lightweight AI solutions. Ang fear and greed index para sa pagtatanggap ng AI model ay umuunlad.

May modelo na may 2 bilyon na parameter lamang ang nakuha ang unang puwesto sa pagkakasunod-sunod ng mga bukas na modelo sa ilalim ng 4 bilyon na parameter sa Artificial Analysis Intelligence Index v4.2, na may marka na 15 puntos. Ang MiniCPM5-2B ng OpenBMB, na binuo sa pamamagitan ng kolaborasyon ng NLP lab ng Tsinghua University at ModelBest, ay disenyo upang magsagawa sa mga telepono, laptop, at iba pang mga device kung saan ang mga yunit ng komputasyon ay isang luho, hindi isang ibinigay.

Ano ang tunay na sinusukat ng benchmark

I-release ng Artificial Analysis ang bersyon 4.2 ng kanyang Intelligence Index noong Setyembre 4, 2026, tatlong araw bago mag-launch ang MiniCPM5-2B. Ang updated na index ay nagdala ng makabuluhang pagbabago sa paraan ng pag-evaluate sa mga AI model.

Ang mga pribadong test set ay ngayon ay nagtatampok ng 40% ng kabuuang bigat, tumaas mula sa mga nakaraang bersyon. Mahalaga ito dahil mas mahirap manipulahin ang mga pribadong test. Kapag hindi makakakita ang mga developer ng model ng mga tanong sa pagsusulit sa harap, mas kredible ang mga marka bilang tumpak na signal ng tunay na kakayahan.

Dinagdagan ng v4.2 update ang dalawang bagong komponente sa pagtataya: ang AA-Briefcase agentic evaluation at ang Surge’s GDP.pdf long-context test. Ipinaliliwanag ng mga dagdag na ito ang paglalago ng interes ng industriya sa mga modelo na kayang mag-act nang awtonomo at prosesuhin ang napakahabang dokumento, hindi lamang magandang sagutin ang mga tanong sa trivia.

Sa tuktok ng pangkalahatang leaderboard, patuloy pa ring dominanteng ang mga proprietary na modelo. Nagtatampok si Claude Fable 5.1 ng Anthropic. Ngunit sa kategorya ng mas mababa sa 4B na parameter, kung saan ang efficiency at accessibility ay mas mahalaga kaysa sa raw power, nasa tuktok ang MiniCPM5-2B sa mga open-weight rankings.

Paghahayag

Maliit na modelo, malawak na pangarap

Ang MiniCPM5-2B ay isang dense transformer, na nangangahulugan na aktibo ang bawat parameter habang nagpapatakbo kaysa mag-route sa isang mixture-of-experts architecture. Ang mga dense model ay karaniwang mas maipagmamalaki sa kanilang paggamit ng mga yunit, kung ano ang nais mo kapag ipinapalabas ang AI sa edge devices.

Ang modelo ay sumusuporta sa mga context window na nangangahulugan mula sa 131K hanggang 512K na mga token ayon sa konfigurasyon. Para sa paghahambing, ang 512K na mga token ay katumbas ng pagproseso ng isang aklat na may 1,000 na pahina sa isang pagkakataon.

Optimized ng OpenBMB ang MiniCPM5-2B para sa mga chip mula sa AMD, Intel, MediaTek, at Qualcomm.

Sa aspeto ng kakayahan, sinasabing may pinakamataas na performance ang team sa loob ng kanilang parameter range sa pag-code, matematika, pag-unawa sa mahabang konteksto, paggamit ng mga kasangkapan, at agentic workflows.

Ang pagtatrain ng modelo ay naglalaman ng reinforcement learning alignment at kung ano ang inilalarawan ng OpenBMB bilang mataas na kalidad na trajectories, mga teknik na disenyo upang mapabuti kung paano ang modelo ay nakahahandle ng mga kumplikadong, sekwensyal na pagdedesisyon.

Ang mga lahi ng MiniCPM

Binubuo ng MiniCPM5-2B ang isang track record. Ang kanyang nakaraang bersyon, MiniCPM5-1B, ay nakakuha ng 17.9 sa isang mas lumang bersyon ng Artificial Analysis Index, at nakuha ang unang position sa mga model na mas maliit sa 2 bilyong parameter.

Ang pagkakaiba sa pagsusuri sa pagitan ng dalawang modelo, 17.9 para sa bersyon na 1B at 15 para sa bersyon na 2B, ay nagpapakita ng pagbabago sa metodolohiya ng index kaysa sa isang pagbagsak. Ang mas malaking pagkakasalig ng bersyon 4.2 sa mga pribadong test set at mga bagong kategorya ng pagsusuri ay nangangahulugan na ang mga score sa iba’t ibang bersyon ay hindi direktang ikukumpara.

Ano ang ibig sabihin nito para sa AI sa device

Nagiging mas puno ang kompetisyon para sa mga maliit na modelo. Ang Llama series ni Meta, ang mga Phi model ni Microsoft, at ang mga Gemma variants ni Google ay lahat ay kumikita sa magkakaparehong saklaw ng parameter. Ang pagiging lider ni MiniCPM5-2B sa benchmark sa kategoryang ilalim ng 4B ay nakakatanda, ngunit ang pagiging dominanteng benchmark at ang tunay na paggamit ay hindi laging naglalakad nang sabay.

Hindi pa publiko na dokumentado ang independiyenteng pagpapatotoo sa ipinahayag na performance ng modelo. Sa AI benchmarking, ang pagrereproduksyon ng mga resulta ng isang third-party ang pagkakaiba sa pagitan ng isang press release at isang patunay na kakayahan.

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.