Sa isang maikli, magandang sandali noong Enero 2025, nakasama ng mga open-weight AI model ang kanilang closed-source na mga kalaban. Naging zero ang pagkakaiba sa Elo rating sa crowdsourced na leaderboard ng Arena. Paridad.
Nawala na ang panahong iyon. Ayon sa mga datos ng pagtataya ni Arena AI, noong Setyembre 2026, tumabas na sa 29 Elo points ang pagkakaiba sa pagitan ng pinakamahusay na closed frontier models at kanilang pinakamalakas na open-weight na kalaban. Nakatira si Claude Opus 5 Max sa rating na 1505, habang ang Kimi K3 Max ng Moonshot AI, ang pinakamalakas na open-weight na kalaban, ay naiiwan ng halos 30 points. Si Peter Gostev, ang AI Capability Lead ni Arena, ay nasa sentro ng pagsubaybay at pagpapakita ng pagkakaiba na ito.
Ano ang ibig sabihin ng mga numero
Ang trahektorya ay nagkukuwento ng mas interesanteng kuwento kaysa sa anumang isang snapshot. Mula sa zero noong Enero 2025 patungo sa 29 puntos noong Setyembre 2026, ang linya ng trend ay naglalakad sa tamang direksyon para sa mga tagasuporta ng open-weight. Ang pagsusuri ni Epoch AI ay nagpapatibay sa larawang ito mula sa ibang pananaw: ang open-weight models ay ngayon ay naiiwan ng humigit-kumulang apat na buwan sa kanilang closed counterparts sa performance sa pinakamahirap na mga gawain. Ito ay tumataas mula sa tatlong buwang lag na nakita hanggang sa huling bahagi ng 2025.
Ang Arena ay nagproseso ng higit sa 10 milyong pagtataya bawat buwan, na gumagamit ng malaking pool ng tunay na interaksyon ng mga user kaysa sa sintetikong benchmark. Kapag paulit-ulit na pinipili ng milyon-milyong anonymous na user ang isang output ng isang modelo kaysa sa isa pa, mas mahirap iwasan ang signal na ito.
Ang negosyo ng pagsukat ng AI
Ang Arena mismo ay naging isang nakakaaliw na kuwento ng negosyo. Ang nagsimula bilang isang proyekto ng pananaliksik sa UC Berkeley noong 2023 ay naging isang enterprise na kumikita ng $100 milyon sa taunang kita. Nakuha niya ang antas na iyon sa loob ng apat na buwan lamang pagkatapos mag-launch ng mga serbisyo sa bayad na pagtataya.
Ang partikular na kontribusyon ni Gostev ay nakatuon sa paggawa ng mga kahinaan ng modelo na maunawaan. Ang kanyang trabaho ay nagpapakita ng tensyon sa pagitan ng kung paano gumagana ang mga modelo kapag isinusuri ng mga eksperto sa larangan kumpara sa mga karaniwang gumagamit, isang pagkakaiba na mahalaga nang husto para sa mga enterprise deployment.
Ang geopolitika ng mga bukas na modelo
Ang pinakamalawak na pag-unlad ng open-weight model ay napalitan nang malaki patungo sa mga Chinese lab. Ang Kimi series ng Moonshot AI, ang GLM ng Zhipu, ang DeepSeek, at ang Qwen ng Alibaba ay kumakatawan sa pinakamataas na antas ng mga modelong available sa publiko. Gayunpaman, patuloy pa ang pagkakaiba. Ang Anthropic, OpenAI, at Google DeepMind ay patuloy na hahabaan at papabilisin ang kanilang mga closed model.
