2025年1月のほんの一瞬、オープンウェイトのAIモデルはクローズドソースの競合モデルに追いついた。ArenaのクラウドソーシングランキングでのElo評価差がゼロになった。平等。
その瞬間は過ぎ去った。2026年9月現在、最上位のクローズドフロンティアモデルとそのトップのオープンウェイト競合モデルとの間の差は、Arena AIの評価データによると29 Eloポイントに拡大している。Claude Opus 5 Maxの評価点は1505だが、最も強力なオープンウェイト競合であるMoonshot AIのKimi K3 Maxはその約30ポイント下回っている。ArenaのAI能力リーダーであるPeter Gostevは、この差異の追跡と可視化の中心にいる。
その数字が実際に何を意味するのか
経過は、単一のスナップショットよりもはるかに興味深い物語を語っている。2025年1月のゼロから2026年9月の29ポイントまで、トレンドラインはオープンウェイト支持者にとって望ましくない方向に動いている。Epoch AIの分析は、この状況を別の角度から裏付けている:オープンウェイトモデルは、最も困難なタスクでのパフォーマンスにおいて、クローズドモデルに約4ヶ月遅れている。これは、2025年末までに観察された3ヶ月の遅れから拡大した。
Arenaは月間1,000万以上の評価を処理し、合成ベンチマークではなく、膨大なリアルユーザーのインタラクションを基にしています。数百万の匿名ユーザーが一方のモデルの出力を他よりも一貫して好む場合、その信号は無視しづらくなります。
AIの測定というビジネス
アリーナ自体が魅力的なビジネスストーリーとなりました。2023年にカリフォルニア大学バークレー校の研究プロジェクトとして始まったこの企業は、年間1億ドルの収益を上げる企業へと成長しました。有料評価サービスを開始してからたった8ヶ月でこの収益水準に到達しました。
ゴステフの具体的な貢献は、モデルの弱点を明確に可視化することに集中しています。彼の研究は、ドメイン専門家による評価と一般ユーザーによる評価との間のギャップを浮き彫りにし、これは企業導入において極めて重要です。
オープンモデルの地政学
最も活発なオープンウェイトモデルの開発は、中国の研究機関に大きくシフトしている。Moonshot AIのKimiシリーズ、ZhipuのGLM、DeepSeek、そしてAlibabaのQwenは、一般に利用可能な最前線を代表している。しかし、差は依然として存在する。Anthropic、OpenAI、Google DeepMindは、引き続き自社のクローズドモデルをより速く、より先へと進化させ続けている。
