在 2025 年 1 月的短暫而美好的時刻,開放權重的 AI 模型追上了其閉源對手。Arena 的眾包排行榜上,Elo 評分差距降至零。平等。
那個時刻已經過去。根據 Arena AI 的評估數據,截至 2026 年 9 月,最頂尖的閉源前沿模型與其最強的開源權重競爭對手之間的差距已擴大至 29 個 Elo 分數。Claude Opus 5 Max 的評分為 1505,而 Moonshot AI 的 Kimi K3 Max 作為最強的開源權重競爭對手,落後近 30 分。Arena 的 AI 能力負責人 Peter Gostev 一直處於追蹤和視覺化這一差距的核心位置。
這些數字實際上代表什麼
軌跡所講述的故事,比任何單一快照都更為有趣。從2025年1月的零分,到2026年9月的29分,趨勢線對開放權重支持者而言正朝著錯誤的方向發展。Epoch AI 的分析從另一個角度強化了這一圖景:在最具挑戰性的任務上,開放權重模型的表現現已落後於閉源模型約四個月,而這比2025年底觀察到的三個月落後進一步拉大。
Arena 每月處理超過 10 億次評估,依賴龐大的真實用戶互動數據,而非合成基準。當數百萬匿名用戶持續偏好某個模型的輸出而非另一個時,這種信號更難被忽視。
衡量 AI 的商業
Arena 本身已成為一個引人入勝的商業故事。這個始於 2023 年加州大學柏克萊分校的研究項目,已轉變為一家年收入達 1 億美元的企業,僅在推出付費評估服務後八個月便達成此營收水平。
戈斯捷夫的具體貢獻在於使模型的弱點變得清晰可見。他的研究突顯了模型在領域專家評估與一般使用者評估之間的表現差異,這一區別對於企業部署至關重要。
開放模型的地緣政治
最活躍的開放權重模型開發已大幅轉向中國實驗室。Moonshot AI 的 Kimi 系列、智譜的 GLM、DeepSeek 和阿里的 Qwen 代表了目前公開可用的前沿成果。然而,差距依然存在。Anthropic、OpenAI 和 Google DeepMind 繼續更快、更遠地推進其閉源模型。
