2026 年,閉源 AI 模型比開源權重模型高出 29 個 Elo 分數

iconCryptoBriefing
分享
AI summary icon精華摘要
2026 年 9 月的 AI 與加密貨幣新聞顯示,閉源 AI 模型現已比開源權重模型高出 29 個 Elo 分數。Arena AI 數據將 Claude Opus 5 Max 排名為 1505,而 Moonshot AI 的 Kimi K3 Max 則落後近 30 分。這一差距反映了開源模型在複雜任務上延遲了四個月。通貨膨脹數據趨勢顯示,對此 AI 表現轉變無直接影響。

在 2025 年 1 月的短暫而美好的時刻,開放權重的 AI 模型追上了其閉源對手。Arena 的眾包排行榜上,Elo 評分差距降至零。平等。

那個時刻已經過去。根據 Arena AI 的評估數據,截至 2026 年 9 月,最頂尖的閉源前沿模型與其最強的開源權重競爭對手之間的差距已擴大至 29 個 Elo 分數。Claude Opus 5 Max 的評分為 1505,而 Moonshot AI 的 Kimi K3 Max 作為最強的開源權重競爭對手,落後近 30 分。Arena 的 AI 能力負責人 Peter Gostev 一直處於追蹤和視覺化這一差距的核心位置。

廣告

這些數字實際上代表什麼

軌跡所講述的故事,比任何單一快照都更為有趣。從2025年1月的零分,到2026年9月的29分,趨勢線對開放權重支持者而言正朝著錯誤的方向發展。Epoch AI 的分析從另一個角度強化了這一圖景:在最具挑戰性的任務上,開放權重模型的表現現已落後於閉源模型約四個月,而這比2025年底觀察到的三個月落後進一步拉大。

Arena 每月處理超過 10 億次評估,依賴龐大的真實用戶互動數據,而非合成基準。當數百萬匿名用戶持續偏好某個模型的輸出而非另一個時,這種信號更難被忽視。

衡量 AI 的商業

Arena 本身已成為一個引人入勝的商業故事。這個始於 2023 年加州大學柏克萊分校的研究項目,已轉變為一家年收入達 1 億美元的企業,僅在推出付費評估服務後八個月便達成此營收水平。

戈斯捷夫的具體貢獻在於使模型的弱點變得清晰可見。他的研究突顯了模型在領域專家評估與一般使用者評估之間的表現差異,這一區別對於企業部署至關重要。

開放模型的地緣政治

最活躍的開放權重模型開發已大幅轉向中國實驗室。Moonshot AI 的 Kimi 系列、智譜的 GLM、DeepSeek 和阿里的 Qwen 代表了目前公開可用的前沿成果。然而,差距依然存在。Anthropic、OpenAI 和 Google DeepMind 繼續更快、更遠地推進其閉源模型。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露