OpenAI 的 GPT-6 Astra 在 Code Arena 的 WebDev 排行榜上以 1,797 分奪得榜首,與排名第二的 Anthropic Claude Fable 5.1(1,762 分)拉開了 35 分的差距。該模型於 2026 年 9 月 3 日正式上線後僅兩天,便已重新定義了 AI 輔助網頁開發的排名格局。
由 Arena.ai 運營的排行榜並非傳統的靜態基準。它採用了一種眾包的 Elo 式評分系統,這種排名機制與競技國際象棋中使用的相同,社區成員會對 AI 模型處理實際前端編程任務的表現進行投票。截至目前,已針對 126 個模型累積了超過 650,000 票,使其成為 AI 領域中最堅實的社區評估之一。
這項基準有何不同
傳統的 AI 基準測試通常使用固定資料集和預設的正確答案來測試模型。Code Arena 則採用根本不同的方法,評估模型在多步推理、工具使用和迭代式編碼工作流程上的表現,這正是實際網頁開發所涉及的混亂且非線性的過程。
GPT-6 Astra 的 1,797 分是該排行榜上任何模型取得的最高分。Anthropic 最新的競爭對手 Claude Fable 5.1 原以 1,762 分穩居前列。
競爭環境正變得越來越擁擠
OpenAI 和 Anthropic 並非僅有的競爭者。九月排行榜的早期快照顯示,中國開發商的模型正在挑戰這兩家公司,爭奪頂尖排名。
GPT-6 Astra(Max)和 Claude Fable 5.1(Max)的定價相同,每百萬輸入代幣為 $10,每百萬輸出代幣為 $50。兩者均提供 1 百萬代幣的上下文窗口。
OpenAI 已將 GPT-6 Astra 定位為其最先進的軟體工程及相關應用模型。該模型目前僅提供給 ChatGPT 訂閱用戶以及特定的 API 和雲端合作夥伴使用。
