OpenAIのGPT-6 Astraが、Code ArenaのWebDevランキングで1,797点を記録し、1,762点のAnthropicのClaude Fable 5.1を35点差で上回って1位を獲得しました。2026年9月3日に正式にリリースされてからたった2日で、このモデルはAI支援Web開発の順位を再定義しています。
Arena.aiが運営するリーダーボードは、従来の静的なベンチマークではありません。これは、競技チェスで使用されるような、コミュニティメンバーがAIモデルのリアルワールドのフロントエンドコーディングタスクに対するパフォーマンスを評価する、クラウドソーシングされたEloスタイルのレーティングシステムを採用しています。126のモデルに対して65万票以上が記録されており、これはAI分野で最も堅牢なコミュニティ評価の一つとなっています。
このベンチマークを特別にしているのは何ですか
従来のAIベンチマークは、固定されたデータセットと事前に定義された正解を用いてモデルを評価しますが、Code Arenaは根本的に異なるアプローチを採用しています。モデルは、複数ステップの推論、ツールの活用、反復的なコーディングワークフローに基づいて評価され、これは実際のウェブ開発に伴う、曖昧で非線形なプロセスそのものです。
GPT-6 Astraの1,797というスコアは、この特定のリーダーボードでこれまでに達成された最高点です。Anthropicの最新の競合モデルであるClaude Fable 5.1は、1,762を堅調に維持していました。
競合環境が混雑してきています
OpenAIやAnthropicだけが地位をめぐって競争しているわけではありません。9月のリーダーボードの以前のスナップショットには、中国の開発者が両社とトップランキングを競うモデルを示していました。
GPT-6 Astra (Max) および Claude Fable 5.1 (Max) は、いずれも入力トークン100万トークンあたり10ドル、出力トークン100万トークンあたり50ドルで価格が同じです。両方とも100万トークンのコンテキストウィンドウを提供します。
OpenAIは、GPT-6 Astraをソフトウェアエンジニアリングおよび関連アプリケーション向けの最高峰モデルとして位置づけています。このモデルは、現在ChatGPTのサブスクライバーおよび選ばれたAPIおよびクラウドパートナーに提供されています。
