OpenAIの最新の推論モデルGPT-6 Astraは、9月3日にリリースされ、FrontierMath Tier 4(v2)で97.6%のスコアを記録しました。これは、このモデルの以前の内部バージョンが数学能力評価でわずか17%しか達成できなかったことを知ると、驚きを禁じ得ない数値です。
内部で17%から47%へ、その後パブリックベンチマークでほぼ完璧へと進む軌跡は、通常数年かかる進歩を単一の開発サイクルに圧縮する。
ベンチマーク・ブリッツ
ARC-AGI-3では、OpenAI自体の評価ハーネスでAstraは99.9%のスコアを記録しました。ExploitBenchでは100%の完全スコアを達成しました。大学院レベルの科学的推論ベンチマークであるGPQA Diamondは96.0%でした。Terminal-Bench Science 0.1は64.6%のスコアを出しました。
ただし、FrontierMath Tier 4 (v2) の結果が主要な数値です。Astraの前身であるGPT-5.6 Solは、同じベンチマークで83.0%を記録しました。Astraの97.6%は、14.6ポイントの改善を示しています。
17%から世界クラスへ
アストラとなるモデルの初期バージョンは、数学能力評価で約17%を達成しました。反復的な改善を通じて、この数値は公開リリース前に約47%まで向上しました。
OpenAIはまた、Astraが数世紀にわたり人間の数学者たちを悩ませてきた難解な数論の分野である素数の間隔について、新たな洞察を提供したと評価している。
誰がアクセスできて、いつ
アストラの展開は段階的なアプローチを採りました。発表日には特定の組織がアクセスを獲得し、その後すぐにChatGPT Plus、Pro、Business、Enterpriseのサブスクライバーにも広く提供されました。APIアクセスは、OpenAIを通じて、またAzureおよびAWS Bedrockを通じて利用可能です。
競合環境
独立的な評価により、Astraは現在利用可能なAIモデルの中でもトップパフォーマンスの一つと評価されていますが、一部の評価では、Anthropicの特定のClaudeバージョンがより広範な知能テストでやや優れていると指摘されています。
FrontierMathで1回のモデル生成中に83.0%から97.6%へと向上したことは、AIの数学的推論に上限があるとしても、その上限はまだ達成されていないことを示唆している。
