OpenAIのGPT-6 AstraがFrontierMath Tier 4で97.6%を達成

iconCryptoBriefing
共有
AI summary icon概要
OpenAIのGPT-6 Astraは、FrontierMath Tier 4(v2)で97.6%のスコアを記録し、数学テストで17%を記録した内部バージョンから大幅な進歩を遂げました。このモデルはまた、ARC-AGI-3で99.9%、ExploitBenchで100%、GPQA Diamondで96.0%を達成しました。Astraは、同じベンチマークで前任モデルであるGPT-5.6 Solを14.6ポイント上回りました。このオンチェーンニュースは、トークン発行ニュースサイクルにおける重要な更新を示しています。Astraは、現在ChatGPT Plus、Pro、Business、EnterpriseユーザーおよびAPIパートナーに利用可能です。

OpenAIの最新の推論モデルGPT-6 Astraは、9月3日にリリースされ、FrontierMath Tier 4(v2)で97.6%のスコアを記録しました。これは、このモデルの以前の内部バージョンが数学能力評価でわずか17%しか達成できなかったことを知ると、驚きを禁じ得ない数値です。

内部で17%から47%へ、その後パブリックベンチマークでほぼ完璧へと進む軌跡は、通常数年かかる進歩を単一の開発サイクルに圧縮する。

ベンチマーク・ブリッツ

ARC-AGI-3では、OpenAI自体の評価ハーネスでAstraは99.9%のスコアを記録しました。ExploitBenchでは100%の完全スコアを達成しました。大学院レベルの科学的推論ベンチマークであるGPQA Diamondは96.0%でした。Terminal-Bench Science 0.1は64.6%のスコアを出しました。

広告

ただし、FrontierMath Tier 4 (v2) の結果が主要な数値です。Astraの前身であるGPT-5.6 Solは、同じベンチマークで83.0%を記録しました。Astraの97.6%は、14.6ポイントの改善を示しています。

17%から世界クラスへ

アストラとなるモデルの初期バージョンは、数学能力評価で約17%を達成しました。反復的な改善を通じて、この数値は公開リリース前に約47%まで向上しました。

OpenAIはまた、Astraが数世紀にわたり人間の数学者たちを悩ませてきた難解な数論の分野である素数の間隔について、新たな洞察を提供したと評価している。

誰がアクセスできて、いつ

アストラの展開は段階的なアプローチを採りました。発表日には特定の組織がアクセスを獲得し、その後すぐにChatGPT Plus、Pro、Business、Enterpriseのサブスクライバーにも広く提供されました。APIアクセスは、OpenAIを通じて、またAzureおよびAWS Bedrockを通じて利用可能です。

競合環境

独立的な評価により、Astraは現在利用可能なAIモデルの中でもトップパフォーマンスの一つと評価されていますが、一部の評価では、Anthropicの特定のClaudeバージョンがより広範な知能テストでやや優れていると指摘されています。

FrontierMathで1回のモデル生成中に83.0%から97.6%へと向上したことは、AIの数学的推論に上限があるとしても、その上限はまだ達成されていないことを示唆している。

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。