OpenAI 最新的推理模型 GPT-6 Astra 於 9 月 3 日推出,在 FrontierMath 第 4 級(v2)中取得 97.6% 的分數。這個數字令人驚訝,尤其是當你得知該模型早期的內部版本在數學能力評估中僅能達到 17% 的分數時。
從內部的 17% 到 47%,再進步到公共基準上的近完美,將通常需要數年才能實現的進展壓縮至單一開發週期中。
基準快閃
在 ARC-AGI-3 上,根據 OpenAI 自有的評估框架,Astra 取得了 99.9% 的分數。在 ExploitBench 上,它取得了完美的 100%。GPQA Diamond 是一個研究生級別的科學推理基準測試,得分為 96.0%。Terminal-Bench Science 0.1 的得分為 64.6%。
不過,FrontierMath 第 4 級(v2)的結果是主要數字。Astra 的前身 GPT-5.6 Sol 在同一基準上獲得了 83.0% 的分數,而 Astra 的 97.6% 則代表提升了 14.6 個百分點。
從 17% 到世界級
成為 Astra 的早期版本在數學能力評估中僅能處理約 17%。經過多次迭代改進,這一數字提升至約 47%,之後該模型在公開發布前進一步優化。
OpenAI 也感謝 Astra 在質數間隔這一長期困擾數學家數百年的艱深數論領域中提供了新的見解。
誰可以存取,以及何時
Astra 的推出採用分階段方式。部分機構於上線當日即可使用,隨後更廣泛的使用權限延伸至 ChatGPT Plus、Pro、Business 和 Enterprise 用戶。API 訪問可直接透過 OpenAI,以及 Azure 和 AWS Bedrock 取得。
競爭格局
獨立評估將 Astra 列為目前最優秀的 AI 模型之一,但部分評估指出,Anthropic 的某些 Claude 版本在更廣泛的智力測試中略勝一籌。
FrontierMath 從 83.0% 提升至 97.6% 表明,若 AI 數學推理存在上限,該上限尚未到達。
