OpenAI 的 GPT-6 Astra 在 FrontierMath 第 4 級取得 97.6% 分數

iconCryptoBriefing
分享
AI summary icon精華摘要
OpenAI 的 GPT-6 Astra 在 FrontierMath 第 4 級(v2)中取得 97.6% 的成績,遠超先前內部版本在數學測試中僅得的 17%。該模型在 ARC-AGI-3 中達到 99.9%,在 ExploitBench 中取得 100%,在 GPQA Diamond 中取得 96.0%。Astra 在同一基準測試中比其前代產品 GPT-5.6 Sol 高出 14.6 個百分點。這則鏈上新聞標誌著代幣發行新聞週期中的關鍵更新。Astra 現已向 ChatGPT Plus、Pro、Business 和 Enterprise 用戶,以及 API 合作夥伴開放。

OpenAI 最新的推理模型 GPT-6 Astra 於 9 月 3 日推出,在 FrontierMath 第 4 級(v2)中取得 97.6% 的分數。這個數字令人驚訝,尤其是當你得知該模型早期的內部版本在數學能力評估中僅能達到 17% 的分數時。

從內部的 17% 到 47%,再進步到公共基準上的近完美,將通常需要數年才能實現的進展壓縮至單一開發週期中。

基準快閃

在 ARC-AGI-3 上,根據 OpenAI 自有的評估框架,Astra 取得了 99.9% 的分數。在 ExploitBench 上,它取得了完美的 100%。GPQA Diamond 是一個研究生級別的科學推理基準測試,得分為 96.0%。Terminal-Bench Science 0.1 的得分為 64.6%。

廣告

不過,FrontierMath 第 4 級(v2)的結果是主要數字。Astra 的前身 GPT-5.6 Sol 在同一基準上獲得了 83.0% 的分數,而 Astra 的 97.6% 則代表提升了 14.6 個百分點。

從 17% 到世界級

成為 Astra 的早期版本在數學能力評估中僅能處理約 17%。經過多次迭代改進,這一數字提升至約 47%,之後該模型在公開發布前進一步優化。

OpenAI 也感謝 Astra 在質數間隔這一長期困擾數學家數百年的艱深數論領域中提供了新的見解。

誰可以存取,以及何時

Astra 的推出採用分階段方式。部分機構於上線當日即可使用,隨後更廣泛的使用權限延伸至 ChatGPT Plus、Pro、Business 和 Enterprise 用戶。API 訪問可直接透過 OpenAI,以及 Azure 和 AWS Bedrock 取得。

競爭格局

獨立評估將 Astra 列為目前最優秀的 AI 模型之一,但部分評估指出,Anthropic 的某些 Claude 版本在更廣泛的智力測試中略勝一籌。

FrontierMath 從 83.0% 提升至 97.6% 表明,若 AI 數學推理存在上限,該上限尚未到達。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露