Ang pinakabagong modelo ng pag-iisip ng OpenAI, ang GPT-6 Astra, ay inilunsad noong Setyembre 3 na may marka na 97.6% sa FrontierMath Tier 4 (v2). Ito ang uri ng numero na nagpapakilos sa iyo, lalo na kapag natutuhan mong ang isang mas maagang bersyon ng modelo ay kahit na hindi makapag-ambag ng 17% sa mga pagtataya ng kakayahan sa matematika.
Ang paglalakbay mula sa 17% hanggang 47% sa loob, at pagkatapos ay sa halos perpekto sa mga pampublikong benchmark, ay pinipigil ang mga taon ng pag-unlad na karaniwang mararamdaman sa isang solong pag-unlad na siklo.
Ang benchmark blitz
Sa ARC-AGI-3, na-measure sa sariling evaluation harness ng OpenAI, nakamit ng Astra ang 99.9% na marka. Sa ExploitBench, nakamit nito ang perfektong 100%. Ang GPQA Diamond, isang graduate-level science reasoning benchmark, nakuha ang 96.0%. Ang Terminal-Bench Science 0.1 ay nagbigay ng 64.6% na marka.
Ang resulta ng FrontierMath Tier 4 (v2) ang pangunahing numero. Ang GPT-5.6 Sol, ang nakaraang bersyon ni Astra, ay nakakuha ng 83.0% sa parehong benchmark. Ang 97.6% ni Astra ay nagpapakita ng pagtaas ng 14.6 puntos porsyento.
Mula sa 17% patungo sa antas ng mundo
Ang mga maagang bersyon ng model na magiging Astra ay nakakamit ng halos 17% sa mga pagtataya ng matematikong kakayahan. Sa pamamagitan ng paulit-ulit na pagpapabuti, tumaas ang numerong ito sa halos 47% bago pa man mapakinabangan ang model para sa kanyang pampublikong paglabas.
Kinilala rin ni OpenAI ang Astra dahil sa pagkakaroon ng mga bagong pag-unawa tungkol sa mga prime gaps, isang kilalang mahirap na larangan sa teorya ng bilang na nananatiling nakapag-occupy sa mga tao na matematiko sa loob ng mga siglo.
Sino ang nakakakuha ng access, at kailan
Ang paglunsad ni Astra ay sumunod sa isang pahintulot na pagkakasunod-sunod. Nakakuha ng akses ang ilang organisasyon sa araw ng paglunsad, at lumawak ang mas malawak na pag-access sa mga subscriber ng ChatGPT Plus, Pro, Business, at Enterprise kaagad pagkatapos. Magagamit ang API access sa pamamagitan ng OpenAI nang direkta, pati na rin sa pamamagitan ng Azure at AWS Bedrock.
Ang kompetitibong landscape
Ang mga independiyenteng pagtataya ay isinabuhay ang Astra bilang isa sa mga pinakamahusay na nagtatrabaho na AI model sa kasalukuyan, bagaman may ilang pagtataya na nagtuturo na ang ilang mga variant ng Claude mula sa Anthropic ay mas lumalabas sa mas malawak na pagsubok sa intelehensya.
Ang pagtaas mula sa 83.0% patungo sa 97.6% sa FrontierMath sa isang model generation ay nagpapakita na ang hangganan para sa AI mathematical reasoning, kung mayroon man, ay hindi pa nababawasan.
