Model penalaran terbaru OpenAI, GPT-6 Astra, dilancarkan pada 3 September dengan skor 97,6% pada FrontierMath Tier 4 (v2). Itu adalah angka yang membuat anda menoleh dua kali, terutama apabila anda mengetahui bahawa versi dalaman sebelumnya model ini hampir tidak mampu mencapai 17% dalam penilaian kemampuan matematik.
Trajektori daripada 17% kepada 47% secara dalaman, kemudian kepada hampir sempurna pada tolok awam, mampatkan apa yang biasanya dirasakan sebagai tahun-tahun kemajuan ke dalam satu kitaran pembangunan.
Blitz tolok ukur
Pada ARC-AGI-3, diukur dalam rangka penilaian sendiri OpenAI, Astra mendapat skor 99,9%. Pada ExploitBench, ia mencapai skor sempurna 100%. GPQA Diamond, tolok ukur penalaran sains peringkat sarjana, mendapat 96,0%. Terminal-Bench Science 0.1 menghasilkan skor 64,6%.
Keputusan FrontierMath Tier 4 (v2) adalah nombor utama. GPT-5.6 Sol, pendahulu Astra, mendapat 83.0% pada tolok ukur yang sama. 97.6% Astra mewakili peningkatan 14.6 peratusan.
Dari 17% ke kelas dunia
Versi awal model yang kemudian menjadi Astra mengurus sekitar 17% dalam penilaian kemampuan matematik. Melalui peningkatan berulang, angka tersebut meningkat kepada sekitar 47% sebelum model tersebut disempurnakan lagi untuk pelancaran awam.
OpenAI juga memberi penghargaan kepada Astra atas sumbangan wawasan baru mengenai kesenjangan nombor perdana, satu bidang yang terkenal sukar dalam teori nombor yang telah menarik perhatian ahli matematik manusia selama berabad-abad.
Siapa yang mendapat akses, dan bila
Pelancaran Astra mengikuti pendekatan bertahap. Organisasi terpilih mendapat akses pada hari pelancaran, dengan ketersediaan yang lebih luas diperluaskan kepada pelanggan ChatGPT Plus, Pro, Business, dan Enterprise tidak lama selepas itu. Akses API tersedia melalui OpenAI secara langsung, serta melalui Azure dan AWS Bedrock.
Lanskap persaingan
Penilaian bebas telah menempatkan Astra di antara model AI berprestasi terbaik yang tersedia semasa ini, walaupun beberapa penilaian mencatat bahawa beberapa varian Claude daripada Anthropic unggul dalam ujian kecerdasan yang lebih luas.
Peningkatan dari 83.0% kepada 97.6% pada FrontierMath dalam satu generasi model menunjukkan bahawa had untuk penalaran matematik AI, jika ada, belum dicapai.
