โมเดลการให้เหตุผลล่าสุดของ OpenAI ชื่อ GPT-6 Astra เปิดตัวเมื่อวันที่ 3 กันยายน โดยได้คะแนน 97.6% ใน FrontierMath Tier 4 (v2) นี่คือตัวเลขที่ทำให้คุณต้องตกใจ โดยเฉพาะเมื่อคุณรู้ว่าเวอร์ชันภายในก่อนหน้านี้ของโมเดลนี้แทบจะทำได้เพียง 17% เท่านั้นในการประเมินความสามารถด้านคณิตศาสตร์
เส้นทางจาก 17% เป็น 47% ในองค์กร แล้วไปสู่ความใกล้เคียงสมบูรณ์แบบบนแบบทดสอบภายนอก บีบอัดสิ่งที่ปกติจะรู้สึกเหมือนความก้าวหน้าหลายปีให้เหลือเพียงวงจรการพัฒนาเดียว
การแข่งขันแบบเบนช์มาร์ก
บน ARC-AGI-3 ซึ่งวัดภายในกรอบการประเมินของ OpenAI เอง Astra ได้คะแนน 99.9% บน ExploitBench ได้คะแนนเต็ม 100% GPQA Diamond ซึ่งเป็นมาตรฐานการให้เหตุผลทางวิทยาศาสตร์ระดับปริญญาโท ได้คะแนน 96.0% Terminal-Bench Science 0.1 ได้คะแนน 64.6%
ผลของ FrontierMath Tier 4 (v2) เป็นตัวเลขหลัก แม้ว่า GPT-5.6 Sol ซึ่งเป็นรุ่นก่อนหน้าของ Astra จะได้คะแนน 83.0% บนเกณฑ์เดียวกัน แต่ Astra ได้คะแนน 97.6% ซึ่งแสดงถึงการปรับปรุงเพิ่มขึ้น 14.6 คะแนนเปอร์เซ็นต์
จาก 17% สู่ระดับโลก
รุ่นแรกของโมเดลที่จะกลายเป็น Astra จัดการได้ประมาณ 17% ในการประเมินความสามารถด้านคณิตศาสตร์ ผ่านการปรับปรุงแบบวนซ้ำ ตัวเลขนี้เพิ่มขึ้นเป็นประมาณ 47% ก่อนที่โมเดลจะได้รับการปรับแต่งเพิ่มเติมสำหรับการเปิดตัวอย่างเป็นทางการ
OpenAI ยังได้ให้เครดิตกับ Astra ที่มีส่วนช่วยให้เกิดความเข้าใจใหม่เกี่ยวกับช่องว่างของจำนวนเฉพาะ ซึ่งเป็นพื้นที่ที่ยากมากในทฤษฎีจำนวนและได้ดึงดูดนักคณิตศาสตร์มนุษย์มาเป็นเวลาหลายศตวรรษ
ใครได้รับสิทธิ์เข้าถึง และเมื่อใด
การเปิดตัวของ Astra ดำเนินการตามขั้นตอนเป็นระยะ องค์กรที่เลือกไว้ได้รับสิทธิ์เข้าถึงในวันเปิดตัว โดยการเข้าถึงในวงกว้างจะขยายไปยังผู้ใช้บริการ ChatGPT Plus, Pro, Business และ Enterprise ไม่นานหลังจากนั้น การเข้าถึง API มีให้ผ่าน OpenAI โดยตรง รวมถึงผ่าน Azure และ AWS Bedrock
ภูมิทัศน์การแข่งขัน
การประเมินอย่างอิสระได้จัดให้อาสตราอยู่ในกลุ่มโมเดลปัญญาประดิษฐ์ที่มีประสิทธิภาพดีที่สุดในปัจจุบัน แม้ว่าการประเมินบางฉบับจะระบุว่ารุ่นบางรุ่นของคลอดจากแอนทร์โพลิกมีประสิทธิภาพเหนือกว่าในการทดสอบความฉลาดโดยรวม
การเพิ่มขึ้นจาก 83.0% เป็น 97.6% บน FrontierMath ในหนึ่งรุ่นของโมเดลบ่งชี้ว่าขีดจำกัดของเหตุผลทางคณิตศาสตร์ของ AI ถ้ามีจริง ยังไม่ได้รับการแตะถึง
