GPT-6 Astra ของ OpenAI ทำคะแนนได้ 97.6% ในระดับ FrontierMath 4

iconCryptoBriefing
แชร์
AI summary iconสรุป
GPT-6 Astra ของ OpenAI ได้คะแนน 97.6% ใน FrontierMath Tier 4 (v2) ซึ่งเป็นก้าวกระโดดอย่างมากจากเวอร์ชันภายในที่ได้คะแนนเพียง 17% ในการทดสอบคณิตศาสตร์ โมเดลนี้ยังทำคะแนนได้ 99.9% ใน ARC-AGI-3, 100% ใน ExploitBench และ 96.0% ใน GPQA Diamond Astra ทำผลงานดีกว่ารุ่นก่อนหน้า GPT-5.6 Sol ถึง 14.6 คะแนนเปอร์เซ็นต์บนมาตรฐานเดียวกัน ข่าวบนโซ่ฉบับนี้ถือเป็นการอัปเดตสำคัญในวัฏจักรข่าวการเปิดตัวโทเค็น Astra ตอนนี้พร้อมใช้งานสำหรับผู้ใช้ ChatGPT Plus, Pro, Business และ Enterprise รวมถึงพันธมิตร API

โมเดลการให้เหตุผลล่าสุดของ OpenAI ชื่อ GPT-6 Astra เปิดตัวเมื่อวันที่ 3 กันยายน โดยได้คะแนน 97.6% ใน FrontierMath Tier 4 (v2) นี่คือตัวเลขที่ทำให้คุณต้องตกใจ โดยเฉพาะเมื่อคุณรู้ว่าเวอร์ชันภายในก่อนหน้านี้ของโมเดลนี้แทบจะทำได้เพียง 17% เท่านั้นในการประเมินความสามารถด้านคณิตศาสตร์

เส้นทางจาก 17% เป็น 47% ในองค์กร แล้วไปสู่ความใกล้เคียงสมบูรณ์แบบบนแบบทดสอบภายนอก บีบอัดสิ่งที่ปกติจะรู้สึกเหมือนความก้าวหน้าหลายปีให้เหลือเพียงวงจรการพัฒนาเดียว

การแข่งขันแบบเบนช์มาร์ก

บน ARC-AGI-3 ซึ่งวัดภายในกรอบการประเมินของ OpenAI เอง Astra ได้คะแนน 99.9% บน ExploitBench ได้คะแนนเต็ม 100% GPQA Diamond ซึ่งเป็นมาตรฐานการให้เหตุผลทางวิทยาศาสตร์ระดับปริญญาโท ได้คะแนน 96.0% Terminal-Bench Science 0.1 ได้คะแนน 64.6%

โฆษณา

ผลของ FrontierMath Tier 4 (v2) เป็นตัวเลขหลัก แม้ว่า GPT-5.6 Sol ซึ่งเป็นรุ่นก่อนหน้าของ Astra จะได้คะแนน 83.0% บนเกณฑ์เดียวกัน แต่ Astra ได้คะแนน 97.6% ซึ่งแสดงถึงการปรับปรุงเพิ่มขึ้น 14.6 คะแนนเปอร์เซ็นต์

จาก 17% สู่ระดับโลก

รุ่นแรกของโมเดลที่จะกลายเป็น Astra จัดการได้ประมาณ 17% ในการประเมินความสามารถด้านคณิตศาสตร์ ผ่านการปรับปรุงแบบวนซ้ำ ตัวเลขนี้เพิ่มขึ้นเป็นประมาณ 47% ก่อนที่โมเดลจะได้รับการปรับแต่งเพิ่มเติมสำหรับการเปิดตัวอย่างเป็นทางการ

OpenAI ยังได้ให้เครดิตกับ Astra ที่มีส่วนช่วยให้เกิดความเข้าใจใหม่เกี่ยวกับช่องว่างของจำนวนเฉพาะ ซึ่งเป็นพื้นที่ที่ยากมากในทฤษฎีจำนวนและได้ดึงดูดนักคณิตศาสตร์มนุษย์มาเป็นเวลาหลายศตวรรษ

ใครได้รับสิทธิ์เข้าถึง และเมื่อใด

การเปิดตัวของ Astra ดำเนินการตามขั้นตอนเป็นระยะ องค์กรที่เลือกไว้ได้รับสิทธิ์เข้าถึงในวันเปิดตัว โดยการเข้าถึงในวงกว้างจะขยายไปยังผู้ใช้บริการ ChatGPT Plus, Pro, Business และ Enterprise ไม่นานหลังจากนั้น การเข้าถึง API มีให้ผ่าน OpenAI โดยตรง รวมถึงผ่าน Azure และ AWS Bedrock

ภูมิทัศน์การแข่งขัน

การประเมินอย่างอิสระได้จัดให้อาสตราอยู่ในกลุ่มโมเดลปัญญาประดิษฐ์ที่มีประสิทธิภาพดีที่สุดในปัจจุบัน แม้ว่าการประเมินบางฉบับจะระบุว่ารุ่นบางรุ่นของคลอดจากแอนทร์โพลิกมีประสิทธิภาพเหนือกว่าในการทดสอบความฉลาดโดยรวม

การเพิ่มขึ้นจาก 83.0% เป็น 97.6% บน FrontierMath ในหนึ่งรุ่นของโมเดลบ่งชี้ว่าขีดจำกัดของเหตุผลทางคณิตศาสตร์ของ AI ถ้ามีจริง ยังไม่ได้รับการแตะถึง

คำปฏิเสธความรับผิดชอบ: ข้อมูลในหน้านี้อาจได้รับจากบุคคลที่สาม และไม่จำเป็นต้องสะท้อนถึงมุมมองหรือความคิดเห็นของ KuCoin เนื้อหานี้จัดทำขึ้นเพื่อวัตถุประสงค์ในการให้ข้อมูลทั่วไปเท่านั้น โดยไม่มีการรับรองหรือการรับประกัน และจะไม่ถูกตีความว่าเป็นคำแนะนำทางการเงินหรือการลงทุน KuCoin จะไม่รับผิดชอบต่อความผิดพลาดหรือการละเว้นในเนื้อหา หรือผลลัพธ์ใดๆ ที่เกิดจากการใช้ข้อมูลนี้ การลงทุนในสินทรัพย์ดิจิทัลอาจมีความเสี่ยง โปรดประเมินความเสี่ยงของผลิตภัณฑ์และความเสี่ยงที่คุณยอมรับได้อย่างรอบคอบตามสถานการณ์ทางการเงินของคุณเอง โปรดดูข้อมูลเพิ่มเติมได้ที่ข้อกำหนดการใช้งานและเอกสารเปิดเผยข้อมูลความเสี่ยงของเรา