OpenAI का GPT-6 Astra Code Arena के WebDev लीडरबोर्ड पर 1,797 के स्कोर के साथ शीर्ष स्थान पर पहुंच गया है, जिससे यह Anthropic के Claude Fable 5.1, जो 1,762 पर है, से 35 अंकों का अंतर बना रहा है। 3 सितंबर, 2026 को अपनी आधिकारिक लॉन्च के दो दिन बाद, यह मॉडल AI-सहायता वाले वेब डेवलपमेंट में पदानुक्रम को पुनर्लिख रहा है।
एरेना.एआई द्वारा संचालित लीडरबोर्ड, आमतौर पर का स्थिर बेंचमार्क नहीं है। यह एक सामुदायिक Elo-शैली की रेटिंग प्रणाली का उपयोग करता है, जो प्रतिस्पर्धी शतरंज में उपयोग की जाने वाली रैंकिंग तंत्र के समान है, जहां सामुदायिक सदस्य एआई मॉडल के वास्तविक दुनिया के फ्रंटएंड कोडिंग कार्यों को संभालने की क्षमता पर मतदान करते हैं। 126 मॉडलों के लिए 6,50,000 से अधिक मत दर्ज किए गए हैं, जिससे यह एआई क्षेत्र में सबसे मजबूत सामुदायिक मूल्यांकनों में से एक बन गया है।
यह बेंचमार्क किस बात से अलग है
पारंपरिक AI बेंचमार्क आमतौर पर मॉडल्स का परीक्षण निर्धारित सही उत्तरों वाले स्थिर डेटासेट्स के खिलाफ करते हैं। कोड एरीना एक मूलभूत रूप से अलग दृष्टिकोण अपनाता है। मॉडल्स का मूल्यांकन बहु-चरणीय तर्क, टूल का उपयोग और आवर्ती कोडिंग वर्कफ्लो पर किया जाता है, जो मूलतः वास्तविक वेब विकास में शामिल अव्यवस्थित, गैर-रेखीय प्रक्रिया है।
GPT-6 Astra का 1,797 का स्कोर इस विशिष्ट लीडरबोर्ड पर किसी भी मॉडल द्वारा प्राप्त सर्वोच्च अंक है। Claude Fable 5.1, Anthropic का नवीनतम प्रतिद्वंद्वी, 1,762 पर मजबूती से बना हुआ था।
प्रतिस्पर्धी दृश्य भीड़ भरता जा रहा है
OpenAI और Anthropic एकमात्र प्रतियोगी नहीं हैं जो पोज़ीशन के लिए लड़ रहे हैं। सितंबर के लीडरबोर्ड के पहले स्नैपशॉट्स में चीनी डेवलपर्स के मॉडल्स शीर्ष रैंकिंग के लिए दोनों कंपनियों को चुनौती दे रहे थे।
GPT-6 Astra (Max) और Claude Fable 5.1 (Max) दोनों की कीमत $10 प्रति मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन समान है। दोनों 1 मिलियन टोकन की कॉन्टेक्स्ट विंडो प्रदान करते हैं।
OpenAI ने GPT-6 Astra को सॉफ्टवेयर इंजीनियरिंग और संबंधित अनुप्रयोगों के लिए अपना सबसे उन्नत मॉडल स्थापित किया है। यह मॉडल वर्तमान में ChatGPT सदस्यों और चयनित API और क्लाउड साझेदारों के लिए उपलब्ध है।
