OpenAI’nin GPT-6 Astra’sı, Code Arena’nın WebGeliştirme liderlik tablosunda 1.797 puanla birinci oldu ve 1.762 puanla ikinci sırada olan Anthropic’in Claude Fable 5.1’den 35 puan önde. Model, 3 Eylül 2026’da resmi olarak başlatıldıktan iki gün sonra, yapay zeka destekli web geliştirme alanında sıralamayı yeniden yazıyor.
Arena.ai tarafından işletilen liderlik tablosu, tipik bir statik referans değildir. Topluluk üyeleri, AI modellerinin gerçek dünya ön uç kodlama görevlerini ne kadar iyi yürüttüğünü oylar; bu, rekabetçi satrançta kullanılan aynı türde bir Elo tarzı puanlama sistemidir. 126 model üzerinde toplam 650.000'den fazla oy kaydedilmiştir; bu, AI alanında en güçlü topluluk değerlendirmelerinden biridir.
Bu performans ölçütünü farklı kılan nedir
Geleneksel Yapay Zeka performans testleri, modelleri önceden belirlenmiş doğru cevaplarla sabit veri kümelerine karşı test eder. Code Arena, tamamen farklı bir yaklaşım benimser. Modeller, çok adımlı muhakeme, araç kullanımı ve yinelemeli kodlama iş akışları üzerinde değerlendirilir; temel olarak, gerçek web geliştirme sürecini içeren karmaşık, doğrusal olmayan süreçler.
GPT-6 Astra'nın 1.797 puanı, bu özel liderlik tablosunda bir modelin elde ettiği en yüksek puandır. Anthropic'ın en son rakibi Claude Fable 5.1, 1.762 puanla güçlü bir pozisyon koruyordu.
Rekabet ortamı giderek kalabalıklaşıyor
OpenAI ve Anthropic, pozisyon için yarışan tek oyuncular değil. Eylül ayı liderlik tablosundan önceki görüntüler, Çinli geliştiricilerin modellerinin her iki şirketi de üst sıralarda zorladığını gösterdi.
GPT-6 Astra (Max) ve Claude Fable 5.1 (Max), her ikisi de milyon girdi token başına 10 dolar ve milyon çıktı token başına 50 dolar fiyatla sunulmaktadır. Her ikisi de 1 milyon tokenlık bir bağlam penceresi sunmaktadır.
OpenAI, GPT-6 Astra'yı yazılım mühendisliği ve ilgili uygulamalar için en gelişmiş modeli olarak konumlandırdı. Model şu anda ChatGPT abonelerine ve seçili API ile bulut ortaklarına sunulmaktadır.
