GPT-6 Astra, ARC-AGI-3 testinde %100'e yakın bir puan alarak dikkat çekti. Bu model, gerçek dünyayı mantıksal semboller ve neden-sonuç kodlarına dönüştürerek verimli bir "sembolik dünya modeli" oluşturuyor ve bilinmeyen grafik oyunlarda kendi kendine DSL cebirsel sembol sistemleri oluşturarak ortam kurallarını kaydediyor, ardından "sanal kum kütüğü" oluşturarak simülasyon yaparak harekete geçiyor. Ancak yüksek puanın ardında, her soru için 360 dolarlık, toplamda 18.000 dolarlık pahalı hesaplama maliyeti bulunuyor. ARC Ödülü Vakfı Başkanı Greg Kamradt, yüksek puanların Harness dışarı çerçevesine bağlı olduğunu ve gerçek bir AGI atılımı olmadığını, sadece yapay zekânın daha akıllı hale geldiğini kanıtladığını belirtti.Yazan: LeiFeng.com

Her soruda 360 dolar yakıyor, GPT-6 gerçekten AGI'yi geçti mi?
OpenAI'nin en güçlü modeli GPT-6 Astra nihayet göründü ve bilgisayar işlemleri, bilimsel araştırmalar ve güvenlik savunmasında şaşırtıcı ilerlemeler kaydetti. Çok sayıda dikkat çekici başarı arasında, büyük ilgi gören en önemli başarı, ARC-AGI-3 testinde %100'e yaklaşan performansıdır.

ARC-AGI-3 nedir? Bu, şu anda küresel teknoloji dünyasında kabul görmüş AI "zeka" değerlendirme listesidir; AI dünyasının Mensa kulübü giriş sınavı olarak düşünebilirsiniz.
Bu testte sürekli değişen grafik kalıpları soruları yer alıyor, soru çözmek mümkün değil; AI, insanlar gibi ortamı keşfetmeli, hedefi tahmin etmeli ve anlık tepkilerle ve akıl yürütme yeteneğiyle kalıpları bulmalı. Bu, çeşitli değerlendirmelerde daha ileri seviyede olup, AI'nın sadece bir araç mı yoksa gerçek zeka mı olduğunu daha iyi test eder.
GPT-6 Astra, bu testi tamamen aşmayı başardı; önceki model olan GPT-5.6 Sol'un skoru sadece %38,3 idi, bu gerçekten büyük bir sıçrama. Bu zeka, insanları bile ezdi; %96'lık tüm seviyelerde, insanlardan daha yüksek işlem verimliliğine sahip oldu ve ortalama işlem adımı sayısı insanlardan %51,7 daha az.
Eğer bir yapay zeka, tamamen tanımadığı bir ortamda gerçek anlamda mantıksal kurallar kurma ve sorun çözme yeteneğine sahipse, gelecekte belki de bilinmeyen otomatik sürüş koşullarında doğru kararlar verebilir veya tamamen yeni bilinmeyen bir virüs patlamasında hızla etkili bir ilacın moleküler yapısını çıkarabilir.
GPT-6 Astra'nın neden bu kadar zeki olduğunu anlamak için ARC Ödülü resmi olarak arka plan kayıtlarını inceledi ve oyun oynarken verimli bir "sembolik dünya modeli" oluşturduğunu tespit etti.

Sembolik Dünya Modeli, "Dünya Modeli"'nin gelişmiş bir türevidir. Dünya Modeli, geleceğe dair tahminlerde bulunurken bir sanatçı gibi görseller kullanırken; anlık Sembolik Dünya Modeli, gerçek dünyayı mantıksal sembollere ve neden-sonuç kodlarına dönüştüren bir matematikçi gibi davranır.
Bu teknoloji, AI'nın ileri düzeydeki muhakemeye ulaşmak için kaçınılmaz bir yol olarak kabul edilir.
Sembolik Dünya Modeli nedir?
Geçmişte, birçok büyük modelin ARC-AGI serisi testlerinde yüksek puan alamamasının önemli bir nedeni, “kaba kuvvet deneme”ye alışkın olmalarıdır. Yapay zeka, oyun ekranını piksel bloklarına böler, rastgele bir yere tıklar, yanlışsa yön değiştirir ve şansa dayanarak seviyeyi tamamlar.
Bu modda, bazı puan atlamaları olsa bile, AI oyun kurallarını gerçekten anlayamaz veya kavrayamaz.
Sembolik dünya modelinin tümü kontrol etmesinin nedeni, çevresel fiziksel kuralları ve neden-sonuç ilişkilerini tam olarak anlayıp, hassas hesaplamalarla seçim yapmasıdır.
Gerçek testlerde, GPT-6 Astra yabancı bir grafik oyununa girdiğinde, gözlemlediği ortam için kendi yarattığı bir DSL, özel bir cebirsel sembol sistemi kullanarak yoğun notlar tutmaya başlar. Örneğin, oyunun gizli kurallarını, yakında yürütülecek komut dizilerini ve hatta her pikselin hareket izini koordinat sistemi üzerinde tam olarak haritalar.
Bu cebirsel kayıt yöntemi, önceki modellerin doğal dil etkileşimiyle oluşturduğu belirsizliklere kıyasla, doğrulukta efsanevi bir sıçrama sağlar.
Ardından zihninde bir Python kodu mantığı yazar: "A'ya basarsam, grafik 90 derece sola döner."
Daha sonra, kendi zihninde bir "sanal kum kütüğü" oluşturur ve önümüzdeki planı zihninde simüle eder. Mantıksal döngünün tamamen doğru olduğunu onayladıktan sonra, gerçek oyun içinde ilk adımı atar. İşte neden operasyonel verimliliği insanlardan çok daha yüksek.
GPT-6 Astra'nın yetenek sınırlarını anlamak için kırmızı takım test platformu PRO‑LONG, AI'nin kendi özgün kodlarını yazıp çalıştırmasına izin vermek üzere bir kod kumandası içine aldı.
Sonuç olarak, GPT-6 Astra her oyun için özel araçlar geliştirmeye başladı. Örneğin, bekçilerin devriye dolaştığı karmaşık bir labirent oyununda, GPT-6 Astra kendisi bir navigasyon sistemi yazdı, ardından savaş kuralları ekledi, bekçilerin devriye rotalarını simüle etti ve nihayetinde kendi geliştirdiği araç zinciriyle sonucu mükemmel şekilde tahmin edip doğruladı.
İlk yıllarda, bu sembolik çıkarım ve kendi araçları oluşturma yeteneği tamamen harici bir Harness harici çatısıyla sağlanıyordu. Harici araçlar, modelin görüntü çevirisini, durum kaydını ve sonuç doğrulamasını yapıyordu; ancak bu yöntemin ciddi dezavantajları vardı: Model ile harici araç arasında veri aktarımı yüksek gecikmelere neden oluyordu; harici araçların mühendislik kapasitesi, büyük modelin ağırlık eğitimiyle tamamen bağlantısızdı; bulut hesaplama ortamına ve harici betiklere büyük ölçüde bağımlı olunması nedeniyle, bu üst düzey yetenekler uç kenar donanımlarına kolayca dağıtılamıyordu.
GPT-6 Astra, şimdi Harness'a ait birçok yeteneği doğrudan model ağırlıklarına dahil ediyor. Sembolik dünya modellerini uzun süredir savunan önde gelen bilim insanı Gary Marcus, GPT-6 Astra'yı bu yaklaşımda büyük bir zafer olarak övdü.
Son iki yılda, Harvard, MIT ve Google DeepMind'den başlayarak akademik ve endüstri dünyası bu yönde büyük sayıda temel sonuç üretti ve herkes "sembolik dünya modeli" üzerine bahis yaptı. AGI'ye giden sayısız dal yolda, endüstri temel bir teknik uzlaşmaya varıyor.
Bu kadar yüksek puanla AGI garantili mi?
Soruyu hazırlayan kendi kendine soğuk su döküyor
Ilginç bir şekilde, tüm ağ bu puan listesi başarısıyla coşarken, birçok kişi OpenAI başkanı Greg Brockman'ın "AGI geldi" sözünü paylaşırken, ARC Ödülü Vakfı başkanı Greg Kamradt doğrudan soğutucu bir tepki verdi.
O, soru oluşturanlar arasında çekirdek kişidir; standart nasıl tasarlanmalı, puanlar nasıl yorumlanmalı konusunda en çok sözü olan odur. Değerlendirme açısından, puanların gerçek olduğunu düşünse de, bunların AGI'den hâlâ on binlerce uzak olduğunu savunur.
Şu ana kadar, PRO-LONG gibi süper hafıza avantajına sahip, Tycho gibi derinlemesine tahmin yeteneğine sahip ve Prime Agent gibi kendi programlama ortamını kendiliğinden geliştirebilen ekiplerin ARC-AGI-3 üzerinde %90 üzeri başarı elde ettiğini gördü.
Yüksek puan alan bu ürünler, zararsız bellek, programlı analiz, açıkça belirtilmiş hipotez testi, kalıcı durum ve düşük maliyetli dahili hesaplama olmak üzere beş ana bileşene sahip ortak bir teknik formüle sahiptir.
Sonsuz bellek, belleği yönetir; programlı analiz, mantığı yönetir; açık varsayımların testi, çıkarımı yönetir; kalıcı durum, çok adımlı etkileşimlerin bağlamını yönetir; düşük maliyetli dahili hesaplama, ucuz dahili hesaplama gücünü sağlar; bu sayede AI, doğru cevabı vermeden önce sanal ortamda çılgınca deneme yapabilir. Bunlar birlikte, modelin kendi eksikliklerini gideren süper bir Harness oluşturur.
GPT-6 Astra, 100%'ye ulaşmak için aynı şık bir Harness kullanıyor ve sürekli diyalog ve bağlam sıkıştırma ile mantık zincirini desteklemek için özel olarak tasarlanmış bir "tedarikçi uyumlayıcı tabanı"ndan yararlanıyor. Her oyun turu tamamlandığında 360 dolarlık pahalı hesaplama gücü tüketiliyor. Tam bir test serisi tamamlandığında toplam hesaplama maliyeti şaşırtıcı bir şekilde 18.000 dolar (yaklaşık 135.000 Çin yuanı) oluyor!
Bir insan bir grafik bulmacayı çözmesi sadece birkaç dakika sürebilir, beyin metabolik gücü 20W olarak hesaplandığında elektrik maliyeti yarım sentten azdır; hatta katılımcılara ödenen gerçek saatlik ücreti de dahil ederseniz, her oyun için maliyet 12,78 dolar olurken, AI'nın maliyeti 360 dolardır. Bu "para gücü" ile elde edilen başarılar, gerçekten sıradan birinin ulaşabileceği AGI olabilir mi?
Elbette, GPT-6 Astra, Harness'in yeteneklerini yavaş yavaş içselleştirmeye başlamıştır; eğer bu gelişim devam ederse, modelin dahili potansiyel hesaplama gücü giderek artacaktır. Ancak, çıkarım süreci artık şeffaf olmaktan çıkmaya başladığı için geliştiriciler, AI'nın gerçekten anlayıp anlamadığını ya da daha verimli bir şekilde kural dışı yollar bulup bulmadığını bilmiyor.
GPT-6 Astra, AGI mi?
Bu soruya göre, Greg Kamradt uzun yazısının sonunda felsefi bir yanıt verdi. İnsanlar neden “genel akıl” olarak kabul edilir? Çünkü insanlar herhangi bir bilinmeyen dünyaya uyum sağlayabilir; hatta bir antik bebeği modern dünyaya atsak bile, o da metro kullanmayı ve telefonu nasıl işleteceğini öğrenebilir. Bu akıl binlerce yıldır sürmüş ve teknolojik ilerlemeyi sürekli ileri taşımıştır. Ancak şimdi teknoloji dünyasının AI için zorlu bir sınav olarak düzenlediği test, sadece bir “grafik eşleştirme sınavıdır”.
Bu, AI'nın daha akıllı hale geldiğini kanıtlamaktadır, ancak AGI'nin geldiğine dair bir kanıt değildir.
