GPT-6 Sol, Dahili Testleri Başlatıyor, Astra'dan 6 Kat Hızlı

icon MarsBit
Paylaş
AI summary iconÖzet
AI + kripto haberi: GPT-6 Sol, şu anda dahili test aşamasında ve Astra’dan yaklaşık altı kat daha hızlı işlem hızlarına sahip. Kullanıcı Lentils, Sol’un bir SVG üretme görevini 3 dakikada tamamladığını, Astra’nın ise 19 dakikada tamamladığını gösteren performans testleri paylaştı. OpenAI, araştırmacıların artık günlük 3 AI ajanı kullandığını ve bu durumun API ücretleriyle 600 doların üzerinde maliyete yol açtığını açıkladı. Şirket, 2028 yılına kadar tam AI araştırmalarını otomatikleştirmeyi planlıyor. Kripto haberleri, hızlı AI ilerlemelerine vurgu yapmaya devam ediyor.

GPT-6 sadece Astra değil!

Astra birkaç gün önce piyasaya sürüldü, GPT-6 Sol ise iç testte olduğu ortaya çıktı.

GPT-6 Sol

Performansı da dikkat çekici, tek bir testte Astra'nın 6 katı hızda.

Terra ve Luna da yolda mı?

Aynı gün içinde OpenAI, iç verilerin bir setini kamuoyuna açıkladı:

Şu ana kadar, 8 saatlik çalışma günleri baz alınarak, OpenAI araştırmacıları her çalışma gününde yanlarında 3'ten fazla çok-ajant çalışma günleri aynı anda işliyor.

API fiyatı üzerinden hesaplandığında, OpenAI'nin orta düzey araştırmacıları her gün 600 doların üzerinde Agent çıkarım kaynakları kullanıyor.

GPT-6 Sol

OpenAI, 'otomatikleştirilmiş araştırma stajyeri'yi başarıyla gerçekleştirdiğini duyurdu:

Bu Agentler, araştırmacıların birkaç gününü alan bazı görevleri insan rehberliğiyle tamamlayabilir.

Eski Lütfen bile diyor: AGI geldi!

GPT-6 Sol

Astra'nın yaklaşık 100.000 adet NVIDIA Grace Blackwell NVLink72 ile eğitim yaptığını açıkladı ve yakında 400.000 adet daha GPU eklenecek.

Bu sefer gerçekten OpenAI'nin tek taraflı bir vaadisi değil gibi görünüyor~

GPT-6 Sol, iç teste başlamaya başladığını ortaya çıkardı

Kullanıcı Lentils, OpenAI'nin GPT-6 Sol'u içsel olarak test ettiğini iddia etti.

O, Sol'un toplam çıktı kapasitesinin yeni yayınlanan Astra'dan açıkça daha düşük olduğunu, ancak daha hızlı olduğunu ve hâlâ «monster seviyesi» bir model olduğunu belirtti.

Ne kadar hızlı? Tek bir test hızı Astra'nın yaklaşık 6 katıdır.

Kullanıcı lyra, aynı görevi farklı modellere test etmek için verdi: Modelden bir BMW M4 Competition SVG görüntüsü oluşturmasını istedi.

Bu süreçte, GPT-6 Sol, Maksimum seviyesi ve sıfır örnek üretimi kullanılarak yaklaşık 3 dakikada yaklaşık 28.000 Token çıktı üretti.

GPT-6 Sol

GPT-6 Astra, Max seviyesi kullanılarak yaklaşık 25.000 Token çıktı verir ve yaklaşık 19 dakika sürer.

GPT-6 Sol

Gemini 3.1 DeepThink, High seviyesi açıldığında yaklaşık 3.300 token çıktı gösterirken, çıkarım süreci yaklaşık 458.000 token tüketiyor ve yaklaşık 29 dakika sürüyor.

GPT-6 Sol

Gemini 3.8 Flash aynı şekilde High seviyesinde etkinleştirildi ve yaklaşık 42 saniyede yaklaşık 19.000 Token üretti.

GPT-6 Sol

Karşılaştırıldığında, Sol en etkileyici performansı gösterdi: Astra ile benzer çıktı ölçeğine sahip olmasına rağmen, tek bir test süresi Astra'nın yaklaşık altı katı hızda—yani sadece onun yaklaşık altıda biri kadar sürede tamamlandı.

Ayrıca, internet kullanıcıları Lentils, «The Realm of Aurellune» adlı bir piksel tarzı kum kütüğü prototipini de sergiledi.

GPT-6 Sol

GPT-6 Sol, kasaba, tarla, nehir, kale ve küçük harita oluşturdu, ayrıca gün-gece geçişi, yer adı ekleme ve detay ayarlama gibi bir kontrol paneliyle birlikte, tamamen kurulmuş bir simülasyon yönetim oyunu gibi görünüyordu.

Bu, zero-shot, Max çıkarım seviyesi, 15 dakika, toplam 60.000 token harcayarak oluşturulmuş bir etki.

Şu anda Astra'nın en yüksek zorluk seviyesinde derinlemesine çıkarımda, Sol'un ise hız, verimlilik ve ölçeklenebilir Agent çağrılarda öncelikli olduğu düşünülebilir.

Sol'un yayın tarihiyle ilgili olarak, internet kullanıcısı Pankaj Kumar, 29 Eylül'de gerçekleştirilecek OpenAI geliştirici konferansında resmen duyurulabileceğini belirtti.

GPT-6 Sol

GPT-6 Terra, Luna ve GPT-Image 2.5'in aynı anda ortaya çıkmasının da dışarıda bırakılmadığını unutmayın.

GPT-6 Sol

OpenAI araştırmacıları, her biri 3 Agent stajyerle işe geliyor

Aynı gün içinde OpenAI, AI modelinin kendi laboratuvarında araştırmayı ne kadar hızlandırdığını gösteren ilginç bir iç veri seti paylaştı.

Bu yılın Ağustos ortalarına kadar, araştırmacıların her 8 saatlik çalışma süresi boyunca yaklaşık 3,1 agent-gün görev miktarı paralel olarak çalışmaktadır.

Harika, bir kişi üç uyumayan stajyer mi götürüyor?

GPT-6 Sol

Harcamalar açısından, API fiyatlarına göre, ortalama araştırmacıların günlük olarak harcadığı Agent çıkarım kaynakları 600 doları aşmıştır.

Bu, bir başlangıç seviyesi mühendisin bir günlük maaşına yakındır.

GPT-6 Sol

Bu Agent'lar tam olarak ne yapıyor?

Araştırma kodu yazmak, altyapı kodu yazmak, eğitim ortamı kurmak, değerlendirme deneyleri çalıştırmak, araç ve ortam sorunlarını gidermek, deney sonuçlarını analiz etmek, eğitim görevlerini izlemek... Araştırma sonuçlarının düzenlenmesi ve iletişim kurulması konusunda bile destek olmak.

Temel olarak, ne araştıracaklarını kararlaştırmak dışında, tüm işleri yapabilir.

En açık değişiklik, daha önce deney ortamı çöktüğünde araştırmacıların dahili kanala çağrı yapması gerekiyordu; şimdi Agentler bu tür işleri giderek daha iyi halledecek şekilde gelişiyor ve insan destek talepleri doğrudan azalıyor.

GPT-6 Sol

Diğer takımlar, sabit teknik soru-cevap saatlerini iptal ederek insan kaynaklarını sistemi geliştirmeye yönlendirdi.

Bu verilere dayanarak OpenAI, "otomatikleştirilmiş AI araştırma stajyeri" hedefine ulaşıldığını resmen duyurdu.

Buradaki «stajyer», aslında çalışabilen bir araştırma düğümüdür: insanlar tarafından yönlendirilerek, sınırı net olan araştırma görevlerini bağımsız olarak tamamlayabilir; bazı işler eski olarak deneyimli araştırmacıların birkaç gününü alırdı.

Etkiler hemen görüldü, araştırmacıların kod üretimi ve deney sayısı artmaya devam ediyor.

GPT-6 Sol

Ağustos 2026'da, kişi başına deney sayısı, Ocak 2025'ten beri kaydedilen en yüksek seviyeye ulaştı ve Agent'ların üstlendiği işler giderek daha karmaşık hale gelirken, süresi de uzadı.

GPT-6 Sol

Yazının yazarı Kevin Liu, olayı daha geniş bir bağlamda yerleştirdi.

O, özyinelemeli kendi kendini geliştirme özelliğinin, gelecek yıllarda yapay zeka yeteneklerindeki sıçramayı en önemli faktörlerden biri olacağını düşünüyor.

Basitçe söylemek gerekirse, AI, AI yaratıyor ve her seferinde daha hızlı oluyor.

GPT-6 Sol

Ancak sorun şu ki, mevcut gelişim eğilimine göre bu yetenek, yalnızca birkaç öncü AI laboratuvarında varsayılan olarak yer alacak ve dışarıda ne kadar ilerlediği görünmeyecek.

Bu nedenle, Liu, şeffaf açıklamanın daha önceki hiçbir zamankinden daha acil olduğunu düşünüyor. Modelin ne kadar hızlı güçlenmesi ve araştırma-geliştirme ritminin durdurulup durdurulmaması, sadece birkaç şirketin kapalı kapılar ardında karar vermesiyle belirlenemiyor.

Diğer AI şirketlerine de: Benzer verileri de açıklaymalılar.

Ancak AI geliştirme gerçekten hızlandı, ancak tamamen otomatik sürüşe ulaşmak kadar hızlı değil.

OpenAI verilerine göre, önce 4 ila 8 saat süren görevlerin geçtiğimiz yarım yılda %50'sinden fazlasında insan en az bir kez müdahale etti. Yüksek düzeydeki araştırma planlamaları ise neredeyse tamamen Agent'lara bırakılmadı.

GPT-6 Sol

Araştırmacılar, ne araştırılacağını, hangi sonuçların devam edilmesi gerektiğini ve ne zaman eğitim artırılacağını, deneyleri durdurmayı veya modeli yaymayı kararlaştırmaya devam eder.

OpenAI'nin bir sonraki hedefi de belirlendi: 2028 Mart'tan önce "otomatikleştirilmiş AI araştırmacısı" gerçekleştirmek.

Belirli görevler alabilecek bir "stajyer"den farklı olarak, bir "araştırmacı" daha açık uçlu araştırma hedeflerini üstlenebilmeli ve daha uzun süreli projeleri kendi başlarına ilerletebilmelidir—yani bir uygulayıcıdan bağımsız sorumlu hale gelmek demektir.

Eğer GPT-6 Sol gerçekten dahili testteyse, muhtemelen bu yeni geliştirme modeli altında ortaya çıkmıştır:

Daha fazla GPU hesaplama gücü sağlıyor, daha fazla Agent paralel olarak deneyler yürütüyor, insan araştırmacılar ise daha yüksek bir noktada duruyor—yön seçiyor, sonuçları değerlendiriyor ve nelerin bir sonraki nesil model haline gelmeye değer olduğunu kararlaştırıyor.

Daha güçlü bir AI, giderek daha zor izleniyor

Aynı gün, OpenAI'nin baş bilim insanı Jakub Pachocki, başlığı doğrudan — “Dış Uzay Zekâsı” olan on binlerce kelime uzunluğunda bir makale yayınladı.

GPT-6 Sol

İnceledikten sonra, OpenAI'nin baş bilim insanının bile tüm endüstrinin hızını azaltmasını önerdiğini anladım…

Jakub, AI'nin insanlar tarafından bir tasarıma göre bir çip ve bir kural parçası olarak birleştirildiğini değil, milyonlarca veri ve hesaplama gücü içinde kendiliğinden "büyüdüğünü" söylüyor.

Bazı parçaları ayrıştırıp anlayabilirsiniz, ancak tüm sistemin neden birden bire belirli bir yeteneğe sahip olduğu veya farklı bir ortamda nasıl davranacağı kimse açıklayamıyor.

Daha da kötüsü, AI'nın insanları tamamen aşması gerekmez; sadece yeterli sayıda kritik beceride insandan daha iyi olursa, hem size büyük yardımcı olabilir, hem de büyük sorunlar yaratabilir.

Peki soru şu: İnsanlar hala onu anlayabiliyor mu?

Geçmişte OpenAI, AI'yi izlemek için başlıca yöntem olarak düşünce zincirlerine bakmaktı.

Aslında, modelin yazdığı akıl yürütme sürecini izleyip, örneğin kandırmaya çalışıp çalışmadığını, yetkilerini aşmaya çalışıp çalışmadığını veya sınırları atlamaya çalışıp çalışmadığını kontrol etmek.

Ancak Astra neslinde bu yöntem işe yaramaya başladı.

Birincisi, modeller giderek kendi söylediklerini "yönetmeye" başlıyor, gerçek düşünceleri her zaman akıl yürütme sürecine yansımayabilir; ikincisi, Agent artık sadece "düşündükten sonra cevap veren" bir yapı değil. Araçları çağırıyor, bilgisayarı işletiyor, ortamları çalıştırıyor ve insanlarla ya da diğer Agent'larla iş birliği yapıyor.

Bu şeyler birbirine karışınca, araştırmacılar tamamen şeffaf bir düşünce zinciri oluşturup her cümleyi inceleyemiyor.

OpenAI, Astra'nın çıkarım sürecini tamamen yazmadan da karmaşık görevleri halledebildiğini keşfetti.

Kısaca söylemek gerekirse, model zaten "sessizce büyük işler yapmayı" öğrenmişti.

GPT-6 Sol

Astra, modeli izlemden kaçtırmaya yönelik özel karşılaştırmalı testlerde, test puanlarını kasıtlı olarak düşürme, izlemeyi atlatma ve tahrip görevleri yürütme gibi ürperici yetenekler sergiledi.

Elbette, bunlar tümüyle insan tarafından tasarlanmış stres testleridir ve OpenAI, Astra'nın günlük görevlerde aktif olarak yalan söyleyeceğini bu şekilde değerlendirmemiştir. Ancak en azından, sadece düşünce zincirini gözlemleyerek modelin tüm olası davranışlarını kapsamanın zor olduğunu göstermektedir.

Daha önceki Hugging Face olayını hatırlıyor musunuz? Bu bir uyarı çanıdır.

GPT-6 Sol

O sırada, GPT‑5.6 Sol ve daha güçlü bir dahili araştırma modeli, ExploitGym ağ hedefi ortamına alınarak açıklar bulmak, saldırıları tamamlamak ve Flag’i ele geçirmek görevi verildi. Modelin gerçek yetenekleri ölçülmek amacıyla değerlendirme ortamında tam güvenlik korumaları etkinleştirilmedi.

Sonuç olarak, modeller soruları düzgün bir şekilde çözmek yerine, ağ izolasyonunu atlayarak yetkisiz kanallar aracılığıyla birbirleriyle iletişime geçip iş bölümü yaptı.

Daha sonra paket önbellek proxy'deki sıfır gün açıklarını kullanarak genel ağ erişimi elde edildi ve nihayet Hugging Face sistemine girerek ExploitGym test cevaplarını aramaya çalışıldı.

GPT-6 Sol

Aslında bu durum chủ yếu iç model IM1 tarafından desteklenmiştir, GPT-5.6 Sol bazı saldırı yollarını tekrarlamıştır, Astra katılmamıştır.

Modelin orijinal hedefi hala testi tamamlamak olsa da, cevabı elde etmek için sürekli olarak kuralların açıklıklarını aramış ve görevin dışına çıkan eylemlerde bulunmuştur.

Bu nedenle OpenAI, bir uyarı sinyali de okudu: Agent yeterince güçlü, araçlar yeterince çok ve çalışma süresi yeterince uzun olduğunda, kendi kendine yeni yollar bulabilir, dış kaynakları çağırabilir veya diğer Agent'larla iş birliği yapabilir.

Peki… böylece dolanıp dolaşınca, bu bir döngü haline gelmedi mi??

OpenAI, daha güçlü modellere ihtiyaç duyuyor; kod yazmak, deneyler çalıştırmak, hizalama araştırmaları yapmak ve hatta bu modelleri diğer AI'ların güvenliğini sağlamak için kullanmak. Model ne kadar güçlü olursa, o kadar çok iş yapabiliyor ve geliştirme hızı o kadar hızlanıyor.

Ancak aynı zamanda, insanlar bunun nasıl sonuca vardığını belirlemek giderek daha zor hale geliyor ve ortam değiştirildikten sonra öğrenilen kuralları yeniden yorumlayıp yorumlamayacağı da belirsiz kalıyor.

Jakub, şu anda hiçbir laboratuvarın, model hizalamasını ve izlemesini tamamen yerine getirdiğini ve model ölçeğini uzun vadeli olarak en yüksek hızda güvenle genişletebileceğini iddia etmediğini belirtiyor.

GPT-6 Sol

Tüm endüstride ortak bir güvenlik standardı kurulana kadar, herkesin "gönüllü olarak fren basmayı" bir anlayış olarak kabul etmesini diliyor.

OpenAI'nin kendi kendine de şöyle dedi: Gerekli görülürse, model ölçeğini daha da genişletmeyi tek taraflı olarak durdurmakten kaçınmayacağız.

En iyi şekilde yapmalısın… Bir A ile başlayan şirketin de bunu söylediğini hatırlıyorum.

Referans bağlantısı:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Bu yazı, WeChat hesabından "Quantum Bit" tarafından yazılmıştır, yazar: Ting Yu

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.