OpenAI, GPT-6 Astra değerlendirme verilerini ayarlıyor, şeffaflık endişelerini artırıyor

icon MarsBit
Paylaş
AI summary iconÖzet
OpenAI, GPT-6 Astra'nın değerlendirme verilerini değiştirdiği rapor edildi ve şeffaflık konusunda endişeler yarattı. Astra'nın hayal kurma oranı %4,2'den %2'ye düştü,Anthropic ve GPT-5.6 Sol gibi rakipler ise matematik puanlarında düşüş yaşadı. OpenAI, değişikliklerin doğru performansı yansıttığını söyledi, ancak Stanford araştırmacıları "benchmaxxing" uyarısında bulundu. Piyasa değişimleriyle birlikte dikkat edilmesi gereken altcoin'ler popülerlik kazanırken, güvenilir veriler hâlâ kritik öneme sahip. Enflasyon verileri trendleri, AI ve kripto sektörlerinde açık ve tekrarlanabilir performans testlerine olan ihtiyacı da vurgulamaktadır.

Dongcha Beating AI Hızlı Haberleri: OpenAI, 3 Eylül'de GPT-6 Astra'yı yayınladıktan sonra, birden fazla model değerlendirme ölçütü verisi sürekli olarak ayarlandı; bazı değişiklikler Astra'nın performansını iyileştirdi, bazı yarışmacı modellerin sonuçları ise düştü ve bu durum, AI'nın "puan dolandırıcılığı" ve değerlendirme şeffaflığı konusunda dışarıda şüphelere yol açtı. Özellikle, Astra'nın hayal kırıklığı oranı 4,2%'den 2%'ye düşürüldü, GPT-5.6 Sol ise 12,2%'den 9,4%'e indirildi; ardından ikisi de tekrar 4,2% ve 12,2%'ye döndü. Matematik değerlendirmesinde, Anthropic'in Fable 5.1 puanı 87,8%'den 78%'e düşürüldü ve şu anda 83%'e yükseldi; GPT-5.6 Sol ise 83%'den 80,5%'e düştü, ardından tekrar 83%'e döndü. Ayrıca, Astra'nın ARC-AGI-3 değerlendirme sonucu, yayın öncesi taslakta 98,6%'den nihai sayfada 99,99%'a çıkarıldı; programlama değerlendirme puanı da 57,7%'den küçük bir artışla 57,9%'a yükseltildi. OpenAI, değerlendirme sonuçlarının model sürümü, araç yapılandırması, çıkarım seviyesi ve test çalışması gibi faktörlerden etkilenebileceğini belirtti ve bu ayarlamaların modelin en iyi performansını daha doğru bir şekilde yansıtmayı amaçladığını söyledi. Ancak, Stanford Üniversitesi araştırmacıları, sık sık değerlendirme testlerinin yeniden çalıştırılmasının "Benchmaxxing" olarak adlandırılan, test koşullarını ayarlayarak referans puanlarını maksimize etme eylemini içerebileceğini düşünüyor. Endüstri uzmanları, AI modelleri arasındaki rekabetin artmasıyla birlikte, değerlendirme verilerinin model yeteneklerini ölçmek ve pazar için rekabet etmek için önemli bir araç haline geldiğini belirtiyor ve referans testlerinin şeffaflığını ve tekrarlanabilirliğini artırmaya yönelik ilgi giderek artıyor.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.