Anthropic'ın Claude Modeli, Kod Oluşturma ve Ajan Güvenilirliğinde Teknik Zorluklar Karşılıyor

iconMetaEra
Paylaş
AI summary iconÖzet
Anthropic'ın Claude modeli, kod üretimi ve Agent güvenilirliği ile ilgili teknik göstergelere karşı karşıya. Su damlası kısıtlamaları kod esnekliğini sınırlarken, Sonnet 5'in uyarlanabilir mekanizması ürün hatlarını bulanıklaştırıyor. Agent oturumlarındaki uzun bağlam hâlâ yetersiz kullanılıyor ve bağlam sıkıştırması geçerli verileri ayıramıyor. Kendini değiştiren ortamlar hata birikimine neden oluyor. Güvenilirlik artık sadece model performansına değil, durum netliğine, eylem doğrulamasına ve rollback'e bağlı. Korku ve açgözlülük endeksi değişiklikleri bu temel teknik zorlukları yansıtabiliyor.
Anthropic, Claude modeliyle ilgili son dönemde çok sayıda teknik zorlukla karşılaştı. Kod üretimi, su damlası yerleştirme kısıtlamaları nedeniyle esneklik kaybı yaşadı; Sonnet 5'in uyarlamalı düşünme mekanizması, aynı modelin farklı hesaplama kaynakları ile ayarlanmasını sağlayarak ürün çizgisi yetenek sınırlarını bulanıklaştırdı; 1M bağlam görünürde yeterli gibi görünse de, uzun Agent oturumlarında model aslında yalnızca %20-30'unu etkili şekilde kullanabiliyor ve ardından durum karmaşası ve eksiklikler ortaya çıkıyor; bağlam sıkıştırılırken hangi bilgilerin hâlâ geçerli olduğu ayırt edilemiyor ve geçici varsayımlar yanlışlıkla gerçeklik haline getirilebiliyor; Agent ortamı aktif olarak değiştirdikten sonra, model orijinal sorun yerine kendi yarattığı yeni hataları analiz etmeye başlıyor. Makale, uzun Agent'ların güvenilirliğinin artık sadece modelin tek adımlık performansından ziyade durum netliği, eylemlerin doğrulanabilirliği ve hataların geri alınabilirliği üzerinde artan bir bağımlılığa sahip olduğunu belirtiyor.

Yazan:雷锋网

Modelin puanının düşmesinden daha sorunlu olan, modelin hâlâ yükseltme aşamasında olmasına rağmen kullanıcıların giderek daha az kullanışlı bulmaya başlaması.

Anthropic son zamanlarda biraz bu tarz bir şey hissettiriyor.

Bu birkaç gün içinde X'te bir gönderi, Claude'nin bu dönemdeki birkaç tipik memnuniyetsizliğini bir araya getirdi: metin ve kodlara makine tarafından okunabilir işaretler eklenmeye başlandı, Sonnet 5'in gerçek deneyimi model yükseltmelerinin sesini yakalayamadı, Fable 5 daha pahalı satılıyor ancak Opus 5'ten neredeyse hiçbir farkı hissedilemiyor; ayrıca daha dikkat çekici bir geri bildirim de, Fable 5'in bağlamı sadece yaklaşık %20–30'una kadar kullanılıyor ve ardından performans düşmeye başlıyor.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Bu dört şey görünürde birbirine bağlı değil; biri üretme mekanizması sorunu gibi, biri model yeteneği sorunu gibi, biri fiyatlandırma sorunu gibi, diğeri ise uzun bağlamda sorun çıkıyor gibi.

Ancak Claude'ın şu anki teknoloji yığınına bakıldığında, bunlar aslında 5 çok spesifik noktada takılı kalıyor: model nasıl üretiyor, çıkarım sırasında ne kadar hesaplama yapmaya razı, neden farklı modeller giderek daha zor katmanlaşıyor, uzun bağlam neden tam dolmadan etkisini kaybediyor ve deneylerdeki yetenekler neden gerçek Agent görevlerinde sıklıkla azalıyor.

Bu nedenle Anthropic'in son zamanlardaki sorunu, basitçe "modelin gerilemesi" olmayabilir. Daha çok Claude giderek daha güçlü hale geldikçe, üretme, hesaplama, bağlam ve Agent çalışma zamanı arasında birbirini yavaşlatmaya başlamış olabilir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

01

İlk günah: Kod oluşturma alanını yok etmek

Makine tarafından okunabilir etiketler, normal metin içine yerleştirilir; teknik zorluk, kararlı sinyalleri korurken üretimi mümkün olduğunca etkilememektir. Kodda bu sorun, doğal dil ve kodun token dağılımlarının farklı olması nedeniyle açıkça daha zor hale gelir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Makale: https://arxiv.org/pdf/2301.10226

Doğal dilde genellikle birbirine yakın anlamlı birden fazla aday bulunur. Aynı anlam farklı kelimelerle veya sözcük sıralamasıyla ifade edilebilir; model birçok konumda belirli bir üretimsel fazlalığa sahiptir. Metin su damgası için yaygın yaklaşımlardan biri, bu fazlalığı kullanarak, kabul edilebilir tokenlar arasında örnekleme olasılıklarında hafif değişiklikler yaparak, yeterince uzun bir süre sonra istatistiksel bir kalıp bırakmaktır.

Kodda çok sayıda düşük entropili konum bulunuyor. Değişken bildiriminden sonra, sonraki referanslar neredeyse yalnızca aynı ismi kullanabilir; JSON alanları, tırnak işaretleri ve parantezler katı yapısal kısıtlamalara tabidir; fonksiyon parametreleri arayüzlere uygun olmalıdır; yol, düzenli ifade, SQL ve Shell komutlarında bir token'da meydana gelen bir değişiklik doğrudan davranışı değiştirebilir.

Olasılık dağılımına göre, bu konumlar genellikle çok keskin olur. Doğru token yüksek olasılıkla yer alırken, diğer adaylar başka bir ifade değil, muhtemelen hatalıdır. Bu nedenle, kod su damgası ile karşı karşıya kalan temel sınırlama, kodlama kapasitesidir.

Bir konumda yalnızca bir mantıklı çıktı varsa, ek sinyal taşımak için neredeyse hiç yer yoktur; sistem yalnızca yüksek entropili konumlara işaretler yerleştirirse, kodun kısa olması, yapılandırılmış token oranının yüksek olması ve kullanılabilir konumların yetersiz olması sorunlarıyla karşılaşırlar.

Bu nedenle, sinyal algılama gücü, üretim kalitesi ve değiştirme direnci arasında doğrudan bir uzlaşmaya gidilir: sinyal çok zayıfse algılanması zor olur, kısıtlamalar çok güçlüyse doğru üretimi etkileyebilir ve biçimlendirme veya kısmi yeniden yazma sonrası algılama yeteneğini korumak daha yüksek sinyal fazlalığı gerektirir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Anthropic, Claude metin işaretlerinin örnekleme nasıl değiştirildiğini açıklayamadığından, Claude Code'un kalite değişikliklerini doğrudan bir su damlası algoritmasına bağlayamaz.

Burada kesin olarak şunun doğrulanması mümkündür: kod üretimi, giderek daha fazla kısıtlamayı aynı anda taşıyor. Anlamsal ve yürütme doğruluğunun yanı sıra, araç protokollerine, yapılandırılmış formatlara, güvenlik kurallarına ve kaynak etiketlerine de uymak zorunda kalabilir; ancak kodun kendisi bu ek kısıtlamaları içerebilmek için doğal dile kıyasla çok daha az esnekliğe sahiptir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

02

İkinci günah: Model seviyeleri hesaplama eğrisine dönüşüyor

Sonnet 5'in uyarlamalı düşünmesiyle oluşan değişiklikler, modelin sadece biraz daha fazla düşünmesini sağlamıyor.

Önceki Sonnet, Opus, Fable tartışmalarında bunları birkaç sabit yetenek noktası olarak kolayca anlayabilirdik. Şimdi effort eklenmesiyle, aynı model farklı test-zamanı hesaplama aralıklarına girebilir ve model adı artık bir isteğin gerçekte ne kadar yetenek harcadığını tam olarak temsil edemiyor.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://platform.claude.com/docs/en/build-with-claude/effort

Bu değişiklik, Coding Agent içinde özellikle belirgindir. Claude bir hata ile karşılaştığında, yalnızca bir düzeltme önerisi üretmekle kalmaz, aynı zamanda hangi dosyaları okuyacağını, hangi çağrı zincirini izleyeceğini, kaç aday varsayımı koruyacağını, testleri çalıştırmayı gerektirip gerektirmeyeceğini, bağımlılıkları kontrol etmeye devam etmeyi kararlaştırır ve ne zaman kanıtların yeterli olduğunu düşünür.

Bu işlemler bir arama ağacı olarak görülebilir. Daha düşük hesaplama yükü, dalların daha erken kesilmesini ve daha hızlı karar verilmesini sağlar; daha yüksek bir yük, modelin aramaya ve doğrulamaya devam etmesine izin verir ve kanıt yetersiz olduğunda doğrudan eylem gerçekleştirmenin olasılığını azaltır.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://platform.claude.com/docs/en/build-with-claude/effort

Bu nedenle effort , sadece thinking uzunluğunu değil, bir Agent görevinin izin verdiği arama kapsamını ayarlar. Bu, Anthropic'in model katmanlamasını doğrudan değiştirir.

Eğer bir standart coding görevi Opus için zor değilse, effort artırıldığında, Opus muhtemelen hızla performans platformuna geçecektir. Fable, daha güçlü bir temel modele sahip olsa bile, belirgin bir deneyim farkına dönüştürülebilecek fazla zorluk kalmamıştır.

Kullanıcı, istek başladığında bile modeller arasındaki fiyat farkını ödemek zorundadır. Bu nedenle Fable, yaygın kod yorumlama, küçük ölçekli yeniden yapılandırma veya normal hata ayıklama yerine, tanımadığı kod kütüphaneleri, çok aşamalı planlama, araçlar arası işlem, uzun süreli bağımsız yürütme ve hata oluştuğunda geri kazanım gerektiren görevlerde daha fazla değer sunar.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://www.anthropic.com/news/claude-opus-5

Bu, üst düzey modellerin sattığı şeyin değiştiğini anlamına gelir. Artık sadece “bu turun cevabı daha güçlü” değil, daha karmaşık bir yolun ek güvenilirliğini satıyor.

Sorun, bu avantajın yeterince uzun görevlerde ortaya çıkması gerektiği ve görev uzadıkça model yeteneklerinin tek belirleyici faktör olmaktan çıkıp bağlam durumunun merkezi konuma gelmeye başlamasıdır.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

03

Üçüncü günah: Sınırsız geçmiş verisi saklayabilir, ancak mevcut durumu netleştiremez

1M bağlamı gördüğünüzde, bunu büyük bir çalışma belleği olarak kolayca anlarsınız, bu yüzden Claude'nin yalnızca 200K veya 300K token kullanarak atlamaya, tekrarlamaya veya durum karışıklığına başlaması çok karşıt gelen bir durumdur.

Ancak context penceresi kapasiteyi ölçer, durum tutarlılığını değil. Uzun agent oturumları statik bir belge değil, sürekli eklenen bir yürütme geçmişidir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://platform.claude.com/docs/en/build-with-claude/context-windows

Bir dosya birkaç kez sırayla değiştirilebilir; bir hata ilk olarak önbellek sorunu olarak değerlendirilmiş, daha sonra eşzamanlılık kaynaklı olduğu ortaya çıkmıştır; bir test ilk başarısız olabilir, ardından başarılı olabilir, ancak yeni değişiklikler nedeniyle tekrar başarısız olabilir. Eski içerik, durum değişiklikleriyle otomatik olarak silinmez; yeni içerik sadece arkaya eklenir.

Buradaki sorun sadece retrieval değil. Model, mevcut görevle ilgili bilgileri bulmakla kalmalı, aynı zamanda bu bilgilerin şu anda geçerli olup olmadığını da değerlendirmelidir.

Eski fonksiyonlar ve yeni fonksiyonlar yüksek oranda benzerdir, eski test günlükleri ve yeni test günlükleri çok sayıda aynı token içerir, reddedilmiş analizler bile mevcut sorunla semantik olarak yüksek oranda ilgilidir. Attention bu içerikleri bulmak zor değildir, zor olan bunlar arasındaki kapsama ilişkisini belirlemektir.

Veritabanları, sürüm numarası, güncelleme zamanı, işlem ve açık alanlar aracılığıyla geçerli durumu koruyabilir; doğal dil bağlamı genellikle bu yapıya sahip değildir. Bu, sadece ekleme işlemine izin veren bir günlük gibi daha yakındır ve model, olay sırasından şu anki dünyanın nasıl olduğunu kendi başına yeniden oluşturmalıdır.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://platform.claude.com/docs/en/build-with-claude/context-windows

Bu nedenle, uzun bağlamın karmaşıklığı, token kullanım oranıyla basitçe eşleşmez. 250K token’lık statik bir belge, sonraki durumda çok sayıda değiştirilmiş nesne, aşamalı yargı, araç sonuçları ve geçersiz hale gelen durumlar içeren 250K token’lık bir Agent geçmişine göre çok daha kolay işlenebilir.

Thinking history, bu karmaşıklığı daha da artırır. Oturumda saklanan, yalnızca "ne olduğunu" değil, aynı zamanda "o zaman neden böyle karar verildiğini" de içerebilir. Erken dönem reasoning, daha sonra reddedilen bir varsayıma dayanıyorsa, bu çıkarım, şu anki soruya yüksek oranda ilgili olduğu için hâlâ sonraki kararlarla ilişkili kalabilir.

Yani 1M bağlamın gerçek sınırı, yalnızca ne kadar bilgi yerleştirilebileceği değil, aynı nesnenin giderek daha fazla geçmiş sürümü ortaya çıktıkça modelin mevcut sürümü kararlı bir şekilde geri yükleyip yükleyemeyeceği.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

04

Dördüncü günah: Tarih sıkıştırılıyor, durum yeniden oluşturuluyor

Bağlam büyüdükçe, sıkıştırma, eski geçmişi kısaltıp devam etmenin doğal bir yolu gibi görünüyor. Ancak Ajan senaryolarındaki sıkıştırma, genel özetle aynı şey değildir.

Bir örneği özete dahil etmemek genellikle bilgi bütünlüğünü etkiler; ancak bir Agent yolunun sıkıştırılması sırasında hâlâ geçerli bir kısıtlama atlanırsa, sonraki yürütme yolu doğrudan değişebilir.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://platform.claude.com/cookbook/tool-use-context-engineering-context-engineering-tools

Kompaktasyonun çözmesi gereken soru, "hangi içerikler önemli", değil, "hangi içerikler şu anda geçerli". Bir geçmişte, tamamlanmış görevler, daha sonra geçersiz kılınan kararlar, hâlâ geçerli olan arayüz kısıtlamaları, süresi dolmuş test sonuçları ve geçici çözümler aynı anda bulunabilir. Kompaktör, bu zaman durumlarını bir sonraki döngü için çalıştırılabilecek bir temsile yeniden düzenlemelidir.

Eğer "şu anda sorun önbellekten kaynaklanıyor gibi görünüyor" ifadesi "sorun önbellekten kaynaklanıyor" olarak kısaltılırsa, geçici varsayım gerçekliğe dönüşür; eğer zaten kullanımdan kaldırılmış bir çözüm hâlâ özete dahil edilirse, sonraki Agent eski yolu tekrar izleyebilir; eğer kritik bir sınırlama özete dahil edilmezse, model daha sonra onu daha asla görmeyebilir.

Bu nedenle, sıkıştırmanın anahtarı sıkıştırma oranı değil, durum sadakatidir. Bu, Git, testler, görev dosyaları, bellek ve yapılandırılmış teslimatın uzun süreli Agent'larda giderek daha önemli hale gelmesinin nedenidir.

Bu, modele görünen bilgileri yalnızca artırma değil, doğal dil geçmişinden uzun süre geçerli olan bazı durumları dış sistemlere taşımadır. Git, geçerli kod sürümünü belirler, testler doğrulanabilir sonuçlar verir, görev dosyaları tamamlama durumunu kaydeder ve yapılandırılmış durum, geçerli sonuçları geçmiş denemelerden ayırt eder.

Bağlam, zengin geçmişleri koruyabilir, ancak uzun vadeli tüm durum yönetimi sorumluluğunu taşıyamaz.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

05

Beşinci günah: Model, kendi oluşturduğu hataları düzeltiyor, hatalar giderek artıyor

Önceki birkaç soru hâlâ modelin girdiyi nasıl işlediğine dair anlaşılabilir. Agent, ortamı aktif olarak değiştirdiği için bir adım daha ileriye gider.

Normal sohbetlerde, model bir kez yanlış cevap verdiğinde, hata genellikle çıktı metninde kalır. Agent, kodu değiştirebilir, komutları çalıştırabilir, bağımlılıkları yükleyebilir, yapılandırmaları ayarlayabilir ve bu eylemlerden oluşan yeni sonuçları okuyabilir.

Bu durumda hata artık yalnızca bir yargı hatası değil, aynı zamanda bir çevre değişikliği haline gelir. Claude, bir hataayı önbellek sorunu olarak yanlış tanımlar ve önbellek mantığını, yeniden deneme mekanizmasını ve birkaç çağrı noktasını değiştirir. Ardından testlerde yeni bir dizi istisna ortaya çıkar.

Bu anomali gerçek, ancak orijinal hata doğal olarak ortaya çıkmadı, önceki düzeltme tarafından oluşturuldu. Bu, Agent'ın kendi oluşturduğu veri dağılımını analiz etmeye başlamasıyla çok özel bir başarısızlık moduna girmesine neden olur.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

Bu, "bu yeni hatalar önceki değişiklikten sonra ortaya çıktı" ifadesini tanımlayabiliyorsa, geri alınıp orijinal varsayımlar yeniden kontrol edilebilir; ancak bu neden-sonuç ilişkisi kurulmazsa, yeni hatalar ayrı ayrı sorunlar olarak görülmeye devam edip birbirini takip ederek düzeltilmeye çalışılabilir.

Bu noktada her adımdaki yerel işlemlerin bir temeli olabilir, ancak görevin tam izi orijinal sorundan sapmıştır. Bu nedenle uzun Agent'in güvenilirliği, tek adımlık doğruluk oranına değil, hata ortama girdikten sonra sistemin hataları tespit edip, nedenini belirleyip, düzeltip düzeltmeyebileceğine bağlıdır.

Git diff, modele hangi değişikliklerin justo gerçekleştiğini gösterebilir; testler, bir davranışın bozulup bozulmadığını doğrulayabilir; checkpoint ve rollback hataların yayılmasını sınırlayabilir; bağımsız değerlendirici ise modelin kendi açıklamalarının dışında ek bir doğrulama sağlayabilir.

Bu bileşenlerin işlevi, temel olarak Agent'e kapalı döngü düzeltme yeteneği kazandırmaktır.

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

Referans bağlantısı: https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

Anthropic teknoloji yığınındaki “Beş Günah” nereden geliyor?

06

Sonuç: Benchmark'in eksik olanı, izlenebilirlik güvenilirliğidir.

Çok sayıda benchmark, modele başlatılmış bir ortam verip görevi tamamlayıp tamamlayamayacağını test eder. Gerçek bir Agent için ek bir zorluk vardır: ortam, modelin kendi eylemleriyle sürekli değişir. Bu nedenle, iki modelin nihai geçme oranları yakın olsa bile, gerçek deneyimler tamamen farklı olabilir.

Bir model başlangıçta çok doğru tahminlerde bulunabilir, ancak bir kez yanlış yola saparsa sürekli olarak yanlış yolu düzeltmeye çalışır; diğer model ise tek adımda açıkça daha güçlü olmayabilir, ancak bir düzeltmenin yeni bir sorun yarattığını daha hızlı fark eder ve ardından geri döner, yeni bir yol seçer.

Sadece hedefe bakmak, bu iki davranışı ayırt etmek için zordur. Eğer Agent görevi daha da uzarsa, daha anlamlı göstergeler, sıkıştırma sonrası kritik durumların ne kadarının korunduğu, hatalı değişikliklerden sonra hatanın nereden girildiğinin tespit edilebilirliği, araç çağrıları arttıkça iç görev durumunun gerçek ortamla tutarlılığının devam etmesi ve sapma sonrasında düzeltmek için ne kadar maliyet ödeneceği olacaktır.

Bu göstergeler, bir yanıtın ne kadar akıllı olduğunu değil, bir trajektoryonun kontrol altında kalıp kalamadığını ölçer.

Bu nedenle, Anthropic'in son zamanlarda ortaya çıkan birkaç sorun türü, farklı seviyelerde yer almaktadır. Bu sorunların bir araya gelmesiyle Claude'in teknik sınırları da değişmeye başlamıştır.

Geçmişte modelin bir soruyu çözebileceği soruluyordu, şimdi daha zor olan başka bir şey: Görev birkaç saat boyunca çalışır, onlarca araç çağrısı geçer, birkaç kez durum sıkıştırılır ve birçok kod değişikliği yapılırken sistem hala güvenilir bir geçerli dünya tutabiliyor mu?

Model yetenekleri sürekli artıyor ve her adımdaki karar sınırı yalnızca yükseltilebilir. Uzun Agent'ların kararlı şekilde çalışabilmesi, artık başka bir yetenek setine bağlı hale geliyor: durumun net olup olmadığı, eylemlerin doğrulanabilir olup olmadığı ve hataların geri alınıp alınamayacağı.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.