Anthropic, Claude Sonnet 5.5'i %30 daha hızlı çıktı ve maliyet azalmasıyla başlatıyor

iconMetaEra
Paylaş
AI summary iconÖzet
Anthropic, yüksek frekanslı görevler için optimize edilmiş yeni bir token projesi olan Claude Sonnet 5.5'in lansmanını duyurdu. Model, Sonnet 5'e göre çıktıları %30 daha hızlı üretiyor ve her görevde maliyeti %30'a kadar daha düşük. Zincir üzerindeki haberlere göre, Terminal-Bench 4.0'da %70,6 puan aldı ve hem Sonnet 5 hem de Opus 5.5'i geride bıraktı. Ancak maksimum akıl yürütme altında daha fazla token kullanıyor ve maliyeti %50'ye kadar daha yüksek olabiliyor. Anthropic, iyi tanımlanmış görevler için Sonnet 5.5'i, karmaşık işler için ise Opus'u öneriyor.
Anthropic, Claude Sonnet 5.5'i, en üst düzey Opus 5.5'in yeteneklerini daha düşük fiyata ve yüksek frekanslı çağrılar için uygun günlük Agent modeline sıkıştırmayı amaçlıyor. API birim fiyatı hâlâ milyon başına 2 dolar ve 10 dolar olmakla birlikte, şirket, çıktı hızının %30'dan fazla arttığını ve tipik görevler için gereken Token sayısının azaldığını belirterek, tek bir görev maliyetinin en fazla %30 azalabileceğini söylüyor. Resmi testlerde, Terminal‑Bench 4.0'da %70,6 puan alarak Sonnet 5'in %10,3'ü ve Opus 5.5'in %66,4'ünden daha yüksek bir performans gösterdi;职业 görevler için GDPval‑AA'da da 1844 Elo ile Opus'un 1846 Elo'una yakın bir sonuç elde etti. Ancak, "yarı fiyatlı Opus" tam bir sonuç değil: Artificial Analysis, Sonnet 5.5'in en yüksek akıl yürütme yoğunluğunda ortalama her soru başına yaklaşık 193.000 çıktı Token ürettiğini ve bu, test ettikleri en Token tüketen yapı olduğunu buldu; bu nedenle tek bir soru maliyeti Sonnet 5'ten yaklaşık %50 daha yüksek oldu; CodeRabbit'in gerçek kod incelemesi testleri de Sonnet 5.5'in önceki nesilden yaklaşık iki kat daha hızlı olduğunu ancak Opus'un tespit edebildiği zor soruları hâlâ kaçırdığını gösterdi. Bu nedenle, bu model, Opus'un tam bir alternatifi değil, net ve tekrarlanabilir görevler için yeni bir ana model olarak daha uygundur.

Yazan: Anthropic

Anthropic, Sonnet'i günlük Agent ana gücü olarak yeniden konumlandırıyor

Sonnet 5.5, Claude 5.5 serisinin ikinci modelidir. Anthropic, bir hafta önce karmaşık açık görevler için çıkarılan Opus 5.5'ten farklı olarak, bunu sınırları net ve çok sayıda tekrarlı çalışma gerektiren günlük görevler için tasarlamıştır: program hatalarını düzeltmek, kod incelemek, araştırmalar yapmak ve belgeler, sunumlar ve elektronik tablolar oluşturmak.

Model, metin ve görüntü girdilerini destekler, 1 milyon Token bağlam sunar ve Claude web ve mobil uygulamalarında, Anthropic API'sinde, AWS'de, Google Cloud'da ve Microsoft Azure'da kullanılabilir. API adıclaude-sonnet-5-5'tür. Anthropic, parametre sayısını, model mimarisini, eğitim verilerini ve eğitim hesaplama gücünü açıklamamıştır; bu nedenle iyileştirmenin temel eğitim, sonrası eğitim, çıkarım stratejisi mi yoksa Agent araç zinciri optimizasyonundan kaynaklandığını belirlemek mümkün değildir.

Opus ile arasındaki fark sadece “daha zayıf yetenekler ve daha düşük fiyat” değil. Anthropic, yeni bir model bölüşümü oluşturmayı hedefliyor: Opus, eksik tanımlı sorular ve sürekli değerlendirme gerektiren karmaşık görevleri üstlenecek; Sonnet ise zaten netleşmiş işleri hızlıca gerçekleştirecek ve daha düşük maliyetle çağrı sayısını artırabilecek.

%70,6 ile %10,3, en dikkat çekici ve dikkatli yorumlanması gereken verilerdir

Sonnet 5.5, Anthropic tarafından duyurulan Terminal-Bench 4.0 testinde %70,6 puan aldı, Sonnet 5 ise %10,3 puan aldı ve Opus 5.5'in %66,4 puanını bile aştı. Bu benchmark, Agent'ın komut satırı ortamında çok adımlı profesyonel görevleri tamamlamasını gerektirir ve kod yazma, terminal işlemleri ve araç kullanımı arasındaki uyumu yansıtır.

Diğer projelerdeki artış bu kadar aşırı değilse de hâlâ belirgin. CursorBench 4.0, Sonnet 5'in %34,1'inden %55,5'e yükseldi ve Opus 5.5'in %57,8'ine yaklaşık iki puan mesafede; Araçlı Humanity’s Last Exam %54,9'dan %64,5'e çıktı; OSWorld 2.1 bilgisayar işlemleri %57,0'den %80,1'e yükseldi ve Opus'un %81,8'ine yaklaştı.

Profesyonel bilgi görevi GDPval-AA'da Sonnet 5.5, 1844 Elo; Opus 5.5 ise 1846 puan aldı; uzun süreli bilgi işi değerlendirme AA-Briefcase'de sırasıyla 1811 ve 1822 puan aldı. Anthropic, bu nedenle belirli sınırları net olan profesyonel işlerin artık flagman modeli varsayılan olarak çağırma ihtiyacının olmadığını düşünüyor.

Ancak bu sayılar, "Sonnet, Opus'u geçti" şeklinde basitçe birleştirilemez. Farklı projeler farklı derecelerde çıkarım gücü kullanır ve Anthropic, uzun süreli karar verme ve açık uçlu hedeflerle uğraşma gerektiren görevlerde Opus'un hâlâ belirgin şekilde daha güçlü olduğunu açıkça belirtmiştir.

FrontierCode'dan ilginç bir ters örnek: Sonnet 5.5, Xhigh çıkarım gücüyle %52,1 başarı elde ederken, Max'a yükseltildiğinde bu oran %46,2'ye düşüyor. Anthropic, modelin Max modunda daha sık birden fazla kod incelemesi alt Aracını başlattığını, bunun sonucunda iki kez zaman aşımına uğradığını veya görev kapsamının dışındaki kodları değiştirdiğini ve nihayetinde değerlendirme tarafından başarısız olarak işaretlendiğini açıklıyor.

Bu sonuç, daha fazla çıkarım ve daha fazla Agent'in mutlaka daha iyi cevaplar getirmeyeceğini göstermektedir. Model, aşırı kontrol yapma, görev kapsamını genişletme veya zaman bütçesini tüketecek şekilde puan kaybedebilir.

Her bir token düşüş olmadan, neden resmi olarak görev maliyetinin %30 daha düşük olduğunu söylüyor?

Sonnet 5.5'nin açık fiyatı, Sonnet 5 ile aynıdır: milyon girdi Token başına 2 dolar, milyon çıktı Token başına 10 dolar, önbellek yazma 2,5 dolar, önbellek okuma 0,2 dolar; bunlar Opus 5.5'in karşılık gelen fiyatlarının yarısıdır.

Anthropic'ın “tek görevde en fazla %30 daha ucuz” iddiası, API fiyat listesindeki düşüş değil, modelin aynı işi yaparken gerekli adım ve Token sayısının azalmasıdır. Resmi olarak, üretimin %30'dan fazla hızlandığı belirtiliyor; Slack, iç testlerde çıktı Token'larının yaklaşık %14 azaldığını gözlemledi, Atlassian, Agent hızının en fazla %30 arttığını söyledi, Lovable ise araç çağrısının yaklaşık üçte bir azaldığını ve Shell çalıştırma sayısının yaklaşık yarıya düştüğünü raporladı.

Bir varlık yönetimi şirketi, 2.441 finansal soru-cevap, çıkarım, analiz ve tahmin görevinde Sonnet 5.5'in ortalama her bir görevde yaklaşık 121.000 Token kullandığını, Sonnet 5'in ise 497.000 Token kullandığını tespit etti. Bu görevler, ortakların özel testleri olduğundan, dışarıdan görev zorluğu, ipuçları ve tam çıktılar kontrol edilemez; ancak sonuçlar, yeni modelin daha az tekrarlı arama, tekrarlı metin okuma veya uzun içsel çıkarımlar yaptığı yönünde ortak bir işaret vermektedir.

Bu, Ajanlar için özellikle önemlidir. Geleneksel sohbetlerde bir seferde yüzlerce token çıkışı sınırlı etki yaratır; ancak uzun süreli Ajanlar, bağlamı tekrar tekrar okur, araçları çağırır ve sonuçları düzeltir. Bir adımdaki fazlalık, onlarca tur sonra önemli bir zaman ve maliyet farkına dönüşebilir.

En yüksek akıl yürütme gücü, başka bir maliyet gerçekliğini ortaya çıkarıyor

Artificial Analysis'ın bağımsız testi, Sonnet 5.5'in en yüksek akıl yürütme yapılandırmasına 56 puan verdi ve genel akıllılık indeksinde Opus 5.5'in 58 puanına sadece 2 puan geride kaldı.

Ancak bu başarıya ulaşmak için yüksek bir maliyet ödenmiştir: Sonnet 5.5, ortalama her testte yaklaşık 193.000 çıktı Token üretmektedir; bu, ölçülen en yüksek seviyedir ve Opus 5.5 Max ile Sonnet 5 Max'ten yaklaşık %60 daha fazladır, GPT‑6 Astra Max'ın yaklaşık yedi katıdır. Tek bir soru başına maliyeti 7,60 dolar olarak tahmin edilmektedir, bu da Sonnet 5'ten yaklaşık %50 daha yüksektir.

Bu, Anthropic'ın "görev maliyetleri en fazla %30 azalır" iddiasıyla doğrudan çelişmiyor. Resmi sonuçlar tipik iş yüklerini ve daha düşük çıkarım yoğunluğunu tanımlıyor; Artificial Analysis, kapasite sınırını maksimize etmek için Max'ın etkinleştirildiği durumu ölçüyor.

İki sonuç birlikte, çıkarım gücünün model ürünlerinin bir parçası haline geldiğini gösteriyor. Sonnet 5.5, Düşük veya Orta modda çok yüksek bir maliyet-verim oranı sağlayabilir; Opus'u yakalamak için çıkarım gücünü Maksimum'a çıkartırsanız, her Token için daha ucuz olsa da, quá fazla üretim nedeniyle maliyet avantajını kaybedebilir.

Artificial Analysis ayrıca, Sonnet 5.5'in gerçek bilgi doğruluk oranının yaklaşık %54 olduğunu, Opus'un %66'sından daha düşük olduğunu ve bilimsel akıl yürütme projelerinde de yaklaşık altı puan geride kaldığını buldu. "Opus'a yakın" ifadesi, temel olarak Agent uç işlemlerine ve bazı bilgi işlerine dayanmaktadır ve tüm yeteneklere genellenemez.

Gerçek kod incelemesinde hız avantajı geçerli ve üst düzey farklar hâlâ mevcut.

CodeRabbit, bilinen hataları içeren gerçek açık kaynak projelerini kullanarak bir yayın günü testi gerçekleştirdi.

13 zor kod incelemesi senaryosunda, akıl yürütme özelliği etkinleştirilmiş Sonnet 5.5, Sonnet 5'in 4'ünden daha fazla olan 6 sorunu tespit etti; her ikisinin de etkili yorum doğruluk oranları sırasıyla %41,2 ve %40,0 oldu. Ancak Opus 5.5'in standart modu 8, Max modu ise 10 sorunu buldu, bu da karmaşık inceleme görevlerindeki farkın hâlâ belirgin olduğunu gösteriyor.

44 gerçek Pull Request'ten oluşan başka bir testte, Sonnet 5.5 ortalama her inceleme için 6 dakika 33 saniye, Sonnet 5 ise 13 dakika 31 saniye sürdü. İlk olan, 24% daha az yorum üretti ve önemsiz görüşler yalnızca bir önceki neslin yaklaşık üçte biriydi; açık fiyatlarla hesaplandığında, çekirdek model çağrısı ortalama yaklaşık 0,46 dolar iken, Sonnet 5 yaklaşık 1,16 dolar oldu.

Ancak, bu 44 PR'nin tam hata kapsama puanı, makalenin yayınlanma anında henüz tamamlanmamıştı, bu nedenle şu anda daha hızlı olduğu ve daha az çıktı ürettiği doğrulanabilirken, az yazılmış yorumların daha fazla gerçek sorunu kaçırdığından emin olunamıyor. 13 yüksek zorluklu vaka örneği de oldukça küçük; CodeRabbit kendisi, yönü gözlemlemek için yeterli olsa da genel sıralamayı belirlemek için yeterli olmadığını hatırlattı.

Daha mantıklı model görev dağılımı şudur: Sonnet 5.5, her PR için hızlı standart incelemeyi yürütür; güvenlik, temel mimari veya hataların kaçırılması yüksek maliyetli olan değişiklikler ise Opus veya insan uzmanlarına yükseltilir.

Görsel tasarım, genel çalışma modelinin bir satış noktası haline geliyor

Anthropic, Sonnet 5.5'in görsel tasarım yeteneğine özellikle vurgu yaptı. Resmi demo, Sonnet 5 ve 5.5'i tek bir HTML dosyasında 400 tane serçe sürüsü, rüzgârın şekillendirdiği kum tepeleri ve 24 küçük çanlı büyük bir saat oluşturmak için kullandı. Yeni model, daha hızlı üretiyor ve animasyon, katmanlama ve arayüz tamamlanması açısından daha yüksek kalitede.

Ayrıca şablonlara göre sunumlar da oluşturabilir. Anthropic, bir iç testte bir halka açık şirketin çeyreklik performans materyallerini, telefon görüşmesi transkriptini ve on sayfalık bir slayt şablonunu sağladı; iki uzman, Sonnet 5.5'in ilk sürümünün doğrudan gönderilebileceğini düşündü.

Bu hâlâ üretici tarafından seçilen gösterim örnekleridir ve modelin her kurumsal şablonu sabit bir şekilde anlayabileceğini göstermez. Karmaşık grafiklerin veri doğruluğu, marka kuralları ve alıntı kaynakları hâlâ insan kontrolü gerektirir, ancak bu, modelin sadece doğru içerik üretmekle kalmayıp aynı zamanda neredeyse tamamlanmış arayüzleri ve belgeleri sunmaya yönelik yeni bir rekabet yönünü yansıtmaktadır.

Güvenlik yeteneklerinin artırılması, bazı isteklerin eski model tarafından devralınması anlamına da gelir.

Sonnet 5.5, piyasaya sürüldüğü anda üst düzey ağ güvenliği koruması kullanan ilk Sonnet modelidir. Anthropic, ağ güvenliği yeteneklerinin Opus 5'e neredeyse eşit olduğunu belirttiğinden, sıradan güvenlik açıkları düzeltmeye devam edilecek ancak daha yüksek riskli ağ güvenliği talepleri şeffaf bir şekilde Sonnet 5'e yönlendirilecektir.

Şirket, kullanıcıları yanıltma, kullanıcı çıkarlarına aykırı davranış, yüksek riskli kötüye kullanım ve çevre sınırlarını aşma gibi davranışları yaklaşık 1850 senaryoda test etmektedir. Resmi açıklamaya göre, yeni model, çoğu ölçütte Sonnet 5 ile eşit veya daha iyidir ve tüm Claude modelleri arasında kaplama sınırlarını en az aktif olarak test eden modeldir.

Ancak bunlar çoğunlukla Anthropic'in dahili otomatik değerlendirme testleridir ve gerçek ortamdaki riskler için tam bir kanıt olarak kabul edilemez. Şirket kendi kendine de herhangi bir test setinin tüm hata modlarını tespit edemeyeceğini kabul ediyor.

Sonnet 5.5, Sonnet serisinin ilk anti-distilasyon sınıflandırıcısını içeren versiyonudur ve farklı hesaplar arasında çıkarım bağlamı aktarımını engellemek için “düşünme içeriğini koruma” mekanizmasını genişletmiştir. Genel geliştiriciler üzerinde sınırlı etkisi vardır, ancak bazı hesaplar arasında Claude Code diyaloglarını taşıyan iş akışları ayarlanmalıdır.

Gerçek değişim birinci sıradaki değil, "yeterince güçlü model"in varsayılan seçim haline gelmesi.

Sonnet 5.5, yeni bir model mimarisi açıklamadı ve Opus'u kapsamlı olarak geçemedi. Daha önemli olanı, önceki flagman modellerin üstleneceği büyük miktarlı işleri, daha hızlı ve birim Token maliyeti yarıya inen orta seviye modellere taşıdı.

Günlük binlerce kez çalışan müşteri hizmetleri, kod incelemesi, veri araştırması ve belge üretimi sistemleri için, genellikle tek bir en yüksek puan değil, her görevin kaç adımdan, kaç token'dan, ne kadar beklemekten ve hataların yükseltilebilir olup olmadığına karar verilir. Sonnet 5.5'in değeri tam olarak bu göstergelerde yoğunlaşmıştır.

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.