Anthropic Fable 5.1 API Güncellemesi Model Dijitalleştirmeyi Engelleyiyor

icon MarsBit
Paylaş
AI summary iconÖzet
Anthropic, Fable 5.1'i yayınladı, bu büyük API güncellemesi model distilasyonunu engelliyor. Güncelleme, Claude'nin akıl yürütmesinin yetkisiz şekilde çıkarılmasını önlemek için bağlam kontrolleri ekliyor. Değiştirilmiş istekler kullanan geliştiriciler hatalarla karşılaşıp bloklar kaldırılabilir. Kurallar, 31 Ağustos 2026'dan sonra oluşturulan yeni hesaplar için geçerli. Uygun kullanıcılar için performans artırıldı. Bu BTC güncellemesi ve ETH güncellemesi, model güvenliği yönündeki daha sıkı trendlerle uyumlu.

Büyük damıtma çağı sona eriyor!

2 Eylül'de Anthropic, API kurallarını değiştirdi ve kılıf büyük modelleri ile distilasyoncuların yolunu tamamen kesdi.

Claude

Daha önce, birçok şirket büyük hesaplama maliyetlerini ve uzun eğitim sürelerini ortadan kaldırmak için API aracılığıyla öncü modellerin çıkarım süreçlerini kullanarak kendi "küçük modellerini" eğitmeyi seçti.

Ancak bugünden itibaren bu olasılık ortadan kalktı.

Claude Fable 5.1, "Düşünme Bloklarını" Değiştirme İşlemiyle Yasa Dışı Hale Getiriyor

Anthropic, bu sefer Fable 5.1'i yayınladı ve en sıkı çözülme önleme mekanizmasını sundu.

Temel eylem, "düşünme bloğunu" sıkıca kilitlemektir.

“Düşünme Bloğu” nedir?

Basitçe ifade edersek, AI'nın size nihai cevabı vermeden önce zihninde gerçekleştirdiği CoT sürecidir.

Claude

Claude, zihinsel hesaplama yaparken karmaşık ve paralel yollar izler.

API çağrılarında, Claude bu akıl yürütme adımlarını kullanıcıya «düşünme blokları» olarak döndürür.

Normal çok adımlı diyaloglarda geliştiriciler, bu düşünme bloklarını sistem ipuçları, araçlar ve geçmiş mesajlarla birlikte Claude'a geri gönderir, böylece model bağlamı hatırlar ve diyalogun akışını korur.

Ancak tam olarak bu mekanizma, damıtıcılar için bir fırsat oldu.

Büyük bir açığa rastlandı: Çoklu diyaloglar boyunca, düşünme bloklarının öncesindeki ve sonraki bağlamı gizlice değiştirmek (örneğin, erken sistem uyarılarını veya geçmiş mesajları değiştirmek), Claude'un savunma mekanizmasını aşmak ve hatta Claude'un orijinal olarak gizlediği temel akıl yürütme mantığını ortaya çıkarmak mümkün!

Claude

Claude

Bu karmaşayı gidermek için Anthropic, Fable 5.1'de "bağlam tutarlılığı doğrulaması" adlı yeni bir kuralı kesinlikle uyguladı.

1. Aynı yoldan geri dön, tam olarak aynı şekilde: API, istemciden dönen "düşünme bloğunu", orijinal olarak oluşturduğu sistem talimatları, araçları ve geçmiş mesajlarıyla tamamen uyumlu olup olmadığını artık sıkı bir şekilde doğrulayacaktır.

2. El oynandı? Doğrudan hata! Sistem, bağlamın değiştirildiğini fark eder etmez, hatta bir karakter bile değiştirilirse hata verir! Nokta Nokta Tüm eşleştirmeler başarısız olacak ve API doğrudan hata mesajı dönecek, hizmet reddedilecektir.

Ayrıca, gerçek ihtiyaçları olan (örneğin, maliyetleri azaltmak için bağlam uzunluğunu sıkıştırmak zorunda kalan) legítim geliştiricilere hizmet etmek amacıyla Anthropic, "sıkı olmayan kip" sunmaktadır.

Bu modda isteğinizi kabul edebiliriz, ancak sistem "düşünme bloklarını" tamamen silecektir! Model, önceki akıl yürütme sürecini görmeden zorla cevap verecektir.

Bu, temelini sarmak anlamına gelir.

Claude

Claude, basit bir soru ve zor bir soru sorulduğunda, sadık çıkarım ve motive edici (sadık olmayan) çıkarım örnekleri

Endüstriyel damıtma, gerçekten ne kadar çılgınca?

Anthropic neden bu kadar çok sinirlenip bu kadar sıkı sınırlamalar getirdi?

Cevap: Konuyla ilgili ve son derece gerekli.

Şu anki yasa dışı damıtma, endüstriyel ölçeğe ulaşmıştır.

Geçen yıl, Anthropic güvenlik ekibi çarpıcı düzeyde kötüye kullanım gözlemledi.

Bu profesyonel "damıtma hakerleri", bir hesapla günlük birkaç soru sormak yerine, binlerce sahte hesap ve otomatiklenmiş betikler kullanarak API uç noktasında gün boyu ve gece boyu çılgınca "kazanç elde ediyor".

Claude

İşlem yöntemleri son derece gizli ve saldırgandır.

Daha önce de belirtildiği gibi, Anthropic, Claude'nin temel düşünme bloklarını uzun zamandır şifrelemiş olsa da, hakerler "bağlam enjeksiyonu" ve "diyalog yeniden yazma" tekniklerini kullandı.

Bu uygulama, Claude'a bir "hipnoz" uygulamak gibi, mantıksal karışıklık içinde kendi şifrelenmiş akıl yürütme sürecini açıp yazdırmaya zorlamaktır.

Bu nedenle, birçok küçük parametreli model, sıfırdan başlayarak hesaplama gücü biriktirmemiş ve algoritmik yenilikler yapmamış; sadece en iyi AI'ların cevap verme stratejilerini ezberleyerek performanslarını eşitleyebilmiştir.

Daha korkutucu olanı, bu uygulamanın doğrudan kırmızı çizgiyi aştığı ve güvenlik önlemlerinin çökmesine neden olduğu.

AI'nin en büyük endişe verici sorunu

İş kazançlarının kaybı, Anthropic için sadece "acı verici" olsa da, "yetenek ile güvenlik arasındaki kopma", tüm AI güvenliği topluluğunu korkutuyor.

Bu, Anthropic'ın kararlı bir şekilde harekete geçmesinin temel motivasyonudur.

Claude, GPT-4 gibi büyük modellerin yüksek zeka seviyesine sahip olmanın yanı sıra, son derece sıkı bir “değerler uyumu” ve güvenlik eğitimi aldıkları bilinmektedir. Bunlar, bomba yapmayı öğretmeyi, kötü amaçlı ransomware yazılımı yazmayı veya nefret söylemini yayınlamayı bilmektedir.

Bu “yetenek + güvenlik koruması” çift bağlantısı, büyük AI şirketleri tarafından milyonlarca dolar harcayarak RLHF ve kırmızı-mavi çatışmalarıyla kurulmuştur.

Claude

Ancak, distilasyon modeli bu güvenlik ağını mükemmel şekilde kaçtı!

Çalıştırıcılar, bağlamı değiştirerek Claude'un "düşünme bloklarını" zorla çıkardığında, yalnızca o yüksek zekânın "muhakeme yeteneğini" çıkarırlar, ancak temel güvenlik önlemlerini devralamazlar.

Bir kötülük organizasyonu gibi, Einstein'ın zekasını kopyaladı ama Einstein'ın ahlakını ve empatisini kopyalamadı.

Bu yasa dışı distilasyon yöntemiyle eğitilen sistemler, sahip olmaları gerekmeyen ileri düzey mantık ve kod yeteneklerini anlamsız bir şekilde miras alır.

Ancak kendileri bir «düşük güvence, zayıf koruma» temel modeli olduğundan, siber saldırı senaryoları üretmek veya biyolojik silah geliştirme konusunda yardım etmek için hakerlerin taleplerine kolayca yanıt verebilirler.

Yetenek ve güvenliğin ayrılması, günümüzdeki AI'nın en büyük riskidir.

Yeni kurallar uygulamaya girdi: Kim etkileniyor?

Bu baskı, ciddi geliştiricileri etkileyecek mi?

Endişe etmeyin, Anthropic, zararları en aza indirmeyi amaçlayan hassas bir "aşamalı uygulama" stratejisi izliyor.

Öncelikle «yeni hesap» geliyor.

Resmi belgelere göre, bu kısıtlama öncelikle en çok kötüye kullanım yapılan yeni hesaplarla başlayacaktır. Fable 5.1 modeli için bu güncelleme, 31 Ağustos 2026, 12:00:00 AM UTC sonrası oluşturulan yeni API hesaplarına uygulanacaktır.

Aşağıdaki kullanıcılar tamamen etkilenmeyeceklerdir.

1. Mevcut API Hesapları: Mevcut eski hesaplar, Fable 5.1 üzerinde geçici olarak etkilenmeyecektir. Bu, yasal geliştiricilere ayarlanmak için yeterli zaman sağlar.

2. Tüketim tarafı normal kullanıcılar: Eğer yalnızca web sürümü Claude.ai, Claude Code, Claude Cowork gibi resmi ürünlerin tüketim tarafı kullanıcıysanız ya da üçüncü taraf tarafından sunulan kapsamlı ürünler aracılığıyla normal sohbet yapıyorsanız, hiçbir şekilde etkilenmeyeceksiniz.

Claude

Etkilenen API geliştiricileri neye dikkat etmelidir?

Daha önceki uygulama entegrasyonlarınızda, özellikle maliyet tasarrufu amacıyla bağlam sıkıştırma veya diyalog ortasında yeni bir sistem uyarısı zorla enjekte etme gibi nedenlerle "diyalog ortasında erken turları yeniden yazma" tekniğini kullandıysanız, hemen kod mantığınızı ayarlamaya başlamalısınız.

Claude

Bu değişikliğe karşılık olarak Anthropic, kapsamlı bir geçiş kılavuzu sağlıyor. Geliştiricilerin iki seçeneği var.

Seçim 1: Bağlamın mutlak tutarlılığını koruyun. Orijinal düşünme bloğunu, sistem talimatını ve aracını tam olarak aynen geri gönderin.

İkinci Seçenek: API isteğinde "Sıkı Olmayan Mod"u seçin. Bu modda, bağlamı değiştirmeniz durumunda API hata vermeden veya işlemi durdurmadan, istekteki etkilenen düşünme bloklarını otomatik ve sessizce kaldırır.

Bu, modelin sonraki diyalogda önceki özel akıl yürütme süreçlerini «unutmasını» sağlar, ancak en azından diyalogunuzun veya görevinizin kesintiye uğramamasını sağlar.

Hatırlatmak gerekir: Şu anda bu kural için bir muafiyet süresi vardır, ancak Anthropic açıkça şu ifadeyi yapmıştır—「Düşünme」 mekanizması, gelecekteki model sürümlerinde tüm hesaplara uygulanacaktır!

Mevcut tampon penceresi de sınırlıdır.

Beklenmedik bir sürpriz: Dürüst insanlara fayda sağlıyor

Ayrıca, bu yeni düzenlemelerle birlikte, yasal geliştiriciler için maliyetlerde büyük bir düşüş ve yanıt hızında sıçrama gizliyor.

Bu nasıl yapıldı?

Anahtar nokta, «bağlam tutarlılığı»dır.

Geçmişte, geliştiricilerin bağlamı serbestçe değiştirebilmesi nedeniyle modelin her talebi «yeni» bir şekilde alması sağlanıyordu. Bu, hem hesaplama gücü harcamaya neden oluyordu, hem de çok yavaş çalışıyordu.

Şimdi, yeni kurallar herkesin «Düşünme Bloğu» ve etrafındaki sistem uyarılarını, geçmiş mesajları tamamen aynı tutmasını ve değiştirmemesini zorunlu kılıyor.

Bu, uyarı önbelleğinin çok yüksek bir oranda hit elde etmesini sağlıyor!

Şu anda, API sunucusu önceki diyalog bağlamını kolayca önbelleğe alabilir. Bir sonraki diyalog isteği geldiğinde, sistem verileri önbellekten doğrudan çağırır ve hemen eşleştirme tamamlanır.

Sonuç olarak: API yanıt süreleri büyük ölçüde kısalır, gecikme doğrusal olarak düşer ve geliştiricilerin API çağrısı maliyeti de önemli ölçüde azalır!

Bu "gözlemci olmayan eylem" taktiği, dürüst geliştiricilere gerçek para ile destek sağlamaktadır.

Toplamda, bu yeni düzenlemeler, AI endüstrisi için kesinlikle bir dönüm noktasıdır.

Küçük parametreli bir modelin büyük modeli yendiği hikâyeler, belki daha az olur.

Çekilme sonrası, kim çıplak yüzmektedir?

Kaynaklar:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

Düzenleyen: Aeneas

Bu yazı WeChat hesabından “Yeni Akıl” (ID: AI_era) tarafından yazılmıştır, yazar: ASI Vahiyleri

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.