Pembaruan API Anthropic Fable 5.1 Memblokir Distilasi Model

icon MarsBit
Bagikan
AI summary iconRingkasan
Anthropic merilis Fable 5.1, pembaruan API utama yang memblokir distilasi model. Pembaruan ini menambahkan pemeriksaan konteks untuk mencegah ekstraksi tidak sah terhadap penalaran Claude. Pengembang yang menggunakan prompt yang diubah mungkin mengalami kesalahan atau blokir yang dihapus. Aturan ini berlaku untuk akun baru setelah 31 Agustus 2026. Kinerja ditingkatkan untuk pengguna yang patuh. Pembaruan BTC dan pembaruan ETH ini selaras dengan tren keamanan model yang lebih ketat.

Zaman distilasi besar-besaran akan segera berakhir!

Pada 2 September, Anthropic menerjang keras, langsung mengubah aturan API dan memutus habis jalan keluar bagi model berlapis dan para pendidik distilasi.

Claude

Dulu, banyak perusahaan memilih untuk mengambil proses inferensi dari model unggulan melalui API, lalu menggunakan data tersebut untuk melatih 'model kecil' mereka, demi menghemat biaya komputasi besar dan waktu pelatihan yang panjang.

Tetapi mulai hari ini, kemungkinan semacam itu tidak ada lagi.

Claude Fable 5.1 melarang manipulasi "thinking block"

Anthropic kali ini meluncurkan Fable 5.1, yang memperkenalkan mekanisme anti-distilasi paling ketat sepanjang sejarah.

Tindakan intinya adalah mengunci erat-erat "blok pemikiran".

Apa itu "Thinking Block"?

Secara sederhana, proses CoT yang dilakukan AI di dalam pikirannya sebelum memberikan jawaban akhir.

Claude

Claude dalam proses berpikir saat melakukan perhitungan mental memiliki jalur yang kompleks dan paralel

Dalam panggilan API, Claude akan mengembalikan langkah-langkah penalaran ini kepada pengguna dalam bentuk "blok pemikiran".

Dalam percakapan berulang normal, pengembang akan mengirim kembali blok-blok pemikiran ini bersama dengan petunjuk sistem, alat, dan pesan historis ke Claude, agar model dapat mengingat konteks dan menjaga kelancaran percakapan.

Tetapi justru mekanisme inilah yang menjadi peluang bagi para penyuling.

Mereka menemukan celah besar: hanya dengan secara diam-diam mengubah konteks sebelum dan sesudah blok pemikiran dalam percakapan berulang (misalnya, mengubah petunjuk sistem awal atau pesan historis), mereka dapat menghancurkan mekanisme pertahanan Claude, bahkan mendorong Claude untuk mengungkap logika inferensi bawahannya yang sebelumnya disembunyikan!

Claude

Claude

Untuk mengatasi kekacauan ini, Anthropic secara tegas meluncurkan aturan baru "verifikasi konsistensi konteks" di Fable 5.1.

1. Kembali melalui jalur yang sama, tanpa perubahan satu kata pun: API sekarang akan secara ketat memverifikasi apakah "blok pemikiran" yang dikembalikan klien sama persis dengan prompt sistem, alat, dan pesan historis yang digunakan untuk menghasilkannya.

2. Diubah-ubah? Langsung error! Sistem akan langsung memberikan error jika mendeteksi perubahan pada konteks, sekecil apa pun Klik Semua akan gagal dipasangkan, API akan langsung mengembalikan pesan kesalahan dan menolak layanan.

Selain itu, untuk melayani pengembang legal yang benar-benar memerlukan modifikasi konteks (misalnya, perlu memperpendek panjang konteks untuk menghemat biaya), Anthropic menyediakan mode "tidak ketat".

Dalam mode ini, permintaan Anda dapat diterima, tetapi sistem akan langsung menghapus seluruh "blok pemikiran"! Model akan menjawab secara paksa tanpa melihat proses penalaran sebelumnya.

Trik ini benar-benar mencabut alas perapian.

Claude

Ketika Claude ditanya tentang pertanyaan yang lebih sederhana dan pertanyaan yang lebih sulit, contoh penalaran setia dan penalaran motivasional (tidak setia)

Seberapa gila penyulingan industri?

Mengapa Anthropic sampai marah besar dan menerapkan batasan yang sangat ketat?

Jawabannya adalah: mengenai, dan sangat diperlukan.

Karena distilasi ilegal saat ini telah berkembang menjadi skala industri.

Dalam setahun terakhir, tim keamanan Anthropic telah mengamati penyalahgunaan yang mengejutkan.

Para "peretas distilasi" profesional ini tidak hanya bertanya beberapa pertanyaan setiap hari dengan satu akun, tetapi menggunakan ribuan akun palsu dan skrip otomatis untuk secara terus-menerus mengeksploitasi API secara berlebihan.

Claude

Metode operasi mereka sangat tersembunyi dan agresif.

Seperti yang telah disebutkan sebelumnya, meskipun Anthropic telah mengenkripsi blok pemikiran inti Claude sejak lama, para peretas menggunakan teknik "context injection" dan "dialog rewriting".

Tindakan ini seperti melakukan "hipnosis" terhadap Claude, sehingga ia secara aktif mendekripsi dan mencetak proses penalaran terenkripsinya sendiri dalam kekacauan logika.

Oleh karena itu, banyak model parameter kecil tidak melalui proses peningkatan daya komputasi dan inovasi algoritma dari nol, tetapi hanya menghafal pendekatan jawaban AI terkemuka, sehingga mampu mencapai kinerja yang sebanding.

Yang lebih menakutkan lagi, praktik ini secara langsung menyentuh garis merah, menyebabkan kegagalan keamanan.

Ancaman terbesar dari kehilangan kendali AI

Jika kerugian kepentingan bisnis hanya membuat Anthropic "kesakitan", maka "pemisahan antara kemampuan dan keamanan" membuat seluruh komunitas keamanan AI merasa takut.

Ini juga merupakan motivasi inti di balik keputusan Anthropic untuk mengambil tindakan tegas.

Seperti yang diketahui, model besar seperti Claude dan GPT-4, meskipun memiliki kecerdasan sangat tinggi, juga telah menjalani pelatihan keamanan dan 'penyelarasan nilai' yang sangat ketat. Mereka tahu tidak boleh mengajari orang membuat bom, tidak boleh menulis perangkat lunak peretasan jahat, dan tidak boleh menyebarkan ujaran kebencian.

Keterikatan ganda berupa "kemampuan + pelindung keamanan" ini dibangun oleh perusahaan AI besar dengan menghabiskan puluhan juta dolar untuk RLHF dan pertandingan merah-biru.

Claude

Namun, model distilasi berhasil menghindari jaring pengaman ini dengan sempurna!

Ketika para pendistilasi memodifikasi konteks untuk memaksa Claude mengungkapkan "blok pemikiran"-nya, mereka hanya mengekstraksi "kemampuan penalaran" berkecerdasan tinggi itu, tetapi sama sekali tidak dapat mewarisi jaminan keamanan dasarnya.

Seperti organisasi jahat yang mengkloning kecerdasan Einstein tanpa mengkloning moral dan empati Einstein.

Sistem yang dilatih dengan metode distilasi ilegal ini secara ajaib akan mewarisi kemampuan logika dan kode tingkat tinggi yang seharusnya tidak dimilikinya.

Namun karena mereka sendiri adalah model dasar dengan "jaminan rendah dan perlindungan lemah", mereka tidak akan ragu untuk merespons permintaan peretas, seperti menghasilkan skrip serangan siber atau membantu pengembangan senjata biologis.

Pemisahan antara kemampuan dan keamanan adalah risiko terbesar dalam AI saat ini.

Peraturan baru diterapkan: Siapa yang terdampak?

Apakah serangan ini akan memengaruhi pengembang yang serius?

Jangan khawatir, Anthropic telah mengambil strategi "pelaksanaan bertahap" yang tepat untuk meminimalkan dampak tidak diinginkan.

Yang pertama adalah "akun baru".

Berdasarkan dokumen resmi, pembatasan ini pertama kali diterapkan pada akun baru yang paling banyak menyalahgunakan. Untuk model Fable 5.1, pembaruan ini hanya berlaku untuk akun API baru yang dibuat setelah 31 Agustus 2026 pukul 12:00:00 AM UTC.

Kelompok berikut dapat benar-benar tenang, karena Anda sama sekali tidak terpengaruh.

1. Akun API yang ada: Akun lama yang sudah ada tidak terpengaruh sementara waktu di Fable 5.1. Ini memberikan waktu yang cukup bagi pengembang yang sah untuk menyesuaikan diri.

2. Pengguna akhir biasa: Jika Anda hanya menggunakan versi web Claude.ai, atau produk resmi seperti Claude Code, Claude Cowork, atau berinteraksi secara normal melalui produk pihak ketiga yang berbentuk wrapper, Anda tidak akan mengalami gangguan apa pun.

Claude

Apa yang perlu diperhatikan oleh pengembang API yang terdampak?

Jika dalam integrasi aplikasi sebelumnya Anda secara tidak sengaja menggunakan teknik "menulis ulang siklus awal di tengah percakapan" (misalnya untuk menghemat biaya melalui kompresi konteks, atau menyisipkan peringatan sistem baru secara paksa di tengah percakapan), Anda harus segera menyesuaikan logika kode Anda.

Claude

Untuk mengatasi perubahan ini, Anthropic menyediakan panduan migrasi yang komprehensif. Pengembang memiliki dua pilihan.

Pilih satu: pertahankan konsistensi absolut konteks. Kembalikan blok pemikiran, petunjuk sistem, dan alat aslinya tanpa perubahan apa pun.

Pilihan dua: Pilih mode "non-strict" dalam permintaan API. Dalam mode ini, meskipun Anda mengubah konteks, API tidak akan menghasilkan kesalahan atau menghentikan proses, tetapi akan secara otomatis dan diam-diam menghapus blok pemikiran yang terpengaruh dari permintaan.

Meskipun ini akan membuat model "lupa" proses penalaran sebelumnya dalam percakapan berikutnya, setidaknya ini menjamin percakapan atau tugas Anda tidak terganggu.

Perlu diingat: meskipun saat ini ada masa pengecualian untuk aturan ini, Anthropic telah menyatakan secara jelas—mekanisme "Keep Thinking" akan berlaku untuk semua akun di versi model mendatang!

Periode buffer yang ada juga terbatas.

Kejutan tak terduga: Memberi manfaat kepada orang jujur

Selain itu, setelah peraturan baru ini, terdapat manfaat tersembunyi bagi pengembang resmi—penurunan biaya yang signifikan dan peningkatan kecepatan respons.

Bagaimana ini bisa dilakukan?

Intinya adalah "konsistensi konteks".

Di masa lalu, karena pengembang dapat mengubah konteks secara sembarangan, setiap permintaan yang diterima model bersifat 'baru'. Hal ini tidak hanya memakan daya komputasi, tetapi juga sangat lambat.

Sekarang, aturan baru memaksa semua orang untuk tetap mempertahankan «Thinking Block» serta prompt sistem dan pesan historis di sekitarnya secara identik, tanpa mengubahnya.

Ini secara teknis menciptakan kondisi sempurna: cache prompt dapat mencapai tingkat keberhasilan yang sangat tinggi!

Sekarang, server API dapat dengan mudah menyimpan konteks percakapan sebelumnya ke dalam cache. Ketika permintaan percakapan berikutnya datang, sistem langsung mengambil data dari cache dan menyelesaikan pencocokan secara instan.

Hasilnya: waktu respons API berkurang drastis, latensi turun tajam, dan biaya pemanggilan API bagi pengembang juga akan berkurang secara signifikan!

Trik "tanpa sengaja menanam pohon" ini dapat dianggap sebagai subsidi nyata bagi para pengembang yang jujur.

Secara keseluruhan, peraturan baru ini jelas merupakan titik balik bagi seluruh industri AI.

Cerita tentang parameter kecil yang menghancurkan model besar mungkin akan jauh lebih sedikit.

Setelah air surut, siapa yang berenang telanjang?

Referensi:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

Diedit oleh: Aeneas

Artikel ini berasal dari akun WeChat "Sinzhiyuan" (ID: AI_era), penulis: ASI Revelation

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.