Kemas kini API Anthropic Fable 5.1 menghalang distilasi model

icon MarsBit
Kongsi
AI summary iconRingkasan
Anthropic telah melancarkan Fable 5.1, kemas kini API utama yang menghalang distilasi model. Kemas kini ini menambahkan semakan konteks untuk menghentikan ekstraksi tidak sah terhadap penaakulan Claude. Pembangun yang menggunakan imbuhan yang diubah mungkin menghadapi ralat atau blok yang dikeluarkan. Peraturan ini berkuat kuasa untuk akaun baharu selepas 31 Ogos 2026. Prestasi ditingkatkan untuk pengguna yang mematuhi. Kemas kini BTC dan ETH ini selari dengan trend keselamatan model yang lebih ketat.

Zaman distilasi besar yang penuh semangat akan berakhir!

Pada 2 September, Anthropic melancarkan serangan kuat, secara langsung mengubah peraturan API dan memutuskan sepenuhnya jalan keluar bagi model berselubung dan pendidik distilasi.

Claude

Dahulu, ramai syarikat memilih untuk mengambil proses inferens daripada model terkemuka melalui API, kemudian menggunakan data tersebut untuk melatih model kecil mereka sendiri, demi mengurangkan kos pengiraan yang besar dan masa latihan yang panjang.

Tetapi selepas hari ini, kemungkinan ini tidak lagi wujud.

Claude Fable 5.1 melarang pengubahsuaian "Thinking Block"

Anthropic kali ini melancarkan Fable 5.1, yang memperkenalkan mekanisme anti-distilasi paling ketat sepanjang sejarah.

Tindakan utama ialah mengunci rapat-rapat "blok pemikiran".

Apa itu "Thinking Block"?

Secara ringkas, ia adalah proses CoT yang dilakukan AI di dalam fikirannya sebelum memberikan jawapan akhir.

Claude

Claude mengikuti laluan yang kompleks dan selari semasa berfikir secara mental.

Dalam panggilan API, Claude akan mengembalikan langkah-langkah penalaran ini kepada pengguna dalam bentuk "blok pemikiran".

Dalam perbualan berbilang putaran biasa, pembangun akan menghantar semula blok pemikiran ini bersama petunjuk sistem, alat, dan mesej sejarah kepada Claude, supaya model dapat mengingati konteks dan mengekalkan keberterusan perbualan.

Tetapi mekanisme inilah yang menjadi peluang bagi para penyuling.

Mereka menemui lubang besar: hanya dengan mengubah konteks sebelum dan selepas blok pemikiran dalam beberapa percakapan berturut-turut (contohnya, mengubah petunjuk sistem awal atau mesej sejarah), mereka boleh meruntuhkan mekanisme pertahanan Claude, bahkan menggalakkan Claude untuk memaparkan logik penalaran bawahannya yang sebelumnya disembunyikan!

Claude

Claude

Untuk mengatasi kekacauan ini, Anthropic memperkenalkan peraturan baharu "pengesahan konsistensi konteks" tanpa kompromi dalam Fable 5.1.

1. Kembali melalui jalan asal, tanpa perubahan apa-apa: API kini akan mengesahkan secara ketat bahawa "blok pemikiran" yang dikembalikan oleh klien adalah sama persis dengan petunjuk sistem, alat, dan pesan sejarah yang menghasilkannya.

2. Diubah? Langsung ralat! Sistem akan segera mengeluarkan ralat sekiranya mendapati konteks telah diubah, walaupun hanya satu Titik-titik Semua pasangan akan gagal, API akan terus mengembalikan pemberitahuan ralat dan menolak perkhidmatan.

Selain itu, untuk memenuhi keperluan pembangun sah yang benar-benar perlu mengubah konteks (contohnya, perlu memendekkan panjang konteks untuk menghemat kos), Anthropic menyediakan modus "tidak ketat".

Dalam mod ini, permintaan anda akan diluluskan, tetapi sistem akan menghapus semua "blok pemikiran" secara langsung! Model akan menjawab secara paksa tanpa melihat proses penalaran sebelumnya.

Langkah ini benar-benar mengambil sumber akarnya.

Claude

Apabila Claude ditanya mengenai satu soalan yang lebih mudah dan satu soalan yang lebih sukar, contoh penalaran setia dan penalaran bermotivasi (tidak setia)

Sejauh mana kegilaan penyulingan perindustrian?

Kenapa Anthropic perlu marah besar dan mengenakan sekatan yang sangat ketat?

Jawapannya adalah: mengenai, dan sangat diperlukan.

Kerana penyulingan haram semasa ini telah berkembang kepada skala perindustrian.

Dalam setahun terakhir, pasukan keselamatan Anthropic telah memantau penyalahgunaan yang mengejutkan.

Para "perompak penyulingan" profesional ini bukan sekadar bertanya beberapa soalan setiap hari menggunakan satu akaun, tetapi menggunakan ribuan akaun palsu dan skrip automatik untuk secara berterusan mengeksploitasi API secara giat.

Claude

Teknik operasi mereka sangat tersembunyi dan agresif.

Seperti yang telah disebutkan sebelumnya, walaupun Anthropic telah mengenkripsi blok pemikiran utama Claude sejak lama, para peretas menggunakan teknik "injeksi konteks" dan "penulisan semula perbualan".

Tindakan ini seakan-akan menghipnotis Claude, menyebabkannya dalam kekacauan logik, secara aktif menghuraikan dan mencetak proses penalaran terenkripsi sendiri.

Oleh itu, banyak model parameter kecil tidak melalui proses pengumpulan kekuatan pengiraan dan inovasi algoritma dari awal, tetapi hanya menghafal pendekatan jawapan AI terkemuka, sehingga mampu mencapai prestasi yang sepadan.

Yang lebih menakutkan, amalan ini secara langsung menyentuh garis merah, menyebabkan kegagalan keselamatan.

Kekhawatiran terbesar terhadap AI yang tidak terkawal

Jika kerugian kepentingan perniagaan hanya membuat Anthropic "kesakitan", maka "pemisahan antara kemampuan dan keselamatan" membuat seluruh komuniti keselamatan AI merasa takut.

Ini juga merupakan motivasi utama Anthropic untuk mengambil tindakan tegas.

Seperti yang diketahui, model besar seperti Claude dan GPT-4, walaupun memiliki kecerdasan yang sangat tinggi, juga telah menerima latihan keselamatan dan "penyesuaian nilai" yang sangat ketat. Mereka tahu tidak boleh mengajar orang membuat bom, tidak boleh menulis perisian perompak jahat, dan tidak boleh mengeluarkan ucapan kebencian.

Pengikatan ganda "keupayaan + pagar keselamatan" ini dibina oleh syarikat AI besar yang menghabiskan berjuta-juta dolar untuk RLHF dan pertandingan merah-biru.

Claude

Namun, model distilasi mengelakkan jaring keselamatan ini dengan sempurna!

Apabila para pendistilasi memodifikasi konteks untuk memaksa Claude mengeluarkan "blok pemikiran"nya, mereka hanya mengambil sebahagian "keupayaan penarikan kesimpulan" yang berkecerdasan tinggi, tetapi sama sekali tidak dapat mewarisi jaminan keselamatan asas.

Seperti sebuah organisasi jahat yang mengklon IQ Einstein tetapi tidak mengklon moral dan empati Einstein.

Sistem yang dilatih menggunakan kaedah penyulingan haram ini akan secara ajaib mewarisi logik dan kemampuan kod tinggi yang seharusnya tidak dimilikinya.

Namun, kerana ia sendiri adalah model dasar dengan "perlindungan rendah dan penghalang lemah", ia akan dengan tanpa ragu-ragu memenuhi permintaan peretas untuk menghasilkan skrip serangan siber, atau membantu dalam pembangunan senjata biologi.

Pemisahan antara kemampuan dan keselamatan adalah risiko terbesar dalam AI hari ini.

Peraturan baharu dilaksanakan: Siapa yang terkesan?

Serangan ini akan memberi kesan kepada pembangun yang serius?

Jangan risau, Anthropic telah mengambil strategi "pelaksanaan bertahap" yang tepat untuk meminimumkan kesan sampingan.

Yang pertama ialah « akaun baharu ».

Berdasarkan dokumen rasmi, sekatan ini pertama kali ditujukan kepada akaun baharu yang paling banyak menyalahgunakan. Untuk model Fable 5.1, kemas kini ini hanya berkuat kuasa terhadap akaun API baharu yang dicipta selepas 31 Ogos 2026, 12:00:00 AM UTC.

Kalangan berikut boleh tenang sepenuhnya, anda tidak terkesan sama sekali.

1. Akaun API semasa: Akaun lama yang sedia ada tidak terjejas sementara di Fable 5.1. Ini memberikan masa yang mencukupi kepada pembangun sah untuk membuat penyesuaian.

2. Pengguna biasa di sisi penggunaan: Jika anda hanya menggunakan versi laman web Claude.ai, atau produk rasmi seperti Claude Code, Claude Cowork, atau berbual secara normal melalui produk pihak ketiga, anda tidak akan mengalami gangguan apa-apa.

Claude

Apa yang perlu diperhatikan oleh pembangun API yang terkesan?

Jika anda sebelum ini menggunakan teknik "menulis semula putaran awal di tengah perbualan" dalam integrasi aplikasi anda (contohnya untuk mengurangkan kos melalui pemampatan konteks, atau memaksa menyuntikkan amaran sistem baru di tengah perbualan), anda perlu segera menyesuaikan logik kod anda.

Claude

Untuk menghadapi perubahan ini, Anthropic menyediakan panduan migrasi yang lengkap. Pembangun mempunyai dua pilihan.

Pilih satu: Kekalkan kekonsistenan konteks secara mutlak. Kembalikan blok pemikiran, petunjuk sistem, dan alat asal tanpa perubahan.

Pilihan dua: Pilih "modus tidak ketat" dalam permintaan API. Dalam modus ini, walaupun anda mengubah konteks, API tidak akan menghentikan atau mengeluarkan ralat, tetapi akan secara automatik dan senyap menghapus blok pemikiran yang terjejas daripada permintaan.

Walaupun ini akan membuat model 'lupa' proses penalaran sebelumnya dalam perbualan seterusnya, ia sekurang-kurangnya menjamin perbualan atau tugas anda tidak terganggu.

Perlu diingat: Walaupun peraturan ini kini mempunyai tempoh pengecualian, Anthropic telah menyatakan dengan jelas—mekanisme "Keep Thinking" akan dikenakan kepada semua akaun dalam versi model masa depan!

Jangka masa bantalan yang ada juga terhad.

Kejutan tak terduga: Memberi manfaat kepada orang jujur

Selain itu, selepas peraturan baharu ini, terdapat kebaikan tersembunyi bagi pembangun sah—penurunan besar dalam kos dan peningkatan pantas dalam kelajuan respons.

Bagaimana ini dilakukan?

Intinya ialah «konsistensi konteks».

Di masa lalu, kerana pembangun boleh mengubah suai konteks secara sewenang-wenang, setiap permintaan yang diterima model adalah «baharu». Ini tidak hanya menghabiskan kuasa pengiraan, tetapi juga sangat perlahan.

Sekarang, peraturan baharu memaksa semua orang untuk mengekalkan blok pemikiran serta petunjuk sistem dan mesej sejarah di sekitarnya secara tepat, tanpa sebarang perubahan.

Ini secara teknikal mencipta syarat yang sempurna: cache pemandu boleh mencapai kadar kejadian yang sangat tinggi!

Sekarang, pelayan API boleh dengan mudah menyimpan konteks perbualan sebelumnya secara langsung ke dalam cache. Semasa permintaan perbualan seterusnya tiba, sistem secara langsung mengambil data daripada cache dan menyelesaikan pencocokan secara segera.

Hasilnya: masa respons API berkurang secara ketara, latensi menurun drastik, dan kos panggilan API untuk pembangun juga akan berkurang secara signifikan!

Langkah "tanpa sengaja menanam pohon" ini boleh dikatakan sebagai subsidi wang sungguhan kepada pembangun yang jujur.

Secara keseluruhan, peraturan baharu ini merupakan titik balik penting bagi seluruh industri AI.

Cerita tentang parameter kecil yang menghancurkan model besar mungkin akan menjadi lebih sedikit.

Selepas air surut, siapakah yang berenang tanpa pakaian?

Rujukan:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

Suntingan: Aeneas

Artikel ini berasal daripada akaun微信公众号 "XinZhiYuan" (ID: AI_era), penulis: ASI Revelation

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.