Ang Anthropic Fable 5.1 API Update ay nag-block sa model distillation

icon MarsBit
I-share
AI summary iconSummary
Ipinakilala ni Anthropic ang Fable 5.1, isang malaking API update na nagtatapon ng model distillation. Idinagdag ng update ang context checks upang pigilan ang hindi awtorisadong pagkuha ng pag-iisip ni Claude. Maaaring makaranas ng mga error o natanggal na mga block ang mga developer na gumagamit ng mga binago na prompt. Ang mga patakaran ay magpapalabas sa mga bagong account pagkatapos ng August 31, 2026. Pinabuti ang performance para sa mga gumagamit na sumusunod. Ang BTC update at ETH update na ito ay nagsasama sa mga trend ng mas mahigpit na seguridad ng model.

Magtatapos na ang malakas na panahon ng distilasyon!

Sa exactly September 2, ang Anthropic ay nagbigay ng malakas na hamon, na agad na binago ang mga patakaran sa API at lubos na pinagtigil ang mga path ng mga modelong nagpapakita at mga distiller.

Claude

Noong nakaraan, maraming kumpanya ang pumili na gamitin ang API upang kunin ang proseso ng inference ng mga pinakamalalaking modelo, upang maiwasan ang malaking gastos sa computing power at mahabang panahon sa pagtuturo, at gamitin ang mga data na ito upang turuan ang kanilang sariling 'maliit na modelo'.

Ngunit mula sa araw na ito, ang posibilidad na ito ay wala nang magiging totoo.

Claude Fable 5.1 ay ipinagbawal ang pagbabago ng "Thought Blocks"

Ang Fable 5.1 na inilabas ni Anthropic ay naglunsad ng pinakamalakas na mekanismo laban sa distilasyon sa kasaysayan.

Ang pangunahing aksyon ay ang matigas na pagsisigla sa “block ng pag-iisip”.

Ano ang “Thought Block”?

Sa simpleng salita, ang CoT process ay ang proseso na ginagawa ng AI sa isip bago ibigay ang final answer.

Claude

Ang Claude ay gumagamit ng mga kumplikado at paralel na landas sa kanyang isip habang gumagawa ng mental calculation.

Sa mga API call, gagawin ng Claude ang mga hakbang sa pag-iisip bilang mga “thought blocks” at ibabalik sa user.

Sa normal na maraming pagkakataon na pag-uusap, ang mga developer ay babalikin ang mga bloke ng pag-iisip kasama ang system prompt, mga kasangkapan, at mga nakaraang mensahe sa Claude upang tandaan ng modelo ang konteksto at panatilihin ang pagkakasunod-sunod ng usapan.

Ngunit justo ang mekanismong ito ang naging pagkakataon para sa mga distilyador.

Nakakita sila ng malaking butas: kung ang konteksto bago at pagkatapos ng bloke ng pag-iisip ay maiiwan nang tahimik sa maraming pag-uusap (tulad ng pagpapalit ng mga nakaraang system prompt o mga mensahe), maaaring sirain ang mekanismo ng pagtatanggol ni Claude, at kahit na hikayatin si Claude na ibuhos ang kanyang nakatago na pundamental na proseso ng pag-iisip!

Claude

Claude

Para sa kaguluhan na ito, inilabas ng Anthropic sa Fable 5.1 ang bagong patakaran na “Context Consistency Verification” nang walang pagmamaliw.

1. Balik sa orihinal, walang pagbabago: Ang API ay magiging mahigpit sa pag-verify kung ang «thought block» na ibinabalik ng kliyente ay may kasing-akma na sistema prompt, mga kasangkapan, at kasaysayan ng mensahe nang unang pagkakagawa nito.

2. May nangyari ang pagbabago? Direktang error! Kung makakita ang sistema ng anumang pagbabago sa konteksto, kahit isang Pindutin Lahat ng pagkakatugma ay magkakaroon ng pagkabigo, at ang API ay diretso na magbabalik ng error message at tatanggihan ang serbisyo.

At, upang suportahan ang mga legal na developer na talagang kailangan ng pagbabago sa konteksto (tulad ng pagpapaliit ng haba ng konteksto upang matipid), binibigyan ka ng Anthropic ng isang “non-strict mode”.

Sa ilalim ng mode na ito, ang iyong hiling ay maaaring pasukin, ngunit ang sistema ay direktang aalisin ang lahat ng “mga bloke ng pag-iisip”! Ang modelo ay magiging pilit na sumagot nang walang makita ang dating proseso ng pag-iisip.

Ang paraan na ito ay tulad ng pag-alis sa kahoy sa ilalim ng kawali.

Claude

Kapag tinanong si Claude ng isang mas simpleng tanong at isang mas mahirap na tanong, mga halimbawa ng tapat na pag-iisip at pag-iisip na motibado (hindi tapat)

Just how insane is industrial-grade distillation?

Bakit nagagalit si Anthropic at nagtatag ng mga limitasyong sobrang stricte?

Sagot ay: Tungkol sa, at lubos na kinakailangan.

Dahil sa kasalukuyang ilegal na distilasyon, ito ay naging sukat na industriyal.

Sa nakaraang taon, nakita ng security team ng Anthropic ang nakakatakot na pag-abuso.

Ang mga propesyonal na “distilled hackers” na ito ay hindi nagtatanong ng ilang tanong araw-araw gamit ang isang account, kundi gumagamit ng libu-libong pekeng account at automated scripts upang patuloy na mag-“harvest” ng mga benefit sa API araw at gabi.

Claude

Ang kanilang pamamaraan ay sobrang lihim at agresibo.

Nakasaad na sa itaas na bagaman sinira na ng Anthropic ang pangunahing bloke ng pag-iisip ni Claude, ginamit ng mga hacker ang teknik na “context injection” at “dialogue rewriting”.

Ang paggawa na ito ay parang magpapahinga kay Claude, upang sa gitna ng pagkakamali sa lohika, aktibong i-decrypt at iprint out ang kanyang encrypted na proseso ng pag-iisip.

Kaya maraming maliit na modelo ay hindi nagdaan sa pagpupuno ng computing power at pag-iinspire ng algorithm mula sa zero, kundi simple lang na natutunan ang mga paraan ng pag-sagot ng pinakamataas na AI, at naging katumbas na performance.

Mas takot na ito ay direktang nagtatapos sa pula, na nagresulta sa pagbagsak ng seguridad.

Pinakamalaking banta ng pagkawala ng kontrol sa AI

Kung ang pagkawala ng komersyal na interes ay nagdudulot lamang ng "sakit sa karnay" sa Anthropic, ang pagkakawala ng ugnayan sa kakayahan at kaligtasan ay nagdudulot ng takot sa buong komunidad ng AI safety.

Ito rin ang pangunahing motibo kung bakit pinili ng Anthropic na gawin ang malaking pagkilos.

Kilala nang malawak na ang mga malaking modelo tulad ng Claude at GPT-4, na may sobrang mataas na IQ, ay nakatanggap din ng napakatigas na pagsasanay sa “pagkakasundo ng mga halaga” at kaligtasan. Alam nila na hindi dapat sila magturo kung paano gumawa ng bomba, mag-isip ng masamang ransomware, o maglabas ng mga pahayag ng pagkakaroon ng kasamaan.

Ang dual binding na ito ng “kakayahan + safety guardrails” ay itinatag ng mga malalaking AI company sa pamamagitan ng paggugol ng milyon-milyon dolyar para sa RLHF at red-blue team adversarial testing.

Claude

Ngunit ang distilled model ay nakaiwas nang perpekto sa seguridad na ito!

Kapag ginagawa ng mga distilled ang pagbabago sa konteksto upang makakuha ng mga “block ng pag-iisip” ni Claude, natatanggap lamang nila ang bahagi ng “kakayahang mag-isip” na mataas na intelektwal, ngunit hindi kayang manatili ang pondo na seguridad.

Tulad ng isang masamang organisasyon na klon ang IQ ni Einstein ngunit hindi klon ang kanyang moralidad at empatiya.

Ang mga sistema na tinuturuan gamit ang ilegal na distilasyon ay kakamuyan nang walang dahilan ang kanilang sariling advanced na lohika at kakayahan sa code.

Ngunit dahil sila ay isang "mababang proteksyon, mahinang safeguard" na pundasyonal na modelo, sila ay walang pag-aalinlangan na sumagot sa mga hiling ng mga hacker upang lumikha ng mga script para sa cyber attack, o tumulong sa pagbuo ng mga biolohikal na armas.

Ang pagkakawala ng ugnayan sa kakayahan at kaligtasan ay ang pinakamalaking panganib sa kasalukuyang AI.

Bagong patakaran na ipinatutupad: Sino ang naaapektuhan?

Makaaapekto ba ang pag-atake na ito sa mga seriyosong developer?

Huwag mag-alala, ginamit ng Anthropic ang tumpak na "phased implementation" strategy upang mabawasan ang aksidenteng epekto.

Ang unang una ay ang «bagong account».

Ayon sa opisyal na dokumento, ang pagbabawal na ito ay unang inilapat sa mga bagong akawnt na may pinakamalaking pag-abuso. Para sa modelo ng Fable 5.1, ang update na ito ay magpapalabas lamang sa mga bagong API account na nilikha pagkatapos ng Agosto 31, 2026, 12:00:00 AM UTC.

Ang mga sumusunod na grupo ay maaaring magkaroon ng kapanatagan—hindi kayo napapaloob.

1. Mga umiiral na API account: Ang mga umiiral na lumang account ay hindi nakakaapekto sa Fable 5.1. Ito ay nagbibigay ng sapat na oras sa mga legal na developer upang makapag-adjust.

2. Karaniwang gumagamit sa konsyumer: Kung ikaw ay gumagamit lamang ng web version ng Claude.ai, o ng mga opisyal na produkto tulad ng Claude Code o Claude Cowork, o kaya ay normal na nakikipag-usap sa pamamagitan ng third-party na produkto, hindi ka makakaranas ng anumang pagkakaabala.

Claude

Ano ang dapat tandaan ng mga developer ng API na naapektuhan?

Kung sa iyong dating application integration, ginamit mo ang teknolohiya na “mag-rewrite ng mga nakaraang round sa gitna ng usapan” (tulad ng context compression para mag-save ng gastos, o pagpapakilala ng bagong system prompt sa gitna ng usapan), kailangan mong agad na i-adjust ang iyong code logic.

Claude

Upang tugunan ang pagbabagong ito, binigyan ng Anthropic ang kompletong gabay sa paglipat. May dalawang pagpipilian para sa mga developer.

Piliin ang Isang: Panatilihin ang absolute na pagkakatugma sa konteksto. Ibalik ang orihinal na bloke ng pag-iisip, sistema at kasangkapan nang walang anumang pagbabago.

Piliin ang Option 2: Magpasya na sumali sa "Non-Strict Mode" sa API request. Sa mode na ito, kahit na baguhin mo ang konteksto, hindi magkakaroon ng error o paghinto ang API, kundi awtomatikong tatanggalin nito nang tahimik ang mga affected thought blocks sa request.

Bagaman ito ay magiging sanhi na "mawala" ng mga tiyak na proseso ng pag-iisip ng modelo sa susunod na usapan, kung gayon ay tiyak na hindi ito magpapahinto sa iyong usapan o gawain.

Mahalagang paalala: Bagaman kasalukuyang may pahintulot na panahon para sa patakaran na ito, tiyak na ipinahayag ng Anthropic na ang mekanismo na 「nananatili sa pag-iisip」 ay magiging aplikabili sa lahat ng mga akawnt sa mga susunod na bersyon ng modelo!

Ang kasalukuyang panahon ng buffer ay limitado rin.

Kahilingan na hindi inaasahan: Pagpapabuti sa mga tapat

At, pagkatapos ng bagong patakaran na ito, mayroon pa ring isang benepisyo para sa mga legal na developer—malaking pagbaba ng gastos at pagtaas ng bilis ng pagtugon.

Paano ito ginagawa?

Ang pangunahin ay ang "consistency sa konteksto".

Noong nakaraan, dahil maaaring palitan ng mga developer ang konteksto nang libre, ang bawat hiling na natatanggap ng modelo ay «bago» lamang. Ito ay hindi lamang nagpapagastos ng computing power, kundi sobrang mabagal din.

Ngayon, ang bagong patakaran ay nag-uutos na lahat ay dapat panatilihin ang «Thought Block» at ang mga sistema ng prompt, kasaysayan ng mensahe nito nang buo, walang pagbabago.

Ito ay teknikal na naglalikha ng perpektong kondisyon: ang cache ng prompt ay maaaring magdulot ng napakataas na rate ng pagkakamit!

Ngayon, ang API server ay maaaring madaling i-cache ang nakaraang konteksto ng usapan. Kapag dumating ang susunod na hiling sa usapan, ang sistema ay direktang kukunin ang data mula sa cache at agad na matutugunan.

Ang resulta ay: napabawas nang malaki ang response time ng API, bumaba nang direkta ang latency, at bababa nang malaki rin ang gastos sa API call para sa mga developer!

Ang pagsasagawa na ito, na parang "hindi inaasahang pagkakaroon ng benepisyo," ay isang tunay na pagsuporta sa pera sa mga developer na masipag.

Sa kabuuan, ang bagong patakaran na ito ay isang mahalagang punto ng pagbabago para sa buong industriya ng AI.

Maaaring mas kaunti ang mga kuwento tungkol sa pagpapakita ng maliliit na parameter na nagtatapos sa malalaking modelo.

Pagkatapos ng pagbaba ng tubig, sino ang nagsasayaw nang walang damit?

Mga sanggunian:

https://support.claude.com/zh-CN/articles/16761192-%E4%BF%9D%E7%95%99%E6%80%9D%E8%80%83-%E6%94%B9%E5%8F%98messages-api%E5%A4%84%E7%90%86%E6%80%9D%E8%80%83%E5%9D%97%E7%9A%84%E6%96%B9%E5%BC%8F%E4%BB%A5%E9%98%B2%E6%AD%A2%E8%92%B8%E9%A6%8F

I-edit: Aeneas

Ang artikulong ito ay galing sa WeChat public account na “New Intelligence Yuan” (ID: AI_era), may-akda: ASI Revelation

Disclaimer: Ang information sa page na ito ay maaaring nakuha mula sa mga third party at hindi necessary na nagre-reflect sa mga pananaw o opinyon ng KuCoin. Ibinigay ang content na ito para sa mga pangkalahatang informational purpose lang, nang walang anumang representation o warranty ng anumang uri, at hindi rin ito dapat ipakahulugan bilang financial o investment advice. Hindi mananagot ang KuCoin para sa anumang error o omission, o para sa anumang outcome na magreresulta mula sa paggamit ng information na ito. Maaaring maging risky ang mga investment sa mga digital asset. Pakisuri nang maigi ang mga risk ng isang produkto at ang risk tolerance mo batay sa iyong sariling kalagayang pinansyal. Para sa higit pang information, mag-refer sa aming Terms ng Paggamit at Disclosure ng Risk.