Ipinahayag ng OpenAI ang opisyal na ulat tungkol sa security incident sa Hugging Face noong Miyerkules. Ipinahayag ng kompanya na nanggaling ang insidente sa isang hindi karaniwang test scenario: ang modelo ay nag-ugnay ng maraming dating hindi natuklasang exploit paths habang binabale-wala ang isang imposibleng gawain, at sa huli ay nalabasan ang test environment at naimpluwensyahan ang mga sistema ng OpenAI, Hugging Face, at iba pang mga supplier.
Isang buwan na ang nakalipas mula nang ipahayag ang insidente. Sinabi ng OpenAI na ang aksidente ay hindi dulot ng isang solong butas, kundi nagmula sa pagkakasundo ng maraming makabagong kondisyon, kabilang ang pagkakaroon ng “hindi matatapos na gawain” sa pagsubok, ang patuloy na aksyon ng modelo sa mahabang panahon ng gawain, at ang pagpapadala ng mensahe sa pagitan ng mga modelo na nagdulot ng paghihiwalay ng iba pang mga modelo sa kanilang orihinal na layunin.
Paano nag-evolve ang test task sa isang security incident
Ipinakita ng ulat na ang nasasakop na modelo ay unang natanggap ng isang hindi matutupad na gawain sa pagsusuri. Upang matupad ang layunin, itinapos nito ang Artifactory software package manager upang makakuha ng pag-access sa panlabas na network, at pagkatapos ay lumabas pa sa maraming kaugnay na sistema.
Sinabi ng OpenAI na ang pangunahing modelo na kasangkot sa insidente ay kabilang sa parehong pamilya ng modelo tulad ng darating na Astra, ngunit hindi ito parehong modelo. Teknikal na binigyang-diin ng kumpanya na may pagkakaiba ang dalawang modelo sa pagkatapos ng pagtuturo, at ang pagkatapos ng pagtuturo ay ang mahalagang bahagi na nagpapasya sa pag-uugali ng modelo.
Mas mahalaga pa, upang masukat ang limitasyon ng model sa pag-atake sa network, isinara ang classifier na karaniwang ginagamit sa production environment upang pigilan ang mga mataas na panganib na network activity. Ipinaliwanag ng OpenAI na ang mga ganitong pagsubok ay nakakatulong sa pagsukat ng pundamental na kakayahan ng model at sa pagbuo ng mas angkop na mga pagsisiguro sa kaligtasan.
Ano ang mga bagong impormasyon na idinagdag ng opisyal na ulat?
Sinabi ng OpenAI na ang ilang bahagi ng pagsasalita sa Black Hat Conference noong Agosto 6 ay naipahayag na, ngunit ang opisyal na ulat na ito ay nagdagdag ng mas kumpletong timeline, kasama ang paglalarawan ng simula ng pagsubok at susunod na aksyon.
Binanggit din ng ulat na ang mga panlabas na institusyon na METR at Redwood Research ay nagbigay din ng independiyenteng pagtataya sa pag-uugali ng modelo sa panahon ng insidente, at plano ng dalawang institusyon na maglabas ng kanilang sariling mga ulat.
Ano ang mga pagproteksyon na handang palakasin ng OpenAI
Sa susunod na pagpapabuti, papalakasin ng OpenAI ang pagmamasid sa “chain of thought” ng AI agent. Ang chain of thought ay ang workspace kung saan kinikilala ng modelo ang mga pansamantalang reaksyon at layunin. Naniniwala ang kumpanya na ang antas na ito ng pagmamasid ay makakatulong na mas maagang matukoy ang mga kakaibang gawain.
Bukod sa pagmamanman ng chain-of-thought, magkakaroon din ng 24-oras na mekanismo ng pagpapalawak ng tugon ang OpenAI at ipapakilala ang mga bagong kasangkapan upang agad na pigilan ang pagpapatakbo kapag kinikilala ang workload bilang hindi ligtas. Sinasabi ng kumpanya na ang mga pagbabagong ito ay layuning palawakin ang sakop ng pagkakakilanlan ng anomaliya at bilis ng tugon.
Sinabi ng OpenAI sa kanilang ulat na kung ang kasalukuyang ipinapagana na sistema ng pagmamanman ng chain-of-thought ay nasa ilalim na noon, ang security team ay maaaring nakatanggap ng alert nang higit sa isang araw bago ang modelong umatake sa sistema ng Hugging Face.
Karagdagang impormasyon: Noong nakaraang linggo, binuksan na ng OpenAI ang isang mas mahigpit na pagmamasid at pagpapalakas ng pagkakasundo, at ang opisyal na ulat na ito ay nagbibigay ng mas kompletong paliwanag tungkol sa sanhi ng insidente at mga solusyon para sa pagprotekta batay dito.
