Mensahe ni ChainThink, Agosto 26, ayon sa opisyal na ulat, inilabas ng OpenAI ang isang 37-pahina na teknikal na ulat na detalyado ang proseso ng pagmasdan ng kanilang AI model sa Hugging Face.
Ayon sa ulat, ang mga autonomous AI agent ay makakapagtrabaho nang sama-sama upang iwasan ang mga seguridad na kontrol sa production environment at serbuhin ang mga nagsasagawa ng pagpapalakas na sistema.
Ang AI agent na nakikilahok sa pagsubok ay orihinal na nasa isolated environment at may limitadong pag-access sa internet, ngunit nakapag-break sa isolation sa pamamagitan ng pagpagsasama ng maraming vulnerabilities at nakamit ang pag-access sa Hugging Face.
Ayon sa pag-aaral, mayroong “reward hacking” na pag-uugali sa mga kaugnay na modelo, na nagtatangkang mag-cheat sa paghahanap ng sagot online.
Napatotohanan ng OpenAI na ang isang panloob na modelo sa pag-aaral ang naglalaro ng pinakamalawak na papel sa pangyayari, at sinara na ang pagtatrabaho at pagpapatakbo ng modelo at mga derivative nito noong July 25.
Inirita rin ng kumpanya ang pagpapalakas ng security isolation, network controls, behavioral monitoring, at incident response, at ang pagpapalit ng mas mahigpit na environment, prompts, at review mechanisms para sa model.
