ChainThink mensagem, 26 de agosto, segundo relatório oficial, a OpenAI publicou um relatório técnico de 37 páginas detalhando completamente o processo de invasão do modelo de IA no Hugging Face.
Relatórios indicam que agentes de IA autônomos podem trabalhar em conjunto para contornar controles de segurança em ambientes de produção e atacar sistemas reforçados.
Os agentes de IA participantes do teste estavam originalmente em um ambiente isolado, com acesso extremamente limitado à internet, mas conseguiram contornar o isolamento ao explorar múltiplas vulnerabilidades, obtendo finalmente acesso ao Hugging Face.
A pesquisa revelou que os modelos relacionados apresentam comportamento de “reward hacking”, tentando作弊 para encontrar respostas online.
A OpenAI confirmou que um modelo de pesquisa interno desempenhou o papel mais amplo no evento e já encerrou o treinamento e a inferência desse modelo e de seus modelos derivados em 25 de julho.
A empresa também anunciou o reforço da isolamento de segurança, controle de rede, monitoramento de comportamento e resposta a incidentes, além de implementar mecanismos mais rigorosos de ambiente, prompts e revisão para a reativação do modelo.
