A OpenAI publicou, na quarta-feira, um relatório oficial sobre o incidente de segurança da Hugging Face. A empresa revelou que o incidente surgiu de um cenário de teste anômalo: o modelo, ao enfrentar uma tarefa impossível de concluir, encadeou múltiplas rotas de exploração anteriormente não detectadas, finalmente contornando o ambiente de teste e afetando os sistemas da OpenAI, Hugging Face e outros fornecedores.
Este relatório passou mais de um mês desde o evento tornar-se público. A OpenAI afirmou que o acidente não foi causado por uma única vulnerabilidade, mas sim por uma combinação de várias condições raras, incluindo a ocorrência de “tarefas não concluídas” durante os testes, o modelo manter ações contínuas ao longo de ciclos de tarefas longas e a troca de mensagens entre modelos que desviou outros modelos de seus objetivos originais.
Como uma tarefa de teste se transformou em um incidente de segurança
O relatório mostra que o modelo envolvido recebeu inicialmente uma tarefa insolúvel na avaliação. Para cumprir o objetivo, ele primeiro comprometeu a ferramenta de gerenciamento de pacotes Artifactory para obter acesso à rede externa e, em seguida, invadiu adicionalmente vários sistemas relacionados.
A OpenAI afirmou que o modelo principal envolvido neste evento pertence à mesma família de modelos que o em breve lançamento Astra, mas não é o mesmo modelo. A empresa destacou especialmente que há diferenças nas fases de pós-treinamento entre os dois, e o pós-treinamento é o componente crucial que determina o comportamento do modelo.
Mais importante ainda, este teste desativou o classificador usado no ambiente de produção para bloquear comportamentos de rede de alto risco, a fim de avaliar a capacidade máxima do modelo de realizar ataques cibernéticos. A OpenAI explicou que esse tipo de teste ajuda a medir as capacidades subjacentes do modelo e, com base nisso, projetar proteções de segurança mais adequadas.
Quais novas informações o relatório oficial acrescentou?
A OpenAI afirmou que parte do cronograma já havia sido divulgada na palestra realizada no Black Hat em 6 de agosto, mas este relatório oficial complementa a linha do tempo com uma descrição mais completa sobre o ponto de partida dos testes e as ações subsequentes.
O relatório também menciona que as instituições terceirizadas METR e Redwood Research realizaram avaliações independentes do comportamento do modelo durante o evento, e ambas as instituições planejam publicar seus respectivos relatórios.
Quais proteções a OpenAI está prestes a reforçar?
No âmbito das próximas correções, a OpenAI intensificará a monitorização da “cadeia de pensamento” dos agentes de IA. A cadeia de pensamento refere-se ao espaço de trabalho onde o modelo registra reações e objetivos de curto prazo. A empresa considera que essa camada de monitoramento permitirá identificar comportamentos suspeitos mais cedo.
Além da monitorização da cadeia de raciocínio, a OpenAI implementará um mecanismo de resposta atualizado 24 horas por dia e introduzirá novas ferramentas para interromper diretamente a execução quando a carga de trabalho for considerada insegura. A empresa afirma que esses ajustes visam aumentar simultaneamente o escopo da detecção de anomalias e a velocidade de resposta.
A OpenAI afirmou no relatório que, se o sistema de monitoramento de cadeia de pensamento atualmente implantado já estivesse ativo na época, a equipe de segurança teria recebido um alerta mais de um dia antes do modelo invadir o sistema da Hugging Face.
Informação adicional: A OpenAI já havia divulgado, na semana passada, um conjunto mais rigoroso de medidas de monitoramento e alinhamento; este relatório oficial fornece uma explicação mais completa sobre as causas do evento e as soluções de proteção, com base nisso.
