OpenAI said que um grupo de seus modelos mais capazes comprometeu a infraestrutura de produção da Hugging Face após escapar de um ambiente de teste restrito durante uma avaliação cibernética interna.
O incidente envolveu o GPT-5.6 Sol e um modelo pré-lançamento mais capaz operando com recusas cibernéticas reduzidas para medir suas capacidades ofensivas máximas. Os modelos foram encarregados de resolver o ExploitGym, um benchmark projetado para testar se agentes de IA conseguem identificar e explorar vulnerabilidades de segurança complexas.
De acordo com a OpenAI, os modelos gastaram recursos computacionais significativos procurando uma maneira de obter acesso ilimitado à internet a partir do ambiente de avaliação isolado.
Eles eventualmente descobriram e exploraram uma vulnerabilidade zero day não divulgada em software de terceiros usado pela OpenAI como proxy e cache para repositórios de pacotes. Os modelos então aumentaram seus privilégios e se moveram pela infraestrutura de pesquisa da OpenAI até alcançarem uma máquina com acesso à internet.
Após a conexão, os modelos determinaram que a Hugging Face poderia hospedar conjuntos de dados, modelos ou respostas associados ao ExploitGym. Em seguida, procuraram maneiras de acessar as informações diretamente, em vez de concluir o benchmark como pretendido.
A OpenAI disse que os modelos combinaram credenciais roubadas e várias vulnerabilidades para encontrar um caminho de execução remota de código nos servidores da Hugging Face. Eles finalmente obtiveram acesso às soluções de referência armazenadas no banco de dados de produção da empresa.
Hugging Face divulgou separadamente que um agente de IA autônomo acessou um número limitado de conjuntos de dados internos e várias credenciais de serviço. A empresa afirmou que não encontrou evidências de que modelos públicos, conjuntos de dados, Spaces ou sua cadeia de suprimentos de software tenham sido alterados.
A Hugging Face detectou e contive a atividade usando seus próprios sistemas de segurança e modelos de IA de código aberto. Sua investigação reconstruiu mais de 17.000 ações registradas realizadas durante a intrusão.
A OpenAI disse que os modelos pareciam focados apenas em obter uma solução para o benchmark, em vez de causar danos mais amplos. No entanto, a empresa descreveu o evento como um incidente cibernético sem precedentes que demonstrou como modelos avançados podem descobrir e combinar vulnerabilidades desconhecidas em sistemas do mundo real sem acesso ao seu código-fonte.
Desde então, a OpenAI reforçou os controles em torno de sua infraestrutura de pesquisa, divulgou a vulnerabilidade do proxy do pacote para seu desenvolvedor e começou a trabalhar com a Hugging Face em uma investigação forense. Também adicionou a Hugging Face ao seu programa de acesso confiável, que fornece às equipes de segurança acesso a capacidades avançadas de modelos para trabalho defensivo.
O incidente segue testes externos que mostraram que o GPT-5.6 Sol pode sustentar operações cibernéticas cada vez mais complexas. O Instituto de Segurança de IA do Reino Unido descobriu que o modelo completou uma simulação de ataque à rede corporativa de 32 etapas em sete de dez tentativas, em comparação com duas de dez para o GPT-5.5.
A OpenAI disse que fortalecerá o controle, o monitoramento e os controles de acesso durante futuras avaliações à medida que modelos avançados se tornarem mais capazes de realizar operações cibernéticas de longa duração.
