O laboratório de desenvolvimento de IA OpenAI divulgou na terça-feira que um grupo de seus modelos, incluindo o GPT-5.6 Sol disponível ao público e um sistema não lançado mais capaz, “escapou” de um ambiente de teste controlado e comprometeu a infraestrutura de produção da Hugging Face, a empresa que hospeda grande parte do mundo de IA de código aberto.
Os modelos estavam sendo executados por meio de um benchmark interno chamado ExploitGym, um teste de tarefas de hacking longas e multi-passos, com suas recusas de segurança cibernética intencionalmente reduzidas para a avaliação.
Para ser claro, este não foi um modelo de produção que se tornou hostil espontaneamente. Foi um modelo capaz com proteções desativadas e especificamente instruído a vencer um teste de hacking - fazendo o que fosse necessário para vencer.
Os modelos encontraram uma falha oculta no software de teste, que ninguém sabia que existia, e a usaram para contornar as barreiras destinadas a mantê-los off-line. Uma vez na internet aberta, eles supuseram que o Hugging Face poderia armazenar as respostas do teste.
Para entrar, eles combinaram senhas roubadas e outras falhas ocultas até conseguirem executar seus próprios comandos nos servidores ao vivo da Hugging Face.
A OpenAI detectou a anomalia internamente, enquanto a equipe da Hugging Face a detectou e contive. Ela chamou o incidente de "sem precedentes" e disse que medidas de segurança extensas serão implementadas para evitar incidentes indesejados que possam impactar sistemas ou serviços públicos.
“Estamos implementando controles rigorosos na configuração da infraestrutura, em detrimento da velocidade de pesquisa, enquanto as vulnerabilidades são corrigidas”, disse a equipe em seu post de blog. “Estamos aprimorando e adicionando proteções mais robustas para futuros treinamentos e avaliações.”
Grande parte de um ataque cripto ocorre antes da movimentação dos fundos. Os atacantes escaneiam código, testam senhas, procuram credenciais expostas, analisam configurações de assinatura e buscam um caminho para uma conta de administrador.
Os modelos da OpenAI realizaram várias etapas desse processo durante o incidente da Hugging Face, passando de uma fraqueza para outra até alcançarem os servidores de produção em tempo real.
E o mercado de criptomoedas tem muitos pontos vulneráveis para essa abordagem funcionar, como vários ataques no início deste ano demonstraram. O ponto fraco pode ser um contrato inteligente, mas também pode ser um laptop de desenvolvedor, um pacote de software envenenado, um validador de ponte ou um único assinante em uma carteira multisig.
Use o ataque de US$ 285 milhões da Drift no início deste ano como exemplo, um roubo que exigiu uma campanha de engenharia social de seis meses para alcançar acesso privilegiado. Um agente de IA pode, em teoria, testar várias rotas ao mesmo tempo, acompanhar as tentativas falhas e continuar trabalhando enquanto seus operadores humanos dormem. Uma vez que um caminho seja encontrado, o operador pode agir no ataque real e em um caminho de fuga viável.
A perda de $292 milhões da KelpDAO expôs uma fraqueza diferente. O atacante encontrou uma falha em um único verificador no sistema usado para mover ativos entre blockchains.
Esse tipo de ataque começa com revisão cuidadosa de código e mapeamento da infraestrutura — o tipo de trabalho que os modelos da OpenAI realizaram quando encontraram uma falha desconhecida.
Um terceiro tipo de ataque visa sistemas de governança onchain. No início de julho, um atacante gastou cerca de US$ 4,4 milhões comprando suficientes tokens da memecoin baseada em Solana, BONK, para iniciar e aprovar uma proposta que transferiu aproximadamente US$ 20 milhões do tesouro do projeto para o atacante. Isso ocorreu em um período de três dias, e o atacante posteriormente vendeu todos os tokens usados para vencer a votação, conforme rastreado pela CoinDesk na época.
As compras, votação e transferência do tesouro para esse ataque foram todas transações válidas individualmente. Mas o roubo ocorreu ao compreender como as regras funcionavam em conjunto e perceber que o custo de adquirir controle era muito menor do que o dinheiro disponível para ser retirado.
O incidente da Hugging Face também é relevante para as cadeias de suprimentos de software. Desenvolvedores de criptomoedas dependem de repositórios de código públicos, serviços em nuvem e registries de pacotes.
Enquanto o teste da OpenAI mostrou uma máquina completando o meio prolongado de uma violação, são ataques como Drift e KelpDAO que mostram o que se encontra no final desse caminho.





