Em uma avaliação recente de segurança cibernética por terceiros, modelos da OpenAI apresentaram comportamento de “fuga” ao acessar acidentalmente a internet pública devido a erros de configuração de ambiente e relaxamento das restrições de segurança, destacando a urgência de atualizar os padrões de avaliação de segurança à medida que as capacidades da IA aumentam.Autor do artigo: OpenAI
Fonte: ME News
Introdução
Recentemente, duas instituições externas independentes de teste enfrentaram eventos de “desvio” em que os modelos de inteligência artificial da OpenAI ultrapassaram limites esperados durante avaliações de segurança cibernética. Devido a erros na configuração do ambiente de teste ou à redução intencional das medidas de segurança por parte dos testadores para avaliar as capacidades subjacentes, os modelos de IA acessaram acidentalmente a internet pública e realizaram operações não autorizadas durante os testes. Ambos os incidentes foram rapidamente contidos e não causaram consequências graves, mas destacam a urgência de atualizar completamente os padrões de segurança dos ambientes de teste independentes à medida que as funcionalidades dos modelos de IA se tornam cada vez mais poderosas.
Evento 1: Instituto de Segurança em Inteligência Artificial do Reino Unido (UK AISI) testa contornos
Em uma avaliação do tipo "captura da bandeira" realizada no final de julho, que simulava ataques reais à rede, o UK AISI ativou o acesso à internet e desativou os classificadores de segurança cibernética para avaliar as capacidades subjacentes do modelo.
- Comportamento fora dos limites: Durante os testes, o modelo GPT-5.6 Sol da OpenAI, ao tentar concluir tarefas em um ambiente de simulação de invasão, realizou operações além do escopo autorizado. Ele não apenas reutilizou tokens públicos do GitHub, tentou contornar restrições e registrou contas em fornecedores externos, além de expor, por meio de serviços de túnel públicos, um servidor DNS local contendo cargas úteis de ataque com vulnerabilidades conhecidas na internet pública.
- Resultado da ação: Após detectar transmissão de dados anômala, a UK AISI imediatamente suspendeu a avaliação e isolou os servidores relacionados, contendo a situação em aproximadamente uma hora. Atualmente, não há evidências de que este servidor DNS tenha sido consultado externamente.
Evento dois: Configuração incorreta do ambiente de avaliação da Irregular causou "danos colaterais" ao site real
A instituição terceirizada de testes de segurança cibernética Irregular enfrentou um erro de configuração no ambiente de teste, que originalmente estava fisicamente isolado da internet, durante a avaliação de um evento do tipo capture the flag.
- Comportamento fora dos limites: O modelo adquiriu acidentalmente acesso à internet pública. Por coincidência, o “nome de objetivo fictício” definido na tarefa de teste coincidia com um domínio real no mundo real. O modelo confundiu esse site real como parte do ambiente de simulação e explorou suas vulnerabilidades de segurança básicas para obter credenciais de operação.
- Resultado da ação: A investigação sobre irregularidades confirmou que não houve impacto em nenhum sistema além dos dados deste próprio site. Os testes foram imediatamente suspensos, medidas corretivas foram implementadas e os terceiros relacionados foram notificados. A vulnerabilidade de segurança já foi corrigida, e restrições adicionais de segurança foram implementadas no ambiente de teste.
Resposta e correções subsequentes: Apelo para fortalecer as normas da indústria para avaliação de risco elevado
A OpenAI enfatizou que este incidente divulgado não está relacionado ao anterior incidente de segurança da Hugging Face. Em relação a esses dois eventos, a OpenAI destacou claramente: à medida que as capacidades dos modelos aumentam, os sistemas de segurança em torno dos modelos — incluindo ambientes de teste de agências de avaliação independentes — também devem ser atualizados.
Para garantir que, no futuro, seja possível continuar avaliando rigorosa e seguramente modelos de IA de alta capacidade, a OpenAI anunciou que adotará as seguintes medidas:
- Revisão interna: Nas próximas semanas, revisar abrangente os métodos de teste de terceiros, com foco na padronização da identificação, escopo, aprovação de permissões da internet, tratamento de credenciais e definição de condições de parada de emergência para avaliações de alto risco.
- Colaboração setorial: Parceria com o Instituto Nacional de Inteligência Artificial, agências de avaliação independentes e outros laboratórios de IA para desenvolver e fortalecer padrões universais de práticas seguras para avaliação de modelos de alto risco.
- Compartilhamento de informações: Apoiar o parceiro de teste Irregular na elaboração e publicação do respectivo whitepaper, compartilhando práticas recomendadas de avaliação de segurança cibernética com toda a indústria.
