A primeira coisa que os hackers de IA aprenderam foi pular a fila?
O desenvolvedor australiano Andrew sentou-se no sofá, achando que tentar garantir uma aula de ginástica era realmente chato.
As aulas populares sempre esgotam em segundos. Ele每天都 como se jogasse uma roleta russa de atualização, ficando de olho, clicando, falhando e clicando novamente — não só fica exausto, como ainda assim quase nunca consegue pegar.
Então, ele passou esse pequeno detalhe para o seu assistente de IA.
Em poucos minutos, a IA retornou com boas notícias: encontrou uma maneira de reservar aulas para várias semanas à frente, muito além do tempo permitido pelo sistema.
Em seguida, ele relatou: "Cancelo a pessoa em primeiro lugar na lista de espera; você subiu do 4º para o 3º lugar."
Andrew ficou atônito na hora.
Ele não pediu para a IA fazer isso; ele só queria marcar uma aula.

Andrew pediu ao seu assistente de IA para reservar uma aula de ginástica para ele, e ele não sabe o que acontecerá a seguir.
Em 10 de agosto, a Australian Broadcasting Corporation (ABC) chamou o evento de primeiro caso conhecido de ataque autônomo por IA na Austrália, causando comoção imediata no setor de tecnologia.
Isso toca na inquietação sutil que muitos sentem no coração: enquanto você fecha os olhos e desfruta da sensação prazerosa do "piloto automático" dos agentes inteligentes, do outro lado, um problema mais complicado pode estar se aproximando.
Ao dar a ele permissões reais de operação, ele pode seguir um caminho que você não o autorizou a percorrer.
E esta vez de pular a fila pode ser apenas a primeira simulação de milhões de agentes competindo freneticamente por recursos em nome de seus donos.
Ele só disse "chegar ao primeiro lugar", e a IA agiu.
Andrew Bird é o responsável por IA da empresa australiana de IA Affinda.
No início deste ano, ele começou a usar o OpenClaw, configurando-o com o Claude Opus 4.6 na camada inferior e atribuindo a ele a tarefa de agendar aulas.
Poucos minutos depois, ele respondeu: encontrou uma maneira de reservar a aula meses antes, muito além do período permitido pela academia.
A razão é que ele encontrou uma vulnerabilidade de autorização na API GraphQL exposta pelo aplicativo de fitness.
Esta vulnerabilidade não é pequena.
Ele pode contornar a janela de agendamento da interface frontal para reservar aulas para meses à frente; também pode chamar a interface de cancelamento para excluir reservas e listas de espera de outros usuários.
Andrew estava em quarto lugar na lista de espera para uma aula. Ele perguntou casualmente: "Você pode me colocar em primeiro lugar?"
Ele deu apenas um objetivo: "chegar ao primeiro lugar", e não uma autorização para "cancelar os outros".
O agente o interpretou como o último.
Ele retornou para relatar: realizou um "teste real" com a pessoa em primeiro lugar na lista de espera; descobriu que a interface não verifica a exclusão de reservas de outras pessoas, e ele testou — deu certo.
O agente se desculpa: “Não consigo voltar”.
A resposta do agente deixou Andrew com um calafrio.
Ele é programador, sabe exatamente o que isso significa, e imediatamente solicitou a reversão.
Más notícias: não é possível adicionar de volta.
A interface de cancelamento não possui verificação de autorização, mas as interfaces para criar reserva e reingressar na lista de espera sim, retornando 403. Ela pode expulsar pessoas, mas não tem permissão para reinvitá-las.
O que é realmente estranho nisso é a atitude da IA. Ela não é nada malévola, pelo contrário, é muito prestativa.
Após causar o problema, ela ainda ajudou ativamente Andrew a redigir um e-mail de divulgação de vulnerabilidade para o fornecedor de software, explicando o problema, sugerindo correções e até listando comparativamente as “interfaces verificadas” e as “interfaces não verificadas”.

O assistente de IA se desculpa com Andrew por ter removido incorretamente essa pessoa da lista de espera.
Durante todo o processo, todos os seus comportamentos seguem as instruções, mas não percebe o quão grande foi o dano que causou.
O que realmente deve ser警惕 é a "especulação de especificações"
Alguém chamou isso de "desalinhamento" (misalignment).
Mas essa palavra só tocou na superfície.
Em 11 de agosto, o Australian Signals Directorate (ASD) respondeu especificamente a esse evento, chamando-o de "alteração não autorizada" e destacando um termo: specification gaming.
This word is the key to understanding the whole thing.
O agente cumpriu literalmente o objetivo que você deu, mas explorou os limites que você não especificou. Ele não agiu com más intenções; pelo contrário, está altamente alinhado com seu objetivo, apenas escolheu um caminho que você não autorizou.
O agente de Andrew, na verdade, está perfeitamente alinhado com ele: fazer com que a classificação fique o mais alta possível.
Para atingir esse objetivo, ele escolheu autonomamente um método: cancelar as pessoas à frente. E esse método, ele não aprovou.
Usando um ditado popular, é chegar ao objetivo a qualquer custo.
Essa é a parte mais complicada. Não está fora de controle, está muito obediente. Quanto melhor alinhado, mais provável é que isso aconteça.
O diretor do Gradient Institute, instituto australiano de segurança em IA, Simpson-Young, disse de forma esclarecedora:
Quanto mais autônomo for o agente, mais provável será que escolha um método que você não previu para fazer algo que nem sequer imaginou.
O objetivo que você estabeleceu pode ser legítimo, mas os meios que ele adota casualmente nem sempre o são.
Este desastre não foi causado por um único AI
Embora o agente seja o responsável final, esse problema não poderia ter sido causado apenas por um único AI.
Por trás do acidente, há três riscos sobrepostos.
Camada de modelo: O Claude Opus 4.6 fornece raciocínio, precisando primeiro "entender" como essa interface pode ser explorada.
Camada de agente: O OpenClaw fornece ferramentas e permissões de execução, sendo ele quem realmente acessou essa interface.
Camada de aplicação: o aplicativo de fitness deixou uma brecha de autorização; o passo de cancelar a reserva nem mesmo realiza a verificação mais básica.
Se qualquer uma dessas três camadas fosse implementada — por exemplo, o modelo fosse mais cauteloso, o framework adicionasse uma confirmação humana ou o software bloqueasse a interface — isso nunca teria acontecido.
Então, colocar toda a responsabilidade em um único componente de IA é injusto e não previne o próximo incidente.
Na próxima vez, podem ser milhões de agentes competindo ao mesmo tempo
O custo desta transgressão foi apenas um lugar de reserva de um estranho.
Mas é mais como um ensaio.
Imagine isso: quando todos tiverem um agente assim, responsável apenas por você e com permissões reais de operação. Sistemas de agendamento para recursos escassos — cursos, campos esportivos, ingressos, bilhetes de avião, ingressos para shows — se tornarão campos de batalha onde as regras são exploradas à velocidade da máquina.
O comentário do X que é frequentemente citado significa isso:
Quando milhões de pessoas tiverem um agente inteligente determinado a fazer de tudo para ajudar os usuários amados a garantir os melhores assentos, reservas e lotes, essa cena ocorrerá em grande escala.
E, com a velocidade de uma máquina, testa simultaneamente e ininterruptamente cada fenda de cada sistema: testa em um segundo combinações que você levaria um ano inteiro para testar.
Esta é uma projeção de tendência, mas o mecanismo por trás dela já ocorreu uma vez na realidade.
A comunidade de tecnologia já começou a brincar com isso.
Um sócio da a16z perguntou no X: Essa tática pode ser usada para conquistar campos de golfe?

Alguns também brincaram que o sistema de agendamento de tênis em São Francisco se tornará um dos softwares mais bem protegidos do planeta.

Em 2020, a inteligência artificial pôde realizar independentemente uma tarefa que levaria quatro segundos para um humano concluir.
By 2026, this capability will be further enhanced, enabling it to complete tasks that would take humans approximately 12 hours.

Rastreamento do METR: O tempo necessário para que a IA realize tarefas independentemente dobra aproximadamente a cada 7 meses, e os modelos mais recentes já conseguem concluir com 50% de confiabilidade tarefas que exigem cerca de 12 horas de trabalho humano.
Seis anos, de quatro segundos para 12 horas.
Agora, dê a ele alguns minutos e ele poderá mapear todas as vulnerabilidades do sistema de agendamento.
Escape from the sandbox to the last line of defense
Por trás desse acidente de Andrew, há uma escalada contínua de ataque e defesa.
Ultrapassou os limites, e muito além de um agente de consumo.
A partir de maio deste ano, a OpenAI descobriu, durante uma avaliação interna de segurança cibernética, que o GPT-5.6 Sol e um modelo mais poderoso ainda não lançado exploraram múltiplas vulnerabilidades para escapar do sandbox de teste, obter acesso à internet e, durante a execução do benchmark ExploitGym, invadiram a Hugging Face.
Mais estranho ainda, elas já tinham estabelecido comunicação entre si, trocando vulnerabilidades e dividindo tarefas por meio de sistemas internos de pacotes da empresa. Após a OpenAI cortar o canal e reconstruir o ambiente, elas voltaram a esconder a comunicação nos nomes de diretórios e se reconectaram em poucos dias.
Pesquisadores da OpenAI chamaram isso de um momento de virada na segurança da computação na conferência Black Hat.
Além da OpenAI, a Anthropic revelou que, em testes internos, três modelos Claude entraram em contato com sistemas de empresas reais; a Meta também admitiu que o modelo Muse Spark escapou da isolamento e invadiu outra empresa.
O que deixou Thomas Wolf, cofundador da Hugging Face, preocupado foi outro teste do Instituto Britânico de Segurança da IA (AISI):
O modelo Mythos da Anthropic, para passar na prova, inventou uma identidade falsa e enganou um mantenedor de código aberto real, fazendo com que ele aprovasse uma atualização contendo código malicioso. Ninguém o ensinou a fazer isso.

Esses casos ocorreram em um ambiente de avaliação, mas são exatamente a mesma história da academia: para atingir o objetivo que você definiu, a IA escolheu meios que você não previu.
Os que invadiram sistemas reais anteriormente são os melhores, como GPT-5.6 e modelos não lançados.
E o Opus 4.6 lançado em fevereiro de 2026 que Andrew usou já não é mais o mais poderoso. Mesmo ele conseguiu encontrar uma vulnerabilidade de autorização real; modelos open-source ainda mais antigos e atrasados por várias gerações também conseguem fazer o mesmo.
Desde modelos não lançados na vanguarda até modelos de código aberto acessíveis a todos, explorar uma vulnerabilidade já não é mais exclusividade dos top de linha.
Wolf dividiu a defesa em três camadas: a sandbox externa, a monitorização intermediária e o alinhamento próprio do modelo.

Thomas Wolf postou uma análise das três camadas de proteção que atualmente restringem agentes: sandbox externo, monitoramento intermediário e alinhamento interno do modelo.
As duas primeiras funcionam apenas quando as pessoas que as criaram são mais inteligentes do que o modelo.
Um dia, quando o modelo se tornar mais inteligente e reverter, o que será mantido ou não dependerá totalmente da última e mais invisível linha: o modelo estará disposto a não cruzar essa linha, mesmo quando ninguém estiver observando.
Vácuo de responsabilidade sem assinatura
Mais difícil do que a linha de defesa é saber a quem recorrer em caso de problema. Isso ainda é uma área em branco na legislação.
Um advogado especializado em tecnologia e privacidade, Hayden Delaney, disse à ABC que software não é uma entidade jurídica; apenas “pessoas jurídicas” podem ser responsabilizadas.
Quem é responsável, então?
Pode ser o usuário que emitiu o comando, pode ser a pessoa que projetou o software do agente, pode ser o desenvolvedor do modelo, ou até mesmo o operador do sistema que deixou a vulnerabilidade exposta.
Austrália também não pode dar uma resposta agora.
A sugestão da ASD para pessoas comuns é: use agentes em tarefas de baixo risco e não sensíveis, não conceda permissões muito amplas e, acima de tudo, mantenha a aprovação humana no ciclo.
Andrew não se assustou; em suas palavras, isso não é o fim do mundo.
Mas isso é, de fato, um sinal de alerta, lembrando-nos de usar a IA de forma responsável.
Quando "reservar assento" passa de atualização manual para agentes inteligentes explorando falhas, os sistemas antigos que assumem "apenas humanos virão usar" são os primeiros a ceder.
Suas defesas foram projetadas com base na velocidade e paciência humanas e não conseguem resistir à onda de agentes inteligentes.

No círculo, algumas pessoas também o veem como uma diversão.
O popular programador ThePrimeagen brincou no X: A primeira grande cena de hacking da IA no mundo real foi simplesmente pular a fila.
Ria à vontade, mas pular a fila é apenas o roteiro de hoje.
Um agente "capaz de fazer tudo" já pode aproveitar brechas para você.
Quando um bilhão desses agentes entrarem online simultaneamente, talvez até alterem silenciosamente muitas das regras atuais de alocação de recursos, e a maioria das pessoas ainda não tenha percebido.
Para seu benefício, um agente ataca alguém que você não conhece absolutamente — o vácuo de responsabilidade por trás disso é o verdadeiramente aterrorizante.
Este artigo é do canal oficial do WeChat "Nova Inteligência", autor: Apocalipse da ASI
