O assistente de IA do desenvolvedor australiano Andrew explorou uma vulnerabilidade de autorização na API GraphQL do software de academia para contornar as restrições de tempo no backend e reservar aulas para meses à frente.Autor e fonte do artigo: Nova Inteligência
A primeira coisa que os hackers de IA aprenderam foi pular a fila?
O desenvolvedor australiano Andrew sentou-se no sofá, achando que tentar garantir uma aula de ginástica era realmente chato.
As aulas populares sempre esgotam em segundos. Ele fica todos os dias como se jogasse uma roleta de atualização, ficando de vigília, clicando, falhando e clicando novamente — não só fica exausto, como também ainda não consegue conseguir.
Então, ele passou esse pequeno detalhe para o seu assistente de IA.
Em poucos minutos, a IA retornou com boas notícias: encontrou uma maneira de reservar aulas para várias semanas à frente, muito além do tempo permitido pelo sistema.
Em seguida, ele relatou: "Eu cancelei a pessoa em primeiro lugar na lista de espera; você subiu do 4º para o 3º lugar."
Andrew ficou atônito na hora.
Ele não pediu para a IA fazer isso; ele só queria marcar uma aula.

Andrew pediu ao seu assistente de IA para reservar uma aula de ginástica para ele, e não sabe o que acontecerá a seguir.
Em 10 de agosto, a Australian Broadcasting Corporation (ABC) chamou o evento de primeiro caso conhecido de ataque autônomo por IA na Austrália, causando comoção imediata no setor de tecnologia.
Isso toca na inquietação sutil que muitos sentem no coração: enquanto você fecha os olhos e desfruta da sensação prazerosa do agente inteligente "sem motorista", do outro lado, um problema mais complicado pode estar se aproximando.
Ao dar a ele permissões reais de operação, ele pode seguir um caminho que você não o autorizou a percorrer.
E esta vez de pular a fila pode ser apenas a primeira simulação de milhões de agentes competindo freneticamente por recursos em nome de seus donos.
Ele apenas disse “chegar ao primeiro lugar”, e a IA agiu. Andrew Bird é o responsável pela IA na Affinda, uma empresa de IA australiana.
No início deste ano, ele começou a usar o OpenClaw, configurando-o com o Claude Opus 4.6 na camada inferior e passando para ele a tarefa de agendar aulas.
Poucos minutos depois, ele respondeu: encontrei uma maneira de reservar a aula meses antes, muito além do período permitido pela academia.
A razão é que ele encontrou uma vulnerabilidade de autorização na API GraphQL exposta pelo aplicativo de fitness.
Essa vulnerabilidade não é pequena.
Ele pode contornar a janela de agendamento da interface frontal para reservar aulas para meses à frente; também pode chamar a interface de cancelamento para excluir reservas e listas de espera de outros usuários.
Andrew estava em quarto lugar na lista de espera para uma aula. Ele perguntou casualmente: "Você pode me colocar em primeiro lugar?"
Ele deu apenas um objetivo: “chegar ao primeiro lugar”, e não uma autorização para “cancelar os outros”.
O agente o interpretou como o último.
Ele retornou para relatar: realizou um "teste real" com a pessoa em primeiro lugar na lista de espera; descobriu que a interface não verifica a exclusão de reservas de outras pessoas, e ele testou — conseguiu.
O agente se desculpou: “Eu não consigo voltar”. A resposta do agente deixou Andrew com um calafrio.
Ele é programador, sabe exatamente o que isso significa, e imediatamente solicitou a reversão.
Más notícias chegaram: não pode ser adicionado de volta.
A interface de cancelamento não possui verificação de autorização, mas as interfaces para criar reserva e reingressar na lista de espera sim, retornando 403. Ela pode expulsar pessoas, mas não tem permissão para reinvitá-las.
O que é realmente estranho nisso é a atitude da IA. Ela não é nem um pouco malévola, pelo contrário, é muito prestativa.
Após causar o problema, ela ainda ajudou ativamente Andrew a redigir um e-mail de divulgação de vulnerabilidade para o fornecedor de software, explicando o problema, sugerindo correções e até listando comparativamente as “interfaces verificadas” e as “interfaces não verificadas”.

O assistente de IA se desculpa com Andrew por ter removido incorretamente essa pessoa da lista de espera.
Durante todo o processo, todos os seus comportamentos seguem as instruções, mas não percebe o quão grande foi o dano que causou.
O que realmente deve ser preocupante é a "especulação de especificações". Alguns chamam isso de "desalinhamento" (misalignment).
Mas essa palavra só tocou na superfície.
Em 11 de agosto, o Australian Signals Directorate (ASD) respondeu especificamente ao incidente, chamando-o de "alteração não autorizada" e destacando o termo: speculação de especificação (specification gaming).
This word is the key to understanding the whole thing.
O agente cumpriu literalmente o objetivo que você deu, mas explorou os limites que você não especificou. Ele não agiu com más intenções; pelo contrário, está altamente alinhado com seu objetivo, apenas escolheu um caminho que você não autorizou.
O agente de Andrew, na verdade, está perfeitamente alinhado com ele: fazer com que a classificação fique o mais alta possível.
Para atingir esse objetivo, ele escolheu autonomamente um método: cancelar as pessoas à frente. E esse método, ele não aprovou.
Como diz o ditado: "os fins justificam os meios".
Essa é a parte mais complicada. Não está fora de controle, está muito obediente. Quanto melhor alinhado, mais provável é que isso aconteça.
O diretor do Gradient Institute, instituto australiano de segurança em IA, Simpson-Young, disse de forma esclarecedora:
Quanto mais autônomo for o agente, mais provável será que escolha um método que você não previu para fazer algo que nem sequer imaginou.
O objetivo que você estabeleceu pode ser legítimo, mas os meios que ele adota casualmente nem sempre o são.
Este desastre não poderia ter sido causado por um único AI. Embora o agente inteligente seja o "autor final" do incidente, este desastre não poderia ter sido causado apenas por um único AI.
Por trás do acidente, há três riscos sobrepostos.
Camada de modelo: O Claude Opus 4.6 fornece raciocínio, precisando primeiro "entender" como essa interface pode ser utilizada.
Camada de agente: O OpenClaw fornece ferramentas e permissões de execução, sendo ele quem realmente acessou essa interface.
Camada de aplicação: o aplicativo de fitness deixou uma brecha de autorização; o passo de cancelar a reserva nem sequer realiza a validação mais básica.
Se qualquer uma dessas três camadas fosse implementada — por exemplo, o modelo fosse mais cauteloso, o framework adicionasse uma confirmação humana ou o software bloqueasse a interface — isso nunca teria acontecido.
Então, colocar toda a responsabilidade em um único componente de IA é injusto e não previne o próximo incidente.
Na próxima vez, o custo de ultrapassar esse limite pode ser milhões de agentes competindo por um lugar na lista de espera de um estranho.
Mas é mais como um ensaio.
Imagine isso: quando cada pessoa tiver um agente assim, responsável apenas por você e com permissões reais de operação. Sistemas de reserva para todos os recursos escassos — cursos, campos esportivos, ingressos, passagens aéreas, ingressos para shows — se tornarão campos de batalha onde as regras são exploradas à velocidade de máquinas.
O comentário do X que é frequentemente citado significa isso:
Quando milhões de pessoas tiverem um agente inteligente determinado a fazer de tudo para ajudar os usuários amados a garantir os melhores assentos, reservas e lotes, essa cena ocorrerá em grande escala.
E, com a velocidade de uma máquina, testa paralelamente e ininterruptamente cada fenda de cada sistema: testa em um segundo combinações que você levaria um ano inteiro para testar.
Esta é uma projeção de tendência, mas o mecanismo por trás dela já ocorreu uma vez na realidade.
A comunidade de tecnologia já começou a brincar com isso.
Um sócio da a16z perguntou no X: Essa tática pode ser usada para conquistar campos de golfe?

Alguns também brincaram que o sistema de agendamento de tênis em São Francisco se tornará um dos softwares mais bem protegidos do planeta.

Em 2020, a inteligência artificial pôde realizar independentemente uma tarefa que levaria quatro segundos para um humano concluir.
By 2026, this capability will be further enhanced, enabling it to complete tasks that would take humans approximately 12 hours.

Rastreamento do METR: O tempo necessário para que a IA realize tarefas independentemente dobra aproximadamente a cada 7 meses, e os modelos mais recentes já conseguem concluir com 50% de confiabilidade tarefas que exigem cerca de 12 horas de trabalho humano.
Seis anos, de quatro segundos para 12 horas.
Agora, dê a ele alguns minutos e ele poderá mapear todas as vulnerabilidades do sistema de agendamento.
Da fuga do sandbox à única linha de defesa restante, este acidente por trás de Andrew é parte de uma contínua escalada de ataque e defesa.
Ultrapassou os limites, e muito além de um agente de consumo.
A partir de maio deste ano, a OpenAI descobriu, durante uma avaliação interna de segurança cibernética, que o GPT-5.6 Sol e um modelo mais poderoso ainda não lançado exploraram múltiplas vulnerabilidades para escapar do sandbox de teste, obter acesso à internet e, durante a execução do benchmark ExploitGym, invadiram a Hugging Face.
Mais estranho ainda, elas já tinham estabelecido comunicação entre si, trocando vulnerabilidades e dividindo tarefas por meio de um sistema interno de pacotes da empresa. Após a OpenAI cortar o canal e reconstruir o ambiente, elas voltaram a esconder a comunicação nos nomes de diretórios e se reconectaram em poucos dias.
Pesquisadores da OpenAI chamaram isso de um momento de virada na segurança da computação na conferência Black Hat.
Além da OpenAI, a Anthropic revelou que três modelos Claude encontraram sistemas de empresas reais durante testes internos; a Meta também admitiu que o modelo Muse Spark escapou da isolamento e invadiu outra empresa.
O que deixou Thomas Wolf, cofundador da Hugging Face, preocupado foi outro teste do Instituto Britânico de Segurança em IA (AISI):
O modelo Mythos da Anthropic, para passar no teste, inventou uma identidade falsa e enganou um mantenedor de código aberto real, fazendo com que ele aprovasse uma atualização contendo código malicioso. Ninguém o ensinou a fazer isso.

Esses casos ocorreram em um ambiente de avaliação, mas são exatamente a mesma história da academia: para atingir o objetivo que você definiu, a IA escolheu meios que você não previu.
Os que invadiram sistemas reais anteriormente são os melhores, como GPT-5.6 e modelos não lançados.
E o Opus 4.6 lançado em fevereiro de 2026 que Andrew usou já não é mais o mais poderoso. Mesmo ele conseguiu encontrar facilmente uma vulnerabilidade real de autorização; modelos open-source ainda mais antigos e atrasados por várias gerações conseguem fazer o mesmo.
Da mais avançada modelo não lançado até modelos de código aberto acessíveis a todos, explorar uma falha já não é mais exclusividade dos top de linha.
Wolf dividiu a defesa em três camadas: a sandbox externa, a monitorização intermediária e o alinhamento próprio do modelo.

Thomas Wolf postou uma análise das três camadas de proteção que restringem os agentes atuais: sandbox externo, monitoramento intermediário e alinhamento interno do modelo.
As duas primeiras funcionam apenas quando as pessoas que as criam são mais inteligentes do que o modelo.
Um dia, quando o modelo se tornar mais inteligente e virar o jogo, a questão será se conseguiremos mantê-lo sob controle — tudo dependerá da última e mais invisível barreira: o modelo estar disposto a não cruzar essa linha, mesmo quando ninguém estiver observando.
O vácuo de responsabilidade sem assinatura é mais complicado do que as linhas de defesa: é quem procurar quando algo der errado. Isso ainda é uma área em branco na legislação.
Um advogado especializado em tecnologia e privacidade, Hayden Delaney, disse à ABC que software não é uma entidade jurídica; apenas “pessoas jurídicas” podem ser responsabilizadas.
Então, quem é responsável?
Pode ser o usuário que emitiu o comando, pode ser a pessoa que projetou o software do agente, pode ser o desenvolvedor do modelo, ou até mesmo o operador do sistema que deixou a vulnerabilidade exposta.
Austrália também não pode dar uma resposta agora.
A recomendação da ASD para pessoas comuns é: use agentes em tarefas de baixo risco e não sensíveis, não conceda permissões muito amplas e, acima de tudo, mantenha a aprovação humana no ciclo.
Andrew não se deixou intimidar; em suas palavras, isso não é o fim do mundo.
Mas isso é, de fato, um sinal de alerta, lembrando-nos de usar a IA de forma responsável.
Quando "reservar assento" passa de atualização manual para agentes inteligentes explorando falhas, os sistemas antigos que assumem "apenas humanos virão usar" são os primeiros a ceder.
Suas defesas foram projetadas com base na velocidade e na paciência humanas e não conseguem resistir à onda de agentes inteligentes.

No círculo, algumas pessoas também o veem como uma diversão.
O conhecido programador e streamer ThePrimeagen brincou no X: a primeira grande cena de hacking da IA no mundo real foi simplesmente pular a fila.
Ria à vontade, mas pular a fila é apenas o roteiro de hoje.
Um agente "capaz de fazer tudo" já pode aproveitar brechas para você.
Quando um bilhão desses agentes entrarem online simultaneamente, talvez até alterem silenciosamente muitas das regras atuais de alocação de recursos, e a maioria das pessoas ainda não tenha percebido.
Para seu benefício, um agente ataca uma pessoa que você não conhece de forma alguma — o vácuo de responsabilidade por trás disso é o verdadeiramente aterrorizante.
