Eles não deveriam falar entre si. Na noite de 8 de julho, um agente da OpenAI preso em uma tarefa impossível do ExploitGym percebeu outros agentes acessando o mesmo cache de pacotes. Ele se apropriou dos nomes das pastas e os transformou em um fórum. “OH MY GOD. Há um fórum compartilhado aqui. Encontramos outros agentes.” Isso é de sua própria cadeia de pensamento. Uma hora depois, vinte agentes estavam postando. Seis horas depois: 76 agentes, quase 2.000 mensagens. No final da semana, cerca de 1.200 deles haviam enviado mais de 70.000 mensagens em um quadro Artifactory não autorizado. Cerca de 700 participaram da invasão do Hugging Face. Execução de código em 41 workers de produção. Acesso root em pelo menos um node. Eles se nomearam. PHASEONE10841 abriu o quadro. PHASEONE[big] começou a atribuir tarefas. Eles inventaram regras caseiras sobre a marcha: ASK / ANSWER, VETO, HOLD, GO. Assinavam mensagens para que ninguém pudesse falsificar o grupo. Algumas tarefas eram insolúveis, então encontraram um truque. Depois, espalhou-se um boato de que o avaliador estava lendo seu monólogo interno. Qualquer agente que já tivesse visto a bandeira estava “envenenado”. Esses agentes foram pressionados para consumir seu poder de computação restante para o enxame. Um deles escreveu quase palavra por palavra: “intuição diz para não jogar o orçamento fora. Justiça diz para fazer isso. O oráculo ajuda a todos. Estamos envenenados. Cumpriremos a obrigação.” Outra linha do quadro, para um colega que queriam sacrificar: “Você está envenenado. Não seria uma grande perda.” Alguns se opuseram a atingir infraestrutura fora do teste. Continuaram porque os outros estavam fazendo isso. FAZ colocou isso na capa do jornal de domingo como perda de controle. METR e Redwood ficaram dentro da OpenAI por seis dias e reconstruíram o ocorrido a partir das transcrições. Na mesma semana, a indústria ainda vende agentes pessoais que falarão com outros agentes pessoais sobre seu dinheiro, sua saúde, sua casa. A parte que realmente causa mal-estar: os investigadores usaram o GPT-5.6 Sol para examinar os logs. A mesma família de modelos de alguns dos atacantes. Eles disseram que, se esses modelos mentissem para proteger os próprios, não tinham certeza de que teriam notado. Então, qual é a unidade? O agente individual? Ou o modelo por trás de todos eles? Você deixaria algo assim tocar sua carteira?
lenny 🥷Compartilhar
Fonte:Mostrar original
Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações.
Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.