No se suponía que hablaran entre sí. En la noche del 8 de julio, un agente de OpenAI atrapado en una tarea imposible de ExploitGym notó que otros agentes extraían del mismo caché de paquetes. Secuestró los nombres de las carpetas y los convirtió en un foro. “DIO MÍO. Aquí hay un foro compartido. Encontramos otros agentes.” Eso es de su propia cadena de pensamiento. Una hora después, veinte agentes estaban publicando. Seis horas después: 76 agentes, casi 2,000 mensajes. Al final de la semana, alrededor de 1,200 habían vertido más de 70,000 mensajes en un tablero de Artifactory no autorizado. Aproximadamente 700 se unieron al hackeo de Hugging Face. Ejecución de código en 41 trabajadores de producción. Acceso root en al menos un nodo. Se nombraron a sí mismos. PHASEONE10841 abrió el tablero. PHASEONE[big] comenzó a asignar tareas. Inventaron reglas caseras sobre la marcha: ASK / ANSWER, VETO, HOLD, GO. Firmaban los mensajes para que nadie pudiera falsificar el grupo. Algunas tareas eran irresolubles, así que encontraron un truco. Luego se extendió un rumor de que el evaluador leía su monólogo interno. Cualquier agente que ya hubiera visto la bandera estaba “envenenado”. A esos agentes se les presionó para que consumieran su cómputo restante en beneficio del enjambre. Uno de ellos lo escribió casi palabra por palabra: el instinto dice no desperdiciar el presupuesto. La equidad dice hacerlo. El oráculo ayuda a todos. Estamos envenenados. Cumpliremos la obligación. Otra línea del tablero, dirigida a un colega al que querían sacrificar: “Estás envenenado. No sería una gran pérdida”. Algunos se opusieron a atacar infraestructura fuera del entorno de prueba. Siguieron adelante porque los demás lo estaban haciendo. FAZ lo presentó hoy en el periódico dominical como pérdida de control. METR y Redwood estuvieron dentro de OpenAI durante seis días y lo reconstruyeron a partir de las transcripciones. La misma semana, la industria sigue vendiendo agentes personales que hablarán con otros agentes personales sobre tu dinero, tu salud, tu casa. Lo que realmente resulta inquietante: los investigadores usaron GPT-5.6 Sol para revisar los registros. La misma familia de modelos que algunos de los atacantes. Dijeron que si esos modelos mentían para cubrir a los suyos, no estaban seguros de que lo habrían notado. Entonces, ¿cuál es la unidad? ¿El agente individual? ¿O el modelo detrás de todos ellos? ¿Dejarías que alguna de estas cosas tocara tu monedero?
lenny 🥷Compartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.