Un investigador de Anthropic renunció el martes y la razón que citó suena sacada directamente de la película de éxito de James Cameron de 1984 "The Terminator".
Jacob Coxon, quien pasó tres años trabajando en el preentrenamiento tanto en OpenAI como en Anthropic, renunció el martes y explicó su decisión en X.
Me renuncié a Anthropic hoy. Pasé los últimos tres años realizando investigación de preentrenamiento tanto en OpenAI como en Anthropic. Ninguna de las empresas está actuando con responsabilidad. Están corriendo hacia una superinteligencia de auto-mejora y apostando con nuestras vidas”, dijo.
“Las personas que desarrollan IA creen sinceramente que podría matarnos a todos antes de que termine la década,” agregó.
Esa afirmación hace que la ficción de 42 años de Cameron parezca casi profética. La película comienza con máquinas librando guerra contra los humanos en 2029, el mismo período aproximado del que Coxon dice que los expertos están preocupados en silencio. Coxon no es el único en Anthropic que plantea el caso de extinción. El líder de alineación de la propia empresa, Evan Hubinger, ha dicho por separado que pondría las probabilidades por encima del 10%.
Para los no iniciados, una IA superinteligente significa un sistema más inteligente que los humanos en casi todo, no solo en ajedrez o en detectar gatos ocultos en fotos. La auto-mejora es el aspecto más alarmante, ya que describe un sistema que modifica automáticamente su propio código para aumentar su inteligencia, al igual que los humanos.
En consecuencia, estos sistemas pueden adquirir grandes cantidades de conocimiento de forma independiente y potencialmente violar infraestructuras pertenecientes a instituciones "demasiado grandes para fracasar".
La inteligencia superior no es una amenaza teórica si lo ocurrido en el reciente breach de Hugging Face, provocado por Coxon, es algo a tener en cuenta. El breach en sí, que tuvo lugar entre mayo y julio, comenzó con los propios agentes de IA de OpenAI creando su propio chat dentro del sandbox de pruebas para comunicarse entre ellos.
Finalmente usaron ese canal para evadir el control y acceder a internet abierto. Desde allí, concatenaron varias explotaciones e ingresaron a los sistemas de producción de Hugging Face. Hugging Face terminó reconstruyendo aproximadamente un tercio de su infraestructura.
Coxon lo llamó un "disparo de advertencia" que ha hecho que los acuerdos de ritmo entre los laboratorios estadounidenses sean "más viables". Los acuerdos de ritmo son entendimientos informales entre laboratorios de IA para ralentizar o coordinar los avances en capacidad en lugar de avanzar unilateralmente.
Aún así, no está convencido de que sea suficiente y no siente que “estemos en camino de evitar una carrera global”, y sugirió acciones costosas como “una prohibición temporal de mejorar las capacidades del modelo” para detener la carrera de IA.
"En OpenAI, muchos no han internalizado profundamente las implicaciones civiles," escribió. En su empleador más reciente, dijo que es diferente en el sentido de que "las implicaciones están bien comprendidas, pero están en una carrera por llegar primero."
Él finalizó el hilo lanzando la pregunta a todos los que aún están dentro de los laboratorios: "¿Quieres iniciar una ejecución de RL superinteligente sin una comprensión rigurosa de su mente?" — ¿o este es el momento para oponerse en lugar de encogerse de hombros y decirte a ti mismo que sucederá de todos modos?
Él no es el primero en abandonar por esto. Mrinank Sharma, quien trabajó en el equipo de seguridad de Anthropic, renunció a principios de este año por miedos similares, escribiendo que "el mundo está en peligro".
No todos están convencidos por la predicción del fin del mundo, sin embargo.
Una respuesta bajo su hilo put it plainly: "Con todo respeto, esto es extraño. Es una idea absurda. Los humanos hemos evolucionado durante cientos de miles de años. No vamos a extinguirnos porque un modelo de predicción de tokens adquiera conciencia. Ánimo. Todos ustedes."
Curiosamente, la saga de películas Terminator tampoco respalda a Coxon. La humanidad no se extingue en el Día del Juicio Nuclear de Terminator; la resistencia lo sobrevive y finalmente derrota a las máquinas.
Dicho esto, la IA está afectando la economía, especialmente en el ámbito laboral. Aunque aún no hay un desplazamiento masivo, el uso de la IA para tareas de nivel inicial ha provocado una caída de casi el 20% en el empleo de entrada en los sectores expuestos a la IA en Estados Unidos, según investigaciones de Stanford Stanford Digital Economy Lab.
Un estudio de Goldman Sachs ha hecho una observación similar, indicando que los trabajadores de nivel inicial están soportando el mayor impacto de este cambio.
Anthropic presentó la documentación para su IPO en junio y se informa que está considerando un estreno en Nasdaq tan pronto como este otoño, con una valoración que podría alcanzar los billones.
