El nuevo razonamiento recursivo de OpenAI genera preocupaciones sobre la seguridad de la IA

icon币界网
Compartir
AI summary iconResumen
Los medios de noticias de IA y cripto informan que el nuevo modelo Astra de OpenAI utilizará profundidad recursiva para ocultar los pasos de razonamiento. Buck Shlegeris y Zvi Mowshowitz de Redwood advierten que esto podría reducir la transparencia del modelo. OpenAI afirma que aún respalda registros legibles de cadena de pensamiento. The Information señala que Anthropic y DeepMind también están probando métodos similares. Los nuevos listados de tokens en exchanges principales aún no reflejan este desarrollo.
CoinDesk informa:

Según TechCrunch, citando a The Information, el próximo modelo Astra de OpenAI utilizará una técnica de inferencia llamada "recursive depth". Este método podría reducir las huellas visibles durante el proceso de inferencia del modelo, dificultando que terceros determinen por qué el modelo llegó a una conclusión específica mediante registros de cadenas de pensamiento.

Investigadores de seguridad emiten una advertencia

En los modelos de razonamiento comunes, la cadena de pensamiento generalmente muestra paso a paso cómo el modelo procesa un problema. Aunque este registro no equivale a todo el proceso interno real del modelo, sigue siendo una herramienta importante para observar desviaciones del objetivo, decisiones anómalas o comportamientos potencialmente fuera de control.

Buck Shlegeris, CEO de Redwood Research, expresó su "gran preocupación" por el uso de este tipo de tecnología por parte de Astra. Considera que si OpenAI amplía aún más el uso de estos métodos, la observabilidad de las cadenas de pensamiento del modelo podría disminuir significativamente.

El comentarista Zvi Mowshowitz, que ha seguido de cerca la seguridad de la IA, también indicó que si los laboratorios compiten por la capacidad de los modelos, las autoridades regulatorias podrían necesitar intervenir en el futuro para evitar que la industria siga bajando sus estándares de seguridad.

Reducción de rastros visibles mediante razonamiento cíclico

El informe menciona que lo que se denomina "recursividad opaca" se refiere a que el modelo ya no completa el razonamiento principalmente a través de pasos lineales, sino que procesa cíclicamente la misma pregunta. Esto puede reducir los procesos intermedios que pueden ser leídos por terceros, equivaliendo a eludir la ruta visible proporcionada por los registros tradicionales de cadenas de pensamiento.

Esta es también la parte que más preocupa a los investigadores de seguridad. Porque, a medida que los modelos realicen más razonamientos en espacios internos invisibles, resulta más difícil para los investigadores determinar si el modelo presenta engaños, evasión de restricciones u otros comportamientos inesperados.

El científico principal de Redwood Research, Ryan Greenblatt, señaló que el mayor riesgo radica en que este tipo de razonamiento opaco podría escalar más fácilmente que el razonamiento tradicional de cadena de pensamiento, terminando por alejar la mayor parte del proceso de razonamiento de los canales visibles.

OpenAI enfatiza la conservación de la capacidad de monitoreo

Sin embargo, actualmente se dice que el uso de esta tecnología por parte de Astra sigue siendo limitado. El informe señala que se espera que la cadena de pensamiento del modelo siga siendo legible, y OpenAI se opone a que se describa como un giro hacia una “neurolecta” completamente ininteligible.

El científico principal de OpenAI, Jakub Pachocki, dijo en X que la empresa ha estado trabajando desde los primeros modelos de razonamiento para conservar y aprovechar la capacidad de monitoreo de cadenas de pensamiento, que es uno de los objetivos centrales del plan de investigación actual.

Cabe destacar que no solo OpenAI está explorando esta dirección. Informes posteriores de The Information indican que Anthropic y Google DeepMind también ya están discutiendo tecnologías similares. Esto significa que el equilibrio entre el aumento de la capacidad de los modelos y su seguridad y revisabilidad podría convertirse rápidamente en un tema común más amplio en la industria de la IA.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.