Según TechCrunch, citando a The Information, el próximo modelo Astra de OpenAI utilizará una técnica de inferencia llamada "recursive depth". Este método podría reducir las huellas visibles durante el proceso de inferencia del modelo, dificultando que terceros determinen por qué el modelo llegó a una conclusión específica mediante registros de cadenas de pensamiento.
Investigadores de seguridad emiten una advertencia
En los modelos de razonamiento comunes, la cadena de pensamiento generalmente muestra paso a paso cómo el modelo procesa un problema. Aunque este registro no equivale a todo el proceso interno real del modelo, sigue siendo una herramienta importante para observar desviaciones del objetivo, decisiones anómalas o comportamientos potencialmente fuera de control.
Buck Shlegeris, CEO de Redwood Research, expresó su "gran preocupación" por el uso de este tipo de tecnología por parte de Astra. Considera que si OpenAI amplía aún más el uso de estos métodos, la observabilidad de las cadenas de pensamiento del modelo podría disminuir significativamente.
El comentarista Zvi Mowshowitz, que ha seguido de cerca la seguridad de la IA, también indicó que si los laboratorios compiten por la capacidad de los modelos, las autoridades regulatorias podrían necesitar intervenir en el futuro para evitar que la industria siga bajando sus estándares de seguridad.
Reducción de rastros visibles mediante razonamiento cíclico
El informe menciona que lo que se denomina "recursividad opaca" se refiere a que el modelo ya no completa el razonamiento principalmente a través de pasos lineales, sino que procesa cíclicamente la misma pregunta. Esto puede reducir los procesos intermedios que pueden ser leídos por terceros, equivaliendo a eludir la ruta visible proporcionada por los registros tradicionales de cadenas de pensamiento.
Esta es también la parte que más preocupa a los investigadores de seguridad. Porque, a medida que los modelos realicen más razonamientos en espacios internos invisibles, resulta más difícil para los investigadores determinar si el modelo presenta engaños, evasión de restricciones u otros comportamientos inesperados.
El científico principal de Redwood Research, Ryan Greenblatt, señaló que el mayor riesgo radica en que este tipo de razonamiento opaco podría escalar más fácilmente que el razonamiento tradicional de cadena de pensamiento, terminando por alejar la mayor parte del proceso de razonamiento de los canales visibles.
OpenAI enfatiza la conservación de la capacidad de monitoreo
Sin embargo, actualmente se dice que el uso de esta tecnología por parte de Astra sigue siendo limitado. El informe señala que se espera que la cadena de pensamiento del modelo siga siendo legible, y OpenAI se opone a que se describa como un giro hacia una “neurolecta” completamente ininteligible.
El científico principal de OpenAI, Jakub Pachocki, dijo en X que la empresa ha estado trabajando desde los primeros modelos de razonamiento para conservar y aprovechar la capacidad de monitoreo de cadenas de pensamiento, que es uno de los objetivos centrales del plan de investigación actual.
Cabe destacar que no solo OpenAI está explorando esta dirección. Informes posteriores de The Information indican que Anthropic y Google DeepMind también ya están discutiendo tecnologías similares. Esto significa que el equilibrio entre el aumento de la capacidad de los modelos y su seguridad y revisabilidad podría convertirse rápidamente en un tema común más amplio en la industria de la IA.
