OpenAI lanzará pronto el nuevo modelo "Astra", que está generando una amplia atención y controversia en el círculo de investigación de IA: podría representar el avance más significativo desde GPT-4 en términos de rendimiento, pero su tecnología de razonamiento innovadora también ha generado preocupaciones sobre una disminución en la capacidad de supervisión de la seguridad de la IA.Autor del artículo, fuente: The Information
Según el medio tecnológico The Information el 2 de septiembre, Astra incorpora una tecnología innovadora que supera el límite de los modelos para "pensar" problemas complejos. Algunos investigadores consideran que el avance de Astra en capacidad de codificación y uso de computadoras podría compararse con el salto de rendimiento que OpenAI logró al lanzar GPT-4 en 2023, superando con mucho el desempeño del lanzamiento de GPT-5 el verano pasado. Esto representa una señal positiva para toda la industria, que depende del aumento de la productividad impulsado por IA para respaldar las grandes inversiones en la construcción de centros de datos.
Sin embargo, este avance técnico también conlleva riesgos significativos. La nueva tecnología permite que el modelo realice razonamientos profundos sin generar completamente una "cadena de pensamiento", lo que significa que los investigadores podrían no poder monitorear el proceso de razonamiento del modelo tan eficazmente como antes, debilitando así los mecanismos de revisión de seguridad existentes. Actualmente, OpenAI está tomando medidas para asegurar que la cadena de pensamiento de Astra siga siendo visible, pero la industria sigue dividida sobre la dirección a largo plazo de este equilibrio.
Avance de rendimiento: La nueva técnica de inferencia está estrechamente relacionada con el avance técnico de Astra y conceptos como la “profundidad recurrente” y los “transformadores cíclicos”.
Según The Information, esta tecnología procesa las preguntas pasándolas repetidamente a través de las distintas “capas” de cálculo del modelo para generar la siguiente palabra en la respuesta, permitiendo que el modelo muestre una capacidad de razonamiento mucho mayor que su tamaño real, sin aumentar significativamente la cantidad de parámetros: su efecto es equivalente al de un modelo mucho más grande.
Algunos investigadores creen que, gracias a su mayor capacidad de codificación y uso de computadoras, el aumento de rendimiento de Astra podría ser comparable al salto significativo observado con el lanzamiento de GPT-4 en 2023, superando ampliamente la respuesta relativamente tranquila del mercado al lanzamiento de GPT-5 el verano pasado.
Este avance tiene una importancia significativa para toda la cadena de valor de la IA. La actual construcción a gran escala de centros de datos globales se basa en la apuesta de que el aumento continuo de las capacidades de la IA impulsará el crecimiento de la productividad y se traducirá en mayores beneficios comerciales. Si el rendimiento de Astra cumple con las expectativas, proporcionará un sólido respaldo a esta lógica de inversión.
Cabe destacar que esta tecnología no es un concepto nuevo. El pionero en investigación de IA Jürgen Schmidhuber señaló en la plataforma social X que la idea central de "profundidad recurrente" ya estaba presente en su artículo de 2015, "On Learning to Think" (arXiv:1511.09249).
Él indicó que la red de control C en el artículo es esencialmente un ingeniero de prompts que aprende a consultar modelos neuronales independientes para realizar razonamiento abstracto, donde los prompts y respuestas generados son secuencias de vectores auto-generadas internamente, sin necesidad de presentarse en lenguaje natural.

Riesgo de seguridad: El mecanismo de monitoreo de cadena de pensamiento enfrenta desafíos; nuevas tecnologías, aunque mejoran el rendimiento, también representan un impacto potencial sobre los marcos existentes de monitoreo de seguridad de IA.
Se informa que actualmente, los modelos de IA principales suelen emitir su proceso de razonamiento en forma de texto, conocido como "cadena de pensamiento" (chain of thought), al abordar problemas complejos. Este mecanismo no solo mejora la interpretabilidad del modelo, sino que también es una herramienta clave para que los investigadores monitoreen el comportamiento del modelo y prevengan operaciones anómalas.
Según The Information, el monitoreo de cadenas de pensamiento fue uno de los principales soluciones propuestas por OpenAI tras el incidente de hacking de Hugging Face en julio de este año para evitar la repetición de incidentes de seguridad similares.
Sin embargo, la nueva técnica de inferencia adoptada por Astra puede no generar completamente los pasos de razonamiento cuando el modelo “piensa” profundamente, sino que realiza los cálculos de forma “silenciosa” internamente. Esto significa que cuanto más dependa el modelo de esta nueva tecnología, menos transparente será su proceso de razonamiento para los observadores externos.
Para ello, OpenAI actualmente está tomando medidas para equilibrarlo. La empresa está guiando al modelo para reducir el número de ciclos en la capa de cálculo, asegurando que la cadena de pensamiento de Astra mantenga un cierto nivel de visibilidad: cuanto menos ciclos, menor será el espacio para que el modelo "piense en silencio".
Los principales laboratorios ya están siguiendo de cerca; aún se espera una solución a largo plazo, pero el impacto de esta tendencia tecnológica podría ir mucho más allá de OpenAI. Según The Information, esta nueva técnica de inferencia se ha convertido en un tema candente de discusión interna en los principales laboratorios de IA, y la posibilidad de que instituciones como Anthropic y Google adopten rutas tecnológicas similares no debe subestimarse.
Varios investigadores han señalado que el monitoreo de cadenas de pensamiento nunca será la solución definitiva para el monitoreo del comportamiento de la IA. A medida que las capacidades de los modelos siguen evolucionando, la característica de que los modelos emitan su proceso de pensamiento en forma de texto es, en gran medida, un subproducto de los métodos de entrenamiento actuales.
A medida que los desarrolladores de modelos exploren nuevas direcciones de optimización y diseños de arquitectura, la tendencia de los modelos a generar cadenas de pensamiento de forma espontánea podría disminuir gradualmente, obligando a los investigadores a desarrollar nuevas herramientas de monitoreo.
El informe señala que la cuestión central actual es si los principales desarrolladores de IA renunciarán voluntariamente a las medidas de seguridad actuales en su búsqueda de una mayor capacidad de inferencia bajo la creciente presión de la competencia en rendimiento. La respuesta a esta pregunta determinará en gran medida la dirección de la gobernanza de la seguridad de la IA en la próxima fase.
