Según informes de los medios, el próximo modelo Astra de OpenAI utiliza una arquitectura de razonamiento cíclico recurrent depth (también conocida como looped transformer).
A diferencia de los Transformer tradicionales, donde cada token generado atraviesa fijamente todas las capas de la red, Astra permite que la misma información pase múltiples veces por el mismo conjunto de capas antes de emitir la salida. ByteDance ya reveló una ruta similar el año pasado.
Ouro, lanzado por el equipo Seed, es un modelo de lenguaje bucleado que hace que un conjunto de capas Transformer se ejecuten en bucle, integrando más cálculo dentro del modelo para permitir que modelos más pequeños aproximen el rendimiento de modelos más grandes aumentando el cálculo de inferencia.
Esta arquitectura plantea preocupaciones de seguridad: parte del razonamiento ocurre en estados internos ocultos, lo que impide que los humanos vean el registro completo del texto y dificulta aún más verificar mediante cadenas de pensamiento si el modelo incumple las normas.
OpenAI limitó así el uso de Astra sobre la profundidad recurrente, manteniendo una cadena de pensamiento legible y planea incorporar un monitoreo adicional de CoT.
