OpenAI Astra ha hecho este "innovador" avance, pero ByteDance ya lo había publicado el año pasado. Esta línea se llama recurrent depth. En términos simples, ya no se trata simplemente de generar CoT más largos para pensar un poco más, sino de hacer que el mismo conjunto de bloques Transformer repita ciclos sobre el estado oculto, inyectando más cálculos en el espacio latente. Para problemas difíciles, se ejecutan varias rondas; para problemas sencillos, se sale antes. Los parámetros no necesitan crecer junto con la profundidad de razonamiento, y el cálculo en tiempo de prueba puede asignarse de forma más flexible. En octubre del año pasado, ByteDance Seed ya publicó y abrió el código de Ouro, que implementaba un Lenguaje Iterativo. Ouro-1.4B y 2.6B incorporaron directamente razonamiento latente iterativo durante la preentrenamiento; el modelo 2.6B realiza por defecto múltiples cálculos recurrentes y admite salida adaptativa, permitiendo que cada pregunta decida por sí misma cuántas rondas necesita. Entonces, solo era una línea secundaria validada por ByteDance con modelos pequeños; ahora OpenAI la ha integrado en su modelo más avanzado. Esto sugiere que recurrent depth probablemente ya no es solo un diseño "interesante" desde el punto de vista académico, sino que comienza a convertirse en una verdadera ruta de ingeniería para los próximos modelos grandes. Y los problemas que plantea son más complejos que los benchmarks. Anteriormente, al expandir la capacidad de razonamiento de los modelos, muchos cálculos se almacenaban en el CoT. Cuanto más tiempo pensaba el modelo, más tokens de razonamiento generaba. Aunque el CoT no equivale al estado interno completo del modelo, al menos ofrecía una ventana de monitoreo segura. El recurrent depth continúa trasladando más cálculos hacia el espacio latente. El mismo conjunto de parámetros puede repetirse muchas veces dentro del estado oculto, completando gran parte del cálculo interno, para finalmente emitir solo un breve fragmento de texto. Surge entonces una pregunta muy práctica: El lugar donde realmente se completa el razonamiento del modelo está dejando gradualmente el lenguaje natural. Este es precisamente el punto que más preocupa a los investigadores sobre Astra. OpenAI siempre ha valorado mucho el monitoreo del Chain-of-Thought, porque cuando un modelo planea hacer trampa, manipular la recompensa o evadir reglas, a menudo revela sus intenciones primero en el CoT. Pero si cada vez más razonamiento ocurre dentro del estado latente, ¿qué es lo que puedes monitorear? Se informa que OpenAI actualmente incluso limita deliberadamente el grado en que Astra utiliza recurrent depth, con el fin de conservar más CoT legibles y además implementar monitoreo adicional del estado interno y del comportamiento. Este hecho es realmente interesante. Durante los últimos años, la forma en que los modelos grandes ampliaban su razonamiento era fácil de entender: dale más tokens, haz que hable más. Ahora podría volverse: dale más ciclos internos, pero sin necesidad de que te cuente esos procesos.
sleepy.mdCompartir
Fuente:Mostrar original
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información.
Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.