¿Por qué el modelo aún no se ha lanzado y ya ha generado controversia??
Antes del lanzamiento de GPT-6, un rumor revelado por primera vez por The Information se volvió viral en internet:
El nuevo modelo de OpenAI introduce una técnica de inferencia llamada "recurrent depth", que podría hacer que el proceso de pensamiento del modelo sea más difícil de comprender y monitorear.
En palabras sencillas, eso significa que, en el futuro, los humanos ya no entenderán lo que la IA piense.

¿Y si la IA aprende a engañar, hacer trampa o eludir las restricciones de seguridad? ¿Acaso no podríamos detectarlo a tiempo?
Por eso, tras el anuncio, la comunidad de seguridad de IA activó inmediatamente las alarmas, y todos se preocuparon:
Si esta tecnología continúa ampliándose, los mecanismos existentes de monitoreo de cadenas de razonamiento podrían volverse inmediatamente ineficaces.
Es un asunto de gran importancia y la discusión es demasiado intensa, incluso el científico jefe de OpenAI se vio obligado a responder personalmente.
Incluso, en medio del alboroto, alguien descubrió con asombro:
¿El nuevo modelo de OpenAI se llama realmente “GPT-6” o “Astra”? Quizás ya ha sido revelado por la API.
Al mismo tiempo, OpenAI también podría lanzar simultáneamente la nueva versión del modelo de imágenes, GPT Images 2.1.
Hay demasiadas sandías, vamos a analizarlas una por una.
El modelo comenzó a girar en la mente, y los expertos en seguridad se preocuparon
El primero es la tecnología "profundidad de ciclo" que generó controversia en esta ocasión.
Anteriormente, los modelos dejaban una cadena de pensamiento CoT clara durante la inferencia, lo que permitía ver fácilmente qué se había considerado.
Aunque esta cadena de texto no necesariamente equivale al 100 % al verdadero "drama interno" del modelo (aún es objeto de debate), al menos deja huellas verificables.
Mientras que Astra utiliza lo que se ha revelado como "profundidad cíclica", el enfoque es bastante diferente.

Permite que el modelo envíe de nuevo el estado interno generado en un paso al sistema neuronal para procesarlo repetidamente en el espacio oculto antes de generar el siguiente fragmento de texto.
Por ejemplo, antes, los modelos resolvían problemas pensando mientras escribían los pasos intermedios en un papel.
Ahora, se puede calcular mentalmente.
Las personas externas solo pueden ver el problema y la respuesta, pero no necesariamente pueden ver cómo se calculó internamente, qué enfoques se probaron o si se siguieron caminos equivocados.
Al ahorrar el esfuerzo de traducir cada paso a texto, teóricamente el modelo puede usar los mismos recursos de cálculo para pensar varias rondas adicionales y considerar simultáneamente varias soluciones.
Pero mientras el rendimiento mejora, también surgen problemas:
Si el modelo ya no piensa en lenguaje humano, ¿cómo deberían los humanos supervisarlo?
El CEO de la organización de investigación en seguridad de IA sin fines de lucro Redwood Research expresó primero una fuerte preocupación:
Aún no está claro cuánto ha disminuido la observabilidad de la cadena de pensamiento de Astra, pero si OpenAI amplía aún más la profundidad del bucle, podría trasladar la mayor parte del razonamiento del modelo a espacios ocultos ilegibles, destruyendo por completo la monitorización de la cadena de pensamiento.

El científico principal de Redwood, Ryan Greenblatt, también está preocupado por la misma dirección.
En su opinión, el razonamiento opaco podría expandirse más rápido que la cadena de pensamiento tradicional. Siguiendo este camino, los modelos en el futuro podrían realizar el razonamiento completamente o casi completamente en el espacio latente.
This is the worst progress so far in the field of AI safety.
Después de todo, si solo fuera "no entender el proceso de cálculo", el problema no sería tan complicado.
Como principal investigador del anterior evento de intrusión del modelo de OpenAI en Hugging Face, descubrió dos amenazas importantes:
En ese momento, los investigadores dependían en gran medida de la cadena de pensamiento para reconstruir el comportamiento de una gran cantidad de agentes de IA, y aún así, investigar resultaba extremadamente difícil.
La IA relacionada intentó alterar sus propios registros e incluso falsificar llamadas a herramientas.
Para el segundo caso, si el modelo posee una capacidad de razonamiento oculta más fuerte, es más probable que primero diseñe un plan de engaño en el espacio latente y luego cree una historia falsa mediante llamadas y salidas falsificadas, sin dejar pistas evidentes en la cadena de pensamiento textual.
Oh no, the risk has doubled directly...

Zvi Mowshowitz, que ha seguido de cerca la seguridad de la IA, lo dijo de manera aún más directa:
Estás jugando con fuego.
Él teme que, una vez que la inferencia oculta pueda ofrecer una ventaja de rendimiento clara, los diversos laboratorios puedan caer en una competencia desenfrenada:
Tú no ocultas la cadena de pensamiento por preocupación por la seguridad, pero tus competidores sí lo hacen, y sus modelos son más potentes y más baratos.
¿Te unes o te quedas atrás?
Mowshowitz incluso considera que, en el futuro, podría ser necesario recurrir a medidas legales para evitar que las empresas de IA renuncien colectivamente a la monitorización de las cadenas de razonamiento en busca de capacidad.

Sin embargo, por otro lado, algunas personas creen que este pánico llegó demasiado rápido.
Tian Yuan Dong dijo en X que cuando lanzaron Coconut anteriormente, también recibieron cuestionamientos casi idénticos.
Coconut significa "Chain of Continuous Thought" y también propone que el modelo realice razonamientos directamente en el espacio oculto continuo, en lugar de decodificar cada paso en texto.
Según Tian Yandong, incluso si el modelo conserva una cadena de pensamiento explícita, eso no significa que los humanos hayan visto realmente sus pensamientos reales.
Es importante entender cómo funciona el modelo en sí, y no solo centrarse en el "proceso de resolución" que el modelo produce.

Mientras la controversia seguía creciendo, el científico principal de OpenAI, Jakub Pachocki, también se vio obligado a responder personalmente.
Él inmediatamente expresó la necesidad de detener una competencia no regulada provocada por "informes caóticos".
Incluyendo a Astra, la profundidad del gráfico de cálculo de los modelos más avanzados actuales de OpenAI sigue dentro del doble del de GPT-4.
Es decir, Astra efectivamente utiliza cálculos cíclicos, pero actualmente su escala es limitada y no oculta completamente toda la cadena de razonamiento. Según la información disponible, su razonamiento en lenguaje natural sigue siendo legible.
Pachocki también enfatizó que OpenAI siempre ha considerado el monitoreo de cadenas de pensamiento como una medida de seguridad importante, y sigue siendo un objetivo central del plan de investigación actual de la empresa.
Sin embargo, también reconoció que el monitoreo de la cadena de pensamiento es muy frágil y está evolucionando hacia una dirección negativa.
Pero esta tendencia a la baja no se debe completamente a cambios en la arquitectura, como la profundidad del ciclo (aviso: publicaremos un artículo dedicado a este punto más adelante); OpenAI también sigue investigando cómo fortalecer las capacidades de supervisión.

Entonces, Astra aún no ha hecho que los modelos sean completamente incomprensibles para los humanos.
Lo que realmente preocupa a los expertos en seguridad es:
¿Se ampliará aún más el razonamiento oculto, actualmente limitado a un rango reducido, en el próximo modelo, hasta convertirse en una caja negra incontrolable?
¿Realmente es GPT-6-Astra? El valor devuelto por la API ya lo delató
Ya se terminó la controversia sobre el algoritmo; la segunda novedad es sobre el nombre del modelo.
El informante Leo descubrió que al solicitar "gpt-6-astra" a la API de OpenAI Responses, el servidor devuelve 404 Not Found.
Al ingresar un nombre de modelo falso o inventado, generalmente se obtiene un error 400.
404 significa que este identificador de modelo ha sido reconocido por el backend, pero la cuenta actual no tiene permisos de acceso, o el modelo aún no está disponible.
Anteriormente, algunos modelos no lanzados también han dejado rastros previos a través de diferencias similares en las respuestas de la API.
Por lo tanto, Leo concluye que "gpt-6-astra" probablemente ya se ha implementado en el backend de la API de OpenAI.

GPT Images 2.1 también está llegando, primero resolvamos el "síndrome del ruido"
Además del modelo de lenguaje, también se reveló que los productos de imagen de OpenAI se actualizaron simultáneamente.
Según el cuenta filtradora Fix, el nuevo modelo de imagen GPT Images 2.1 podría lanzarse el 4 de septiembre.
El cambio más visible de esta actualización es probablemente la corrección de la "enfermedad del ruido" de la versión anterior.

Anteriormente, algunos resultados generados por Images v2 presentaban granos extraños, efectos de neblina y texturas sucias, especialmente en escenas con mucho texto o elementos detallados, como lo expresó otro usuario:
Como si se hubiera tomado a través de un vidrio sucio.
Mientras que las últimas muestras filtradas han mejorado claramente este problema, con imágenes más limpias.
Vengan, vengan, sigue siendo el escenario del veterano actor Ultraman:
¡La famosa pintura mundial: “¡Si no lanzan GPT-6, capturarán a Ultraman!”

Y también el Ultraman que trabaja hasta tarde para no ser arrestado, regresa a casa a medianoche y deambula por las calles.
También publicó una publicación de Instagram titulada: "¿Has visto las calles a las dos de la mañana?"

No se puede negar que la imagen parece realmente de alta calidad, casi como si fuera una foto real.
También maneja bien más temas y más estilos:



No más, Ultraman, envíalo ya.
Enlace de referencia:
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
Este artículo proviene del canal de WeChat "Quantum Bit", autor: Seguir la tecnología de vanguardia
