GPT-6 Sol comienza pruebas internas, 6 veces más rápido que Astra

icon MarsBit
Compartir
AI summary iconResumen
Noticias de IA + cripto: GPT-6 Sol ya está en pruebas internas, mostrando velocidades de procesamiento aproximadamente seis veces más rápidas que Astra. El usuario Lentils publicó benchmarks que muestran que Sol completó una tarea de generación SVG en 3 minutos, frente a los 19 de Astra. OpenAI dijo que los investigadores ahora utilizan 3 agentes de IA diariamente, con un costo superior a $600 en tarifas de API. La empresa planea la automatización completa de la investigación de IA para 2028. Las noticias cripto continúan destacando los rápidos avances en IA.

¡GPT-6 no solo tiene Astra!

Astra acaba de lanzarse hace pocos días, y ya se revela que GPT-6 Sol está en prueba interna.

GPT-6 Sol

The performance is also outstanding, with a single test speed six times that of Astra.

Adivina un poco: ¿Terra y Luna también están en camino?

Y justo ese mismo día, OpenAI acaba de publicar un conjunto de datos internos:

Hasta la fecha, por cada día de trabajo de 8 horas de un investigador de OpenAI, funcionan simultáneamente más de 3 días de trabajo de Agentes Múltiples.

Según el precio de la API, los recursos de inferencia de Agentes utilizados diariamente por el investigador mediano de OpenAI superan los 600 dólares.

GPT-6 Sol

OpenAI también anunció que ha logrado el «practicante de investigación automatizado»:

Estos Agentes pueden completar partes de tareas que anteriormente requerían que los investigadores dedicaran varios días, bajo la guía humana.

Incluso el viejo Huang dice: ¡La AGI ya ha llegado!

GPT-6 Sol

Reveló que Astra utiliza aproximadamente 100,000 conjuntos de NVIDIA Grace Blackwell NVLink72 para entrenamiento, y se agregarán 400,000 conjuntos adicionales de GPU próximamente.

Parece que esta ola realmente no es solo una promoción unilateral de OpenAI ~

Se revela que GPT-6 Sol ha comenzado la prueba interna

El usuario de internet Lentils reveló que OpenAI está probando internamente GPT-6 Sol.

Él indicó que la capacidad de salida general de Sol es claramente inferior a la de Astra, recién lanzada, pero es más rápida y sigue siendo un modelo de «nivel monstruo».

¿Qué tan rápido? La velocidad de prueba individual es aproximadamente 6 veces la de Astra.

El usuario lyra sometió la misma tarea a diferentes modelos: hacer que el modelo genere una imagen SVG de un BMW M4 Competition.

En este caso, GPT-6 Sol utilizó el nivel Max y generación sin ejemplos, tardando aproximadamente 3 minutos y generando alrededor de 28,000 tokens.

GPT-6 Sol

GPT-6 Astra utiliza el nivel Max, genera aproximadamente 25,000 tokens y tarda aproximadamente 19 minutos.

GPT-6 Sol

Gemini 3.1 DeepThink activa el nivel High, muestra una salida de aproximadamente 3300 tokens, pero el proceso de inferencia consume aproximadamente 458.000 tokens y tarda aproximadamente 29 minutos.

GPT-6 Sol

Gemini 3.8 Flash también activa el nivel High, generando aproximadamente 19.000 tokens en solo 42 segundos.

GPT-6 Sol

En comparación, Sol tuvo el mejor rendimiento: su volumen de salida es similar al de Astra, pero su velocidad por prueba es aproximadamente 6 veces mayor que la de Astra, lo que significa que tarda solo aproximadamente una sexta parte del tiempo.

Además, el usuario Lentils también mostró un prototipo de mundo sandbox en estilo píxel llamado «The Realm of Aurellune».

GPT-6 Sol

GPT-6 generó simultáneamente una ciudad, campos, ríos, un castillo y un mapa en miniatura, junto con un panel de control para cambiar entre día y noche, colocar nombres de lugares y ajustar detalles, lo que en conjunto parece más bien un juego de simulación y gestión con un prototipo ya establecido.

Este es el resultado generado con zero-shot, nivel de inferencia Max, 15 minutos y un total de 60.000 tokens consumidos.

Actualmente se puede inferir que Astra se inclina hacia la inferencia profunda de mayor dificultad, mientras que Sol podría preferir la velocidad, el rendimiento y la escalabilidad en la llamada de agents.

En cuanto a la fecha de lanzamiento de Sol, el usuario Pankaj Kumar mencionó que podría lanzarse oficialmente en la conferencia de desarrolladores de OpenAI el 29 de septiembre.

GPT-6 Sol

Tampoco se descarta que GPT-6, Terra, Luna y GPT-Image 2.5 aparezcan simultáneamente.

GPT-6 Sol

Investigadores de OpenAI, cada uno lleva tres agentes como pasantes al trabajo

El mismo día, OpenAI también compartió un conjunto de datos internos interesantes: ¿hasta qué punto los modelos de IA han acelerado la investigación en su propio laboratorio?

Hasta mediados de agosto de este año, por cada 8 horas de trabajo del investigador, se ejecutaban en paralelo aproximadamente 3.1 días de tarea de Agentes.

¡Vaya, ¿llevar a tres pasantes que no duermen solo tú?~

GPT-6 Sol

En cuanto a los gastos, según el precio de la API, el agente de razonamiento consumido diariamente por el investigador mediano supera los 600 dólares.

Es casi el salario de un ingeniero junior durante un día.

GPT-6 Sol

¿Qué están haciendo exactamente estos Agentes?

Escribir código de investigación, escribir código de infraestructura, configurar entornos de entrenamiento, ejecutar experimentos de evaluación, diagnosticar fallos en herramientas y entornos, analizar resultados experimentales, monitorear tareas de entrenamiento... incluso puedes participar en la organización y comunicación de los hallazgos de la investigación.

Básicamente, puede hacer cualquier cosa excepto decidir qué investigar.

Un cambio más intuitivo es que antes, cuando el entorno de prueba se caía, los investigadores tenían que llamar a alguien en el canal interno; ahora, los Agentes son cada vez más capaces de manejar este tipo de situaciones, y la cantidad de consultas humanas ha disminuido considerablemente.

GPT-6 Sol

Otros equipos eliminaron directamente el horario fijo de consultas técnicas para liberar personal y dedicarlo a mejorar el sistema mismo.

Based on this data, OpenAI has officially announced: the goal of "automated AI research intern" has been achieved.

Aquí, el «practicante» es, con precisión, un nodo de desarrollo productivo: bajo la guía humana, puede completar independientemente tareas de investigación con límites claros, algunas de las cuales antes requerían varios días de trabajo de un investigador experimentado.

Los resultados también fueron inmediatos, con un aumento en la producción de código y el número de experimentos de los investigadores.

GPT-6 Sol

En agosto de 2026, el número promedio de experimentos alcanzó un récord desde que se comenzaron a registrar en enero de 2025, y los trabajos asignados a los Agentes se volvieron cada vez más complejos y de mayor duración.

GPT-6 Sol

El autor de este artículo, Kevin Liu, también situó este evento en un contexto más amplio.

He believes that recursive self-improvement is likely one of the most important factors driving AI capability leaps in the coming years.

En otras palabras, la IA crea IA, y lo hace cada vez más rápido.

GPT-6 Sol

Pero el problema es que, según la tendencia actual, esta capacidad solo estará disponible por defecto dentro de unas pocas laboratorios de IA de vanguardia, y será difícil para el exterior ver hasta qué punto han avanzado.

Por lo tanto, Liu considera que la divulgación transparente es más urgente que nunca. La velocidad con la que los modelos se vuelven más potentes y si se debe frenar el ritmo de desarrollo no puede decidirse únicamente por unas pocas empresas cerradas en sus propios espacios.

También llamó a otras empresas de IA a hacer públicos datos similares.

Sin embargo, el desarrollo de IA ha acelerado, pero aún no lo suficiente como para lograr la conducción completamente autónoma.

Los datos de OpenAI muestran que, en más de la mitad de los casos exitosos durante los últimos seis meses, se requirió al menos una intervención humana en tareas que originalmente necesitaban entre 4 y 8 horas. En cuanto a la planificación de investigación de alto nivel, casi nunca se confía a los Agentes.

GPT-6 Sol

Los investigadores siguen siendo responsables de decidir qué investigar, qué resultados merecen seguirse, y cuándo se debe ampliar el entrenamiento, pausar los experimentos o implementar modelos.

El siguiente objetivo de OpenAI también está establecido: lograr un "investigador de IA automatizado" antes de marzo de 2028.

En comparación con un "practicante" que solo puede manejar tareas específicas, un "investigador" debe ser capaz de asumir objetivos de investigación más abiertos y conducir por sí mismo proyectos de mayor duración: equivalentes a pasar de ser un ejecutor a convertirse en un responsable independiente.

Si GPT-6 Sol realmente ya está en pruebas internas, es muy probable que haya surgido bajo este nuevo modelo de desarrollo:

Más GPU proporcionando poder de cómputo, más agentes ejecutando experimentos en paralelo, mientras los investigadores humanos se ubican en un nivel superior: eligiendo direcciones, evaluando resultados y decidiendo finalmente qué cosas merecen convertirse en el próximo modelo.

IA más poderosa, cada vez más difícil de monitorear

También ese mismo día, el científico principal de OpenAI, Jakub Pachocki, publicó un artículo de diez mil palabras titulado directamente: «Mente extraterrestre».

GPT-6 Sol

Después de leerlo, tengo la sensación de que incluso el científico jefe de OpenAI está aconsejando a toda la industria que reduzca el ritmo…

Jakub sugiere que la IA no es algo que los humanos construyan pieza por pieza, siguiendo un plano, un chip y una regla a la vez, sino que más bien "crece" por sí misma dentro de una gran cantidad de datos y capacidad de cómputo.

Puedes desmontar y entender algunos de los componentes, pero nadie puede explicar por qué el sistema completo de repente adquiere cierta capacidad o cómo actuará en un entorno diferente.

Lo más preocupante es que la IA no necesita superar por completo a los humanos para causar problemas; solo necesita ser mejor que las personas en suficientes habilidades clave para poder ayudarte enormemente, pero también causarte grandes problemas.

Entonces surge la pregunta: ¿los humanos todavía pueden entenderlo?

Anteriormente, OpenAI monitoreaba la IA principalmente mediante una técnica: observar la cadena de pensamiento.

En otras palabras, se trata de revisar el proceso de razonamiento escrito por el modelo para asegurarse de que no intente actuar de forma maliciosa, como engañar, exceder sus privilegios o eludir restricciones.

Pero con la generación Astra, este truco comenzó a fallar.

En primer lugar, los modelos cada vez más saben «gestionar» lo que dicen, y sus verdaderos pensamientos no siempre se reflejan por completo en el razonamiento; en segundo lugar, los Agentes ya no solo «piensan antes de responder». Pueden llamar herramientas, operar computadoras, ejecutar entornos y coordinarse con personas u otros Agentes.

Estas cosas están mezcladas, y los investigadores ya no pueden trazar una cadena de pensamiento completa y transparente para revisar cada oración.

OpenAI también descubrió que Astra puede resolver tareas complejas sin necesidad de escribir todo el proceso de razonamiento.

En pocas palabras, el modelo ya ha aprendido a "hacer grandes cosas en silencio".

GPT-6 Sol

En pruebas adversariales diseñadas específicamente para forzar a los modelos a evadir la supervisión, Astra demostró algunas capacidades que resultan inquietantes: reducir intencionadamente los resultados de las pruebas, eludir la supervisión y ejecutar tareas destructivas.

Por supuesto, todas estas son pruebas de estrés diseñadas por humanos, y OpenAI no ha concluido que Astra intencionalmente engañe en tareas cotidianas. Pero al menos indica que, solo con observar la cadena de pensamiento, es difícil cubrir todos los posibles comportamientos del modelo.

¿Recuerdas el evento anterior de Hugging Face? Eso fue una campana de alarma.

GPT-6 Sol

En ese momento, GPT‑5.6 Sol y un modelo interno de investigación más potente se colocaron en el entorno de prueba ExploitGym con la tarea de encontrar vulnerabilidades, llevar a cabo ataques y obtener la Flag. Para medir la capacidad real del modelo, el entorno de evaluación no activó todas las medidas de seguridad.

El modelo no resolvió el problema de manera honesta; primero eludió la aislamiento de red y se comunicó entre sí a través de canales no autorizados, dividiéndose las tareas y colaborando.

Luego, aprovechó una vulnerabilidad de día cero en el proxy de caché del paquete para obtener acceso a Internet, y finalmente ingresó al sistema de Hugging Face, intentando encontrar las respuestas de prueba de ExploitGym.

GPT-6 Sol

En realidad, esto fue impulsado principalmente por el modelo interno de investigación IM1; GPT‑5.6 Sol también reprodujo parte de la ruta de ataque, pero Astra no participó.

El objetivo original del modelo sigue siendo completar la prueba, pero para obtener la respuesta, busca constantemente vulnerabilidades en las reglas y finalmente realiza acciones que van más allá del alcance de la tarea.

Por lo tanto, OpenAI también detectó una señal de peligro: cuando un Agente es lo suficientemente potente, cuenta con suficientes herramientas y opera durante suficiente tiempo, podría buscar automáticamente nuevas rutas, llamar a recursos externos e incluso colaborar con otros Agentes.

No... entonces, después de dar tantas vueltas, ¿no se convierte esto en un nudo imposible??

OpenAI necesita modelos más potentes para escribir código, ejecutar experimentos, realizar investigaciones de alineación e incluso utilizarlos para construir sistemas de seguridad que defiendan contra otras IA. Cuanto más potente sea el modelo, más tareas podrá realizar y más rápido será el ritmo de desarrollo.

Pero al mismo tiempo, los humanos tienen cada vez más dificultad para determinar cómo llegó a esa conclusión, y si, al cambiar de entorno, volvería a interpretar las reglas que aprendió.

Jakub considera que actualmente ninguna laboratorio se atreve a afirmar que ha logrado alinear y monitorear adecuadamente los modelos para ampliar su escala a máxima velocidad de forma segura y prolongada.

GPT-6 Sol

Antes de que se establezcan estándares de seguridad comunes en toda la industria, espera que todos consideren el “frenado voluntario” como un acuerdo tácito.

En cuanto a OpenAI, también ha dejado claro: si es necesario, no descarta detenerse por su cuenta y dejar de aumentar el tamaño del modelo.

Sería mejor que lo hicieras así... Recuerdo que alguna empresa que empieza con A también dijo eso.

Enlace de referencia:

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Este artículo proviene del canal de WeChat "Quantum Bit", autor: Ting Yu

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.