GPT-6 Astra obtiene una puntuación casi perfecta en ARC-AGI-3, lo que desencadena un debate sobre la IAG

iconMetaEra
Compartir
AI summary iconResumen
GPT-6 Astra obtuvo una puntuación casi perfecta en ARC-AGI-3, utilizando un modelo simbólico del mundo para resolver rompecabezas complejos mejor que los humanos en el 96% de las tareas. La prueba costó $18,000, y los críticos señalaron que dependió de herramientas externas en lugar de una verdadera IAG. En medio del creciente interés en activos de riesgo, el rendimiento del modelo plantea preguntas sobre el verdadero progreso de la IA frente a la computación de alto costo. Las agencias de la CFT ya están monitoreando cómo los avances en IA podrían afectar los marcos regulatorios.
GPT-6 Astra ha generado atención al obtener un puntaje cercano al 100% en la prueba ARC-AGI-3. El modelo crea automáticamente un sistema algebraico de símbolos DSL para registrar las reglas del entorno, abstractizando el mundo real como símbolos lógicos y código causal mediante la generación de "modelos de mundo simbólico" eficientes, construye un "sandbox virtual" para simulaciones antes de actuar. Sin embargo, detrás de los altos puntajes se encuentra un costo computacional elevado: $360 por pregunta y un total de $18,000 para toda la prueba. Greg Kamradt, presidente de la fundación ARC Prize, señaló que estos puntajes altos dependen del marco externo Harness y no representan un verdadero avance en AGI, sino que solo demuestran que la IA se está volviendo más inteligente.

Autor del artículo, fuente: Leifeng.com

¡Superando la prueba de inteligencia de IA! ¿El modelo de mundo simbólico de GPT-6 Astra es una ruptura o simplemente una ventaja financiera?

Cada pregunta quema 360 dólares, ¿GPT-6 realmente ha superado la AGI?

El modelo más potente de OpenAI, GPT-6 Astra, finalmente se ha presentado, logrando avances asombrosos en operaciones de computadora, investigación científica y defensa de seguridad. Entre los numerosos logros destacados, el que ha generado mayor热议 entre el público es su desempeño en la prueba ARC-AGI-3, que se acerca al 100%.

¡Superando la prueba de inteligencia de IA! ¿El modelo de mundo simbólico de GPT-6 Astra es una ruptura o simplemente una ventaja financiera?

¿Qué es ARC-AGI-3? Es la evaluación reconocida a nivel mundial sobre la "inteligencia" de la IA, que puedes entender como el examen de ingreso al club Mensa de la IA.

Esta prueba consiste únicamente en problemas de patrones gráficos en constante cambio, imposibles de preparar mediante práctica. La IA debe explorar el entorno, inferir objetivos y descubrir patrones mediante reacciones en tiempo real y razonamiento. Esto representa un nivel más avanzado en diversas evaluaciones y permite determinar si la IA es simplemente una herramienta o verdaderamente inteligente.

Y GPT-6 Astra superó completamente esta prueba; recuerda que el modelo anterior, GPT-5.6 Sol, obtuvo un puntaje de solo 38.3%, lo que representa un salto enorme. Esta inteligencia incluso supera a la humana: en el 96% de los niveles, su eficiencia operativa fue mayor que la de los humanos, con un promedio de pasos de acción un 51.7% menor que el de los humanos.

Si una IA realmente posee la capacidad de establecer patrones lógicos y resolver problemas en un entorno completamente desconocido, podemos imaginar que, en el futuro, podría tomar decisiones correctas en condiciones de conducción autónoma desconocidas, o deducir rápidamente la estructura molecular de un fármaco eficaz ante una nueva y desconocida epidemia viral.

Para investigar por qué GPT-6 Astra es tan inteligente, el equipo oficial del ARC Prize revisó sus registros de fondo y descubrió que, al jugar, genera modelos de "mundo simbólico" eficientes.

¡Superando la prueba de inteligencia de IA! ¿El modelo de mundo simbólico de GPT-6 Astra es una ruptura o simplemente una ventaja financiera?

El modelo de mundo simbólico es un derivado avanzado del "modelo de mundo". Mientras que el modelo de mundo predice el futuro como un artista, utilizando imágenes; el modelo de mundo simbólico en tiempo real actúa más como un matemático, abstrayendo el mundo real en símbolos lógicos y códigos causales.

Esta tecnología es reconocida como un paso obligatorio para que la IA avance hacia el razonamiento avanzado.

¿Qué es el modelo de símbolos del mundo?

En el pasado, una de las razones principales por las que muchos modelos grandes no obtenían puntajes altos en las pruebas de referencia ARC-AGI fue que estaban acostumbrados a “probar y error por fuerza bruta”. La IA dividía la pantalla del juego en bloques de píxeles, hacía clic al azar, y si no funcionaba, probaba otra dirección, confiando en la suerte para completar el nivel.

En este modo, incluso con algunos avances en puntuación, la IA no comprende ni domina realmente las reglas del juego.

El modelo de mundo simbólico puede controlar el conjunto precisamente porque comprende plenamente las leyes físicas y las relaciones causales del entorno, y toma decisiones mediante cálculos precisos.

En pruebas reales, cuando GPT-6 Astra ingresa a un juego gráfico desconocido, comienza a tomar numerosas notas utilizando un DSL creado por sí misma, un sistema de símbolos algebraicos exclusivo. Por ejemplo, registra con precisión las reglas implícitas potenciales del juego, una secuencia de instrucciones próximas a ejecutarse, e incluso mapea con exactitud la trayectoria de cada píxel en un sistema de coordenadas.

Este método de registro algebraico lleva a un estado del mundo único y determinado; en comparación con la ambigüedad generada por los modelos anteriores que utilizaban interacción en lenguaje natural, esta representación simbólica provocará un salto épico en la precisión.

Luego, escribe mentalmente una lógica de código Python: "Si presiono A, la gráfica gira 90 grados a la izquierda".

Luego, crea un "sandbox virtual" en su mente, simulando el plan siguiente. Una vez que confirma que el ciclo lógico es cerrado y preciso, solo entonces da el primer paso en el juego real. Por eso, su eficiencia operativa es mucho mayor que la de los humanos.

Para explorar los límites de las capacidades de GPT-6 Astra, la plataforma de pruebas de equipo rojo PRO‑LONG la colocó en un sandbox de código, permitiendo que la IA escribiera y ejecutara código personalizado de forma autónoma.

Como resultado, GPT-6 Astra comenzó a "personalizar" herramientas para cada juego. Por ejemplo, en un juego de laberinto complejo con guardias que patrullan, GPT-6 Astra escribió automáticamente un sistema de navegación, luego añadió reglas de combate y simuló las rutas de patrulla de los guardias, finalmente prediciendo y validando perfectamente los resultados mediante esta cadena de herramientas creadas por sí mismo.

En años anteriores, esta capacidad de razonamiento simbólico y creación autónoma de herramientas dependía completamente de marcos externos de harness. Los externos ayudaban al modelo a traducir imágenes, registrar estados y validar resultados, pero presentaban desventajas muy marcadas: la transmisión constante de datos entre el modelo y los externos generaba altas latencias; la capacidad de ingeniería de los externos estaba completamente desconectada del entrenamiento de los pesos del modelo grande; debido a la fuerte dependencia del entorno de cómputo en la nube y de scripts externos, estas capacidades avanzadas resultaban difíciles de implementar en hardware de borde o terminal.

Ahora, GPT-6 Astra ha internalizado una gran cantidad de capacidades de Harness directamente en los pesos del modelo. El destacado académico Gary Marcus, defensor de los modelos del mundo simbólico, no pudo por menos que elogiar a GPT-6 Astra como un gran triunfo para esta línea de investigación.

En los últimos uno o dos años, el mundo académico y la industria han producido una gran cantidad de logros clave en esta dirección, desde Harvard y MIT hasta Google DeepMind, todos están apostando por el "modelo de mundo simbólico". Ante numerosas ramificaciones en el camino hacia la AGI, la industria está alcanzando un consenso técnico subyacente.

¿Con una puntuación tan alta, está asegurado el AGI?

El creador del problema le echa agua fría

Curiosamente, mientras la red entera celebraba este puntaje en el ranking, Greg Kamradt, presidente de la fundación ARC Prize, bajó el tono personalmente frente a los muchos que compartían la frase de Greg Brockman, presidente de OpenAI: “La AGI ya llegó”.

Es la figura central entre los creadores de preguntas; él tiene la mayor autoridad sobre cómo diseñar los criterios de evaluación y cómo interpretar las puntuaciones. Desde la perspectiva de la evaluación, considera que, aunque las puntuaciones son reales, aún están a una gran distancia de la IAG.

Hasta ahora, ha visto a varios equipos obtener más del 90% en ARC-AGI-3 con Agent Harness, como PRO-LONG con una memoria externa potente, Tycho especializado en razonamiento profundo y Prime Agent capaz de evolucionar su entorno de programación.

Estos productos de alto rendimiento comparten una receta técnica común: poseen cinco componentes principales, a saber, memoria sin pérdidas, análisis programático, pruebas de hipótesis explícitas, estado persistente y cálculos internos de bajo costo.

La memoria sin pérdida se encarga de recordar, el análisis programático se encarga de la lógica, la prueba explícita de hipótesis se encarga de la deducción, el estado persistente se encarga del contexto en interacciones múltiples, y el cálculo interno de bajo costo proporciona potencia de cómputo interna económica, permitiendo que la IA realice pruebas y errores intensivos en un entorno virtual antes de emitir la respuesta correcta. Juntos, forman un Harness invencible que compensa las deficiencias del modelo.

GPT-6 Astra se acerca al 100% de puntaje, utilizando también un conjunto lujoso de Harness, aprovechando un "base de adaptadores de proveedor" personalizado que utiliza conversaciones continuas y compresión de contexto para respaldar su cadena lógica; cada partida requiere un costo de 360 dólares en poder de cómputo costoso. Si se completa toda la prueba, la factura total de cómputo alcanza la asombrosa cifra de 18.000 dólares (aproximadamente 135.000 yuanes chinos).

Un humano puede resolver un rompecabezas gráfico en solo unos minutos; al calcular el costo de la electricidad según el metabolismo humano de 20 W, es menos de media centavo; incluso incluyendo el salario real pagado a los participantes, cada partida equivale a solo 12.78 dólares, mientras que la IA gasta 360 dólares. ¿Puede realmente este logro conseguido con "poder económico" convertirse en una AGI accesible para la gente común?

Por supuesto, GPT-6 Astra ya ha comenzado a internalizar gradualmente las capacidades de Harness; si continúa desarrollándose, la capacidad computacional potencial interna del modelo se volverá cada vez más poderosa. Sin embargo, dado que su proceso de razonamiento se vuelve cada vez menos transparente, los desarrolladores no saben si la IA realmente lo comprende o simplemente ha encontrado formas más eficientes de hacer trampa.

Volver a la pregunta anterior, ¿GPT-6 Astra es o no es AGI?

Para esta pregunta, Greg Kamradt ofreció, al final de su artículo extenso, una respuesta profundamente filosófica. ¿Por qué se considera a los humanos como “inteligencia general”? Porque los humanos pueden adaptarse a cualquier mundo desconocido, incluso si se lanzara a un bebé antiguo al presente, aún así aprendería a tomar el metro y usar un teléfono móvil. Esta inteligencia ha persistido durante miles de años, impulsando constantemente el progreso tecnológico. Pero ahora, la evaluación que la industria tecnológica exige con gastos masivos es solo un “examen de coincidencia de imágenes” diseñado para la IA.

Esto solo demuestra que la IA se está volviendo más inteligente, pero no es evidencia de la llegada de la AGI.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.