Google's Gemini Flash resuelve 3 problemas matemáticos de nivel PhD utilizando un marco de trabajo en equipo

icon MarsBit
Compartir
AI summary iconResumen
Google's Gemini Flash resolvió tres problemas matemáticos de nivel doctorado utilizando un marco de cumplimiento que permite a los agentes de IA colaborar y refinar soluciones. El modelo ligero replicó los resultados previamente logrados por Gemini Pro, produciendo pruebas sin errores verificadas por máquinas. El marco Teamwork imita la revisión académica, mostrando cómo modelos más pequeños pueden manejar tareas complejas. La liquidez y los mercados de criptomonedas podrían beneficiarse de esta colaboración estructurada de IA.

Si no vieras el nombre, seguramente pensarías que es otro modelo de élite tan potente que no puede lanzarse públicamente, con un récord «cheat»:

Hacer investigación: resolver de un solo tirón siete problemas matemáticos y de informática de primer nivel, presentando una demostración extensa de 40 páginas que ni siquiera la revisión más estricta por máquina puede encontrar errores;

Engineering project: I manually wrote a highly realistic CPU simulator from scratch, successfully booting the system with an error rate of 0.71%;

Escribir código: optimicé automáticamente el código principal de dos bibliotecas de código abierto populares, Eigen y ParlayHash, y los cambios fueron integrados directamente por los mantenedores upstream.

Esta es la hoja de resultados recién presentada por el equipo Antigravity de Google el 27 de agosto.

Google

En el artículo técnico de Teamwork, el equipo Antigravity de Google presentó conjuntamente tres categorías de logros: matemáticas, sistemas y código abierto.

Lo sorprendente es que esta vez no fue una bestia de cálculo que consume grandes cantidades de dinero, sino el modelo pequeño que se enfoca en "velocidad y bajo costo": Gemini 3.7 Flash.

Google

Incluso Google oficialmente lo calificó: es la primera vez que un modelo de nivel Flash logra un resultado matemático de nivel doctorado.

¿Por qué los modelos económicos pueden superar niveles?

El secreto no está en los parámetros, sino en un marco de orquestación de agentes múltiples llamado Teamwork.

La verdadera señal que Google quiere transmitir a la industria es: no es que Flash se haya vuelto repentinamente inteligente, sino que ha cambiado la forma en que se organiza el trabajo.

Pro lidera la exploración

Flash se reprodujo con éxito

¿Quién es el protagonista de esta hoja de calificaciones? El extenso artículo técnico de Google proporciona una definición muy rigurosa:

7 resultados en matemáticas y ciencias de la computación teórica, inicialmente obtenidos todos por Gemini 3.1 Pro en el modo de prueba larga de Teamwork.

Pero lo impresionante es que tres de estos resultados sólidos fueron completamente replicados por Gemini 3.7 Flash.

Estas tres cosas no son problemas secundarios meramente para completar cifras: la construcción de coreset para aproximación de subespacios ℓp, el límite inferior de dimensión para incrustaciones de máximo producto interno, y la cuantización de Hadamard que reduce directamente la constante líder en aproximadamente 5.93 veces.

Cada uno es un problema abierto serio en el mundo académico.

Google

Las otras cuatro están a cargo exclusivamente de 3.1 Pro: el límite inferior del número de condición para la optimización convexa dispersa, el límite inferior aproximadamente óptimo para la factorización de matrices de prefijos, el problema de los ciclos de Knuth, y el problema de la distancia unitaria de Erdős reproducido independientemente sin conexión a internet.

Además, esa evaluación TCSBench con una puntuación máxima del 71%, que superó el récord interno de Google, fue lograda por la combinación de 3.7 Flash y 3.1 Pro, superando directamente el récord anterior de 67.7% obtenido por 3.6 Flash junto con 3.1 Pro.

Entre ellos, la señal realmente digna de nuestra atención es:

Si se estructura correctamente el marco de trabajo, modelos ligeros como Flash pueden reproducir completamente los estudios realizados con modelos de gama alta.

Esto es suficiente para ampliar los límites de nuestra comprensión de lo que los modelos pequeños pueden hacer.

Teamwork convierte el "buscar fallos" en una制度 sólida

Teamwork es un marco de orquestación de múltiples agentes desarrollado por el equipo Antigravity.

Solo necesitas escribir /teamwork-preview, y Gemini leerá la instrucción, seleccionará el modo por sí mismo y reunirá de inmediato un «equipo de expertos en IA» que funcionará durante horas e incluso días.

Los resultados matemáticos mencionados anteriormente provienen todos del modo Long Proof.

Su diseño es extremadamente contraintuitivo: en lugar de acumular parámetros, se basa en hacer que un grupo de Flash se reúna para «criticarse, discutir y apuntar a sus puntos débiles».

¿Cómo se reúnen realmente estos AI? Desglosado, hay cuatro pasos en total:

Paso 1: La "búsqueda de estrategias competitivas" extremadamente intensa.

El sistema incubará simultáneamente múltiples propuestas candidatas y asignará a cada una un "especialista en contradecir" dedicado, cuyo único KPI es refutar esa propuesta.

Lo interesante es que los planes que reciben críticas feroces no se descartan directamente, sino que permanecen en el proceso cargados con todas las opiniones en contra.

Después de todo, a menudo en un camino equivocado y sin salida se esconde la inspiración que puede salvar vidas.

Paso 2: Siga la guía visual, «descomponga con precisión».

Una vez seleccionada una estrategia confiable, el sistema la divide en una serie de subproblemas con dependencias, representándolos en un gráfico topológico riguroso. Los que pueden ejecutarse en paralelo avanzan independientemente; los que tienen un orden secuencial esperan su turno.

Paso 3: El «torneo interno» de competencia feroz.

Dentro de cada subpregunta, se realiza un nuevo torneo de eliminación, donde los nodos leen las propuestas candidatas mientras revisan las críticas mordaces, y trabajan juntos para crear una versión mejorada.

Si falla la integración, vuelve a ejecutarla con las objeciones acumuladas hasta cerrar completamente la vulnerabilidad.

Paso 4: El "aprendizaje cruzado" que te enseña con la experiencia.

Los borradores fallidos se mantienen sin cambios para la próxima ronda, y cada obstáculo atravesado por los validadores se registra en el «libro de trampas».

Los caminos muertos recorridos y las conclusiones demostradas se sincronizan en tiempo real en la biblioteca de conocimiento compartido, disponible para que todos los miembros accedan en cualquier momento.

Google

Red de torneos en modo Long Proof: cada estrategia candidata tiene asignado un falsificador, y las rutas rechazadas permanecen en el proceso con sus objeciones.

Al ejecutar este proceso, más que un supercerebro frío y distante, parece una réplica de una reunión de investigación extremadamente rigurosa, en la que nadie puede intentar engañar.

Aquí, cualquier propuesta debe pasar primero por varias rondas de críticas intensas; solo los huesos más duros que no se rompen logran pasar con éxito.

Esto cura directamente la histeria colectiva más común en los agentes múltiples tradicionales:

Anteriormente, cuando un AI se desviaba accidentalmente, otros AI seguían ciegamente como «eco», construyendo cada vez más alto sobre una base errónea.

El truco de Teamwork no es más que convertir el "buscar errores mutuos" en un sistema sólido del que nadie puede escapar.

La verdad sobre el problema de Knuth

De estos siete logros, el más llamativo y también el más fácil de malinterpretar es el problema Knuth's Cycles propuesto por Donald Knuth.

De hecho, esta pregunta ya fue resuelta por IA en la primavera de este año.

Google

Donald Knuth, conferencia navideña de Stanford 2023.

A finales de febrero de este año, Claude Opus 4.6 generó la construcción de casos impares en aproximadamente una hora, obligando a Knuth a escribir dos «¡Shock!» al inicio del artículo.

Google

A continuación, modelos como gpt-5.3-codex y GPT-5.4 Pro tomaron el relevo y completaron los casos pares más difíciles.

Para mediados de abril, Gartner confirmó claramente en la versión revisada del artículo: el caso par ya no tiene dudas.

¿Qué hizo Google esta vez?

En resumen, Google encontró dos nuevas construcciones más elegantes y simples para el caso par, y además presentó dos primeras pruebas extensas de más de 40 y 70 páginas respectivamente.

Esa prueba de más de 40 páginas, además, pasó la verificación formal en Lean, hasta el punto de que ni siquiera la máquina pudo encontrar ningún error.

Esta es sin duda una contribución académica bastante sólida, pero su verdadero significado radica en "proporcionar una demostración más elegante", no en romper realmente desde cero.

Esto revela realmente el verdadero poder de Teamwork:

No busca compensar la "inteligencia aislada" de un modelo individual, sino que, mediante博弈 y coordinación institucionalizados, corrige por completo la debilidad colaborativa de los múltiples agentes inteligentes, que antes eran desunidos y se conformaban entre sí, liberando así la "inteligencia colectiva".

From Theorem to Shell

Esta vez fue realmente Flash.

El mismo mecanismo de búsqueda, Google cambió el modo y lo aplicó directamente a la ingeniería de alto rendimiento.

Este artículo técnico detallado especifica claramente «uso de Gemini 3.7 Flash». Teamwork construyó desde cero un simulador de CPU RISC-V con ejecución por ciclo y fuera de orden.

La ejecución fuera de orden es un estándar en los CPU modernos de alto rendimiento y también es el punto más propenso a hacer que el emulador se bloquee.

El trabajo en equipo se realiza en dos pasos: primero, asegurar la funcionalidad correcta de la microarquitectura, escribiendo uno mismo la tubería fuera de orden y el buffer de reordenamiento, y logrando arrancar el sistema operativo xv6 hasta el Shell; luego, alinear paso a paso los tiempos.

Google

Proceso de arranque del kernel xv6 y entrada al Shell en un emulador RISC-V construido por Teamwork.

La etapa más difícil, que Google denomina "el abismo de la ejecución silenciosa".

El estado de la microarquitectura del simulador puede desviarse silenciosamente en cientos de ciclos, y cuando se produce un error a nivel de arquitectura, ya es imposible encontrar la raíz del problema.

La solución de Teamwork consiste en aislar el simulador de referencia Spike en un entorno sandbox para evitar que los agentes copien o hagan trampa, y luego realizar una simulación coordinada paso a paso con reconciliación en cada paso.

Finalmente, este simulador ejecutó más de 100 benchmarks estándar de RISC-V y presentó un error promedio de ciclos del 0,71% en cargas de prueba no vistas en comparación con el hardware BOOM.

Google

Google discloses: Cycle alignment comparison between Teamwork simulator and BOOM hardware shows no average error of 0.71% on test loads.

Sin embargo, es importante aclarar que se trata de un simulador a nivel de software, nada que ver con el diseño de chips RTL, y mucho menos con la fabricación de chips.

Desarrollo de código abierto con aplicación real

En la segunda mitad de la investigación en IA, lo que cuenta es la implementación y la aprobación.

En comparación con las matemáticas y los simuladores, la última categoría de resultados parece la menos impresionante, pero cuenta con la evidencia más sólida.

Eigen es una biblioteca de álgebra lineal de alto rendimiento ampliamente utilizada en el mundo de C++.

Teamwork identificó una implementación subóptima de multiplicación de vector de matriz de una sola fila o columna y creó directamente una ruta rápida SIMD.

En la tabla hash concurrente ParlayHash, Teamwork introdujo las optimizaciones de Swiss Table, duplicando directamente el rendimiento de inserción inicial con 64 hilos, aumentando el rendimiento total por hilo en un 1.5 veces y reduciendo el uso de memoria por elemento en un 25%.

Estos dos cambios no son puntuaciones autoevaluadas hechas en un gabinete, sino código real que pasó rigurosamente por la revisión de código abierto y fue oficialmente integrado en la rama principal por mantenedores externos.

Más importante que la puntuación es una declaración final del autor en un artículo matemático: la demostración fue realizada inicialmente por el sistema de agentes Gemini interno de Google y luego verificada y editada por el autor.

Los agentes se encargan de explorar frenéticamente en hojas de papel de borrador infinitas, mientras que los humanos se encargan de firmar y aprobar finalmente. Esta es la división más realista actual en la investigación de IA.

Google lo dice claramente: estos problemas originalmente requerirían meses de trabajo de expertos de primer nivel; Teamwork reduce el ciclo de prueba y error, pero el volante y la autoridad final siguen en manos humanas.

La segunda mitad de la investigación en IA ya no se trata de quién tiene el modelo con más parámetros, sino de quién tiene mejor organizado su equipo de IA.

Cuanto más barato y más como un producto de uso diario sea el modelo, más valiosa se vuelve la revisión y supervisión humana.

Antes, las personas eran quienes resolvían problemas. Ahora, las personas son quienes plantean y verifican los problemas.

Gartner encontró una prueba escrita a mano para Claude, y luego se enteró de que alguien había verificado la prueba con Lean; dijo: “Esto es realmente algo bueno”, porque “recientemente me equivoco con más frecuencia”.

Incluso la demostración del ganador del Premio Turing de 88 años debe pasar por el verificador; las demostraciones escritas por IA no pueden ser una excepción.

En la tarea de resolver problemas, la máquina hará cada vez más. Pero en la fase de aprobación, siempre debe haber alguien supervisando.

Referencias:

https://antigravity.google/blog/teamwork-when-ai-becomes-a-research-partner

https://www-cs-faculty.stanford.edu/~knuth/papers/claude-cycles.pdf

Este artículo proviene del canal de WeChat "Neozhijyuan", autor: Apocalipsis ASI, editor: Yuanyu

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.