Resumen generado por IA: El equipo de la Universidad de Florida aplicó la recién demostrada conjetura de Kakeya tridimensional al entrenamiento de modelos grandes, desarrollando el método GeoLAN para abordar el problema de la “caja negra” en IA. Este método utiliza el concepto de “conjunto de Kakeya pegajoso” surgido de la demostración de la conjetura, aplicando restricciones geométricas al espacio semántico de los modelos grandes y ordenando los conceptos desde la fase de entrenamiento, lo que hace que las rutas de pensamiento de la IA sean rastreables. Se lograron mejoras significativas en modelos como Llama-3-8B y Gemma-3-4B. Además, el ganador del Premio Fields de este año, Jacob Tsimerman, anunció el mismo día de su premiación que se une a OpenAI para trabajar en seguridad de IA, lo que demuestra que las matemáticas y la IA se están fusionando a una velocidad sin precedentes.Autor y fuente del artículo: Leifengwang

El mundo de las matemáticas y el mundo de la IA se han conectado fuertemente
Los resultados matemáticos puros y sólidos ya se han implementado directamente en la capacitación de modelos grandes.
Un autor de Xiaohongshu, Z9, descubrió mientras revisaba artículos académicos que la recientemente viralizada conjetura de Kakeya tridimensional ahora ha sido incorporada por un equipo de la Universidad de Florida en el proceso de entrenamiento de redes neuronales, resolviendo de forma interdisciplinaria el "problema de caja negra" de los grandes modelos.
Su artículo se titula "GeoLAN: Geometric Learning of Latent Explanatory Directions in Large Language Models", y su núcleo consiste en utilizar el concepto central surgido en la demostración de la conjetura de Kakeya, llamado "conjunto de Kakeya pegajoso", para establecer un "conjunto de reglas de organización" en el espacio semántico interno de los grandes modelos, alineando desde la fase de entrenamiento los conceptos entrelazados y haciendo que las rutas de pensamiento de la IA sean verdaderamente rastreables.

Realmente, antes los grandes matemáticos abrieron el camino, y ahora los investigadores de IA recogen las joyas.
El problema fundamental de los grandes modelos: colapso de representación
Comencemos con el "problema de la caja negra" que todos experimentan.
Los modelos grandes actuales tienen una alta precisión al resolver problemas, escribir código y realizar análisis, pero cuando les preguntas “¿cómo se te ocurrió este paso?”, o bien no pueden explicarlo claramente, o simplemente inventan una razón falsa para engañarte.
La raíz de este problema se encuentra en una característica subyacente llamada colapso de representación.
Puedes imaginar el espacio semántico del modelo grande como un inmenso almacén inteligente de miles de niveles, que teóricamente puede clasificar y almacenar innumerables conceptos: lógica, emoción, hechos, razonamiento, etc., cada uno en su lugar.
Pero durante el entrenamiento, Transformer es particularmente “perezoso”: siempre tiende a acumular toda la información semántica en una pequeña zona junto a la entrada del almacén, dejando el 90% restante del espacio completamente vacío.
Como resultado, todos los conceptos se agrupan en una estrecha región cónica de alta dimensión, lo que la comunidad académica denomina "anisotropía".
Sin embargo, las consecuencias de apretarse demasiado traerán muchos problemas.
Por ejemplo, el entrelazamiento de conceptos obliga a incorporar contenidos completamente desconectados en la misma dirección, haciendo que una neurona deba responder a “gato” y activarse también por “pasajes bíblicos”.
Y ni siquiera puedes desglosar qué representación corresponde a qué lógica; ni siquiera el modelo puede reconstruir la ruta de pensamiento real.
Cuando se juntan conceptos similares pero distintos, es fácil confundirse; un pequeño cambio en la pregunta hace que la IA diga tonterías.
Para esto, el artículo ofrece una resumen muy preciso: unos pocos "dimensiones maliciosas" dominan la mayor parte de la varianza de la información, desperdiciando toda la capacidad útil del modelo.
Este problema es una debilidad de casi todos los arquitecturas Transformer principales, desde GPT, Llama hasta Gemma, sin excepción.
Ante esta situación, las soluciones anteriores de la industria básicamente eran “corregir después del hecho”: esperar a que el modelo terminara de entrenarse y luego usar herramientas como autoencoders escasos para descomponer forzosamente los conceptos entrelazados.
Pero el resultado obtenido con este método solo “parece razonable” y no necesariamente refleja la lógica real interna del modelo; la fidelidad siempre se ve comprometida.
Ahora, la idea de GeoLAN cambió completamente de dirección: no esperes a que se desordene para organizarlo, sino que desde el principio coloca todo según las reglas. Durante todo el entrenamiento, aplica restricciones geométricas al espacio de representación para que cada concepto ocupe su lugar adecuado.
¿Cómo está relacionada la conjetura de挂谷 con la IA?
Para entender la idea de GeoLAN, primero hay que saber de qué trata la conjetura ofuri.
En 1917, el matemático Kakeya Susumu planteó un problema aparentemente sencillo, pero que atormentó a la comunidad matemática durante medio siglo: tomemos una aguja de 1 cm de longitud y gírala una vuelta completa sobre una mesa; ¿cuál es el área mínima que puede barrer?
Podrías pensar que, al dar una vuelta, necesariamente se debe trazar un círculo de área considerable. Pero los matemáticos descubrieron que puede acercarse a 0.
¿Cómo se hace?
Si haces que una aguja gire mientras se desliza, puede generar una figura extraña con un área casi nula. Es decir, en un mundo bidimensional, puedes ajustar trayectorias geométricas en todas las direcciones dentro de un rincón extremadamente pequeño.
El desafío se intensifica aún más: ¿y si estuviera en un espacio tridimensional? Cuando esta aguja puede girar en todas las direcciones espaciales —arriba, abajo, izquierda, derecha y en infinitas orientaciones tridimensionales—, ¿cuál es el tamaño mínimo que debe tener el espacio para caber todas estas agujas en todas las direcciones?
Según la experiencia bidimensional, en el espacio tridimensional, el volumen absoluto de esta figura aún puede comprimirse hasta aproximarse a cero.
Pero aquí surge un nuevo rompecabezas: aunque esta figura es vacía y carece de volumen, ¿también se ha encogido o degradado a nivel microscópico? Los matemáticos introdujeron el "número de dimensión fractal" para medir la densidad de su estructura esquelética.
Finalmente, Wang Hong y otros descubrieron que, incluso si se comprime el volumen de la gráfica hasta hacerlo lo más vacío posible, para atender a cada aguja en todas las direcciones, su estructura interna entrelazada mantiene una "densidad tridimensional sólida" que no se degrada en absoluto a nivel microscópico. Este es precisamente el gran logro de Wang Hong al resolver el problema secular.
Fue durante este proceso de prueba rigurosa que surgió un concepto extremadamente clave llamado "conjunto de谷粘".
“Stickiness” es, en términos sencillos, un conjunto de reglas para evitar corridas. Está diseñado específicamente para mantener separadas las líneas y los tubos, impidiendo que se acerquen entre sí.
Si un conjunto de tubos sigue estas reglas, se extenderán ordenadamente y el espacio mantendrá su tamaño original; pero si no las respetan y se apiñan en una pequeña esquina, el "tamaño" del espacio se reducirá, pareciendo comprimido.
Al llegar aquí, ya deberías poder relacionarlo: ¿la colapso de representación de los grandes modelos no es precisamente “que el tubo semántico no cumpla la condición de viscosidad y todo se apile junto”?
Lo que hace GeoLAN es tomar directamente las conclusiones matemáticas de la conjetura de Gu Valley como estándar de ingeniería: dado que ya se ha demostrado rigurosamente en matemáticas que "satisfacer la viscosidad impide el colapso espacial", entonces aplicamos la misma restricción de viscosidad al espacio semántico de los grandes modelos, para que sus representaciones no se aglomeren naturalmente.
Incorporar esta regla en el proceso de entrenamiento implica crear una función de penalización cuantificable, es decir, una regla de penalización que el modelo pueda calcular y entender cómo ajustar.
Luego, GeoLAN diseñó dos conjuntos de reglas de penalización calculables, convirtiendo las normas geométricas de la conjetura de Gauss en objetivos de entrenamiento. Uno se llama KT-CW, especializado en tratar el "agrupamiento semántico"; el otro se llama KT-Attn, especializado en tratar la "pereza de atención".
En pocas palabras, KT-CW consiste en muestrear aleatoriamente diversas direcciones en el espacio semántico durante el entrenamiento. Si se detecta que una dirección contiene demasiada información semántica, se penaliza al modelo. Esto obliga al modelo a distribuir uniformemente el conocimiento por todo el espacio de alta dimensión, aprovechando todas las dimensiones previamente subutilizadas y resolviendo así fundamentalmente el problema de la "aglomeración".
Otro conjunto, KT-Attn, trata específicamente el comportamiento de evasión de la atención. Al final del entrenamiento, los cabezales de atención de los grandes modelos tienden a caer en una homogeneización severa, donde muchos cabezales pasan todo el tiempo fijándose en la misma palabra y la misma posición, con muy pocos que realmente realizan trabajo útil. Esta regla impone obligatoriamente que cada cabezal de atención se enfoque en regiones semánticas completamente distintas, asegurando una cobertura multidireccional de la atención y erradicando por completo el colapso de rango en los cabezales de atención.
Al aplicar este conjunto de medidas, los efectos han sido inmediatos.
En Llama-3-8B, GeoLAN transformó deliberadamente el espacio de representación cónica originalmente comprimido en una esfera suave, reduciendo significativamente la superposición y mejorando considerablemente la uniformidad en todas las direcciones, manteniendo al mismo tiempo la precisión de la tarea.
En Gemma-3-4B, la precisión de MMLU aumentó de 0.59 a 0.60, un incremento de aproximadamente 0.75 puntos porcentuales. La estabilidad semántica en TruthfulQA mejoró significativamente.
En el Gemma-3-12B de mayor escala, la métrica de tasa de sesgo también experimentó una disminución estadísticamente significativa.
Lo más interesante es que el artículo también descubrió un fenómeno interesante llamado "zona de Goldilocks".
Es decir, distribuir uniformemente estas estrictas restricciones geométricas resulta en una catástrofe para modelos con demasiados parámetros pequeños; los modelos pequeños necesitan inherentemente recurrir a la entrelazamiento de conceptos para lograr una compresión semántica extrema, y forzar su dispersión solo empeorará por completo la estructura geométrica interna.
Para modelos gigantes demasiado grandes, el extenso proceso de preentrenamiento ya ha establecido espontáneamente una estructura de manifold extremadamente compleja; agregar este conjunto de reglas no solo resulta inadecuado, sino que también ralentizará el rendimiento general.
Solo los modelos de tamaño medio, como los de cuatro a och mil millones de parámetros, tienen justo suficiente capacidad para aprovechar los beneficios derivados de la distribución uniforme, logrando así los mejores resultados.
Además, el artículo deriva un teorema elegante llamado "Teorema de Pegajosidad Semántica": cuando las representaciones cumplen con la "regla de prevención de aglomeración", diferentes conceptos semánticos se descomponen automáticamente en subespacios aproximadamente mutuamente perpendiculares, que el artículo denomina visualmente "gránulos". Cada subespacio puede interpretarse y ajustarse de forma independiente, lo que significa que el problema de la caja negra que ha preocupado a la industria durante años se vuelve ahora transparente.
Un artículo de ACL llevó la conjetura de Kakeya directamente desde el reino de las matemáticas puras hasta la ingeniería de IA.
Ganador de la Medalla Fields, anunció su incorporación a OpenAI ese día
Otro punto destacable es que uno de los ganadores de la Medalla Fields, el destacado matemático Jacob Tsimerman, anunció el mismo día del premio que se unirá pronto a OpenAI para trabajar en seguridad de IA.

Esto hace que no se pueda dejar de notar la estrecha relación entre las matemáticas avanzadas y la IA.
Hace justo un año, coescribió con Andrew Critch, investigador de seguridad en IA de Berkeley, el artículo «A Taxonomy of Omnicidal Futures Involving Artificial Intelligence», construyendo un sistema de clasificación riguroso para las vías de riesgo de la IA con la máxima rigor matemático.
Él mismo es un gran beneficiario de la IA: en 2025, publicó cinco artículos matemáticos en arXiv y afirmó directamente que la IA duplicó su productividad investigadora.
Lo más dramático es que tres días antes del premio, alguien utilizó el reciente Claude Fable 5 de Anthropic para derribar en una noche la conjetura de Jacobi, suspendida durante 87 años, conmocionando a la comunidad matemática mundial. Esa persona era precisamente su estudiante, Levent Alpöge.
Ante la creciente aproximación e incluso superación de la “inteligencia” de los mejores matemáticos por parte de la IA, el eminente matemático Timothy declaró públicamente: es la primera vez en su vida que ve un modelo de lenguaje grande resolver con facilidad un problema centenario famoso en un campo completamente desconocido para él.
La relación entre las matemáticas y la IA ya ha trascendido el término "indisoluble"; están fusionándose a una velocidad asombrosa.
Repasando el historial de la IA en el campo de las matemáticas durante el último año: desde que AlphaProof de DeepMind ganó una medalla de plata en la Olimpiada Internacional de Matemáticas, hasta que el modelo de razonamiento de OpenAI resolvió la conjetura de la distancia unitaria de Erdős, un problema pendiente desde hace ochenta años; luego, GPT-5.6 resolvió la conjetura de la doble cobertura cíclica en solo una hora, y Claude Fable 5 derribó la conjetura de Jacoby en una sola noche. La IA ha establecido múltiples récords del siglo en solo dos meses, y la velocidad de resolución de problemas está aumentando exponencialmente.
En la entrevista de AMS, Jacob dijo francamente: “En el mundo de las matemáticas hay mucha autoconsolación: la gente observa que la IA ahora no es tan buena como los matemáticos y concluye que nunca lo será”. Él demostró con su práctica que, aunque las demostraciones del modelo son “incompletas e inexactas”, “generalmente pueden proporcionar un enfoque aproximadamente correcto que te lleva hasta el 80 % del camino”.
Incluso cree que dentro de dos años, la IA superará por completo a los humanos en la demostración matemática.
Entonces surge la pregunta: ¿habrá ganadores humanos para la Medalla Fields en 2030, dentro de cuatro años?
El Premio Fields tiene un límite de edad estricto: los ganadores deben tener menos de 40 años. Esto significa que si la IA supera sistemáticamente la capacidad de los matemáticos humanos para realizar descubrimientos originales en los próximos cuatro años, el comité evaluador enfrentará una situación sin precedentes: ¿estás otorgando el premio a la persona que realizó el mejor trabajo matemático, o al mejor matemático humano?
Más intrigante aún es la aceleración bidireccional entre las matemáticas y la IA. Justo después de que se demostrara la conjetura de Kakeya en tres dimensiones, tres meses después surgió GeoLAN, convirtiendo un logro puramente matemático directamente en una herramienta para entrenar grandes modelos. ¿Qué capacidades de IA surgirán mañana a partir de los avances en la conjetura de André-Oort y el sexto problema de Hilbert, reconocidos hoy con la Medalla Fields?
Antes se decía que los matemáticos iban adelante abriendo caminos, y la IA los seguía recogiendo tesoros. Pero ahora, el que recogía los tesoros ya ha comenzado a abrir sus propios caminos.
