En 2012, AlexNet puso fin a una era con una victoria abrumadora. Antes de eso, el reconocimiento de imágenes dependía de que los humanos diseñaran manualmente procesos de extracción de características en capas; AlexNet demostró algo que luego se verificó repetidamente: confiar todo el proceso de extremo a extremo al modelo para que lo aprenda por sí mismo casi siempre supera a las tuberías en etapas cuidadosamente diseñadas por humanos.
Desde la clasificación de imágenes hasta la detección de objetos y luego la segmentación de imágenes, detrás de cada salto del aprendizaje profundo hay siempre la misma frase: déjalo aprenderlo todo de una vez.
Solo hay un área que siempre es la excepción: los modelos generativos.
El modelo generativo más potente y escalable de hoy, ya sea autoregresivo o de difusión, no es end-to-end.
Durante el entrenamiento, solo aprenden a predecir «un pequeño paso», pero durante la inferencia, deben repetir este paso cientos o miles de veces, como una red recurrente.
Los métodos de muestreo utilizados para entrenamiento e inferencia no son los mismos. Esta brecha revivió un problema clásico: el error en cada paso se alimenta al siguiente, haciendo que la entrada se desvíe gradualmente de la distribución vista durante el entrenamiento, acumulando errores capa tras capa. En la literatura académica, esto se conoce como «sesgo de exposición» (exposure bias).
En otras palabras, la experiencia más fundamental del aprendizaje profundo, «extremo a extremo es mejor», no ha logrado aplicarse realmente a los modelos generativos en los últimos quince años.
Y justo recientemente, un artículo de la UIUC y la Universidad de Harvard intentó completar este último rompecabezas.

El autor bautizó este nuevo paradigma como Explorative Modeling (modelado explorativo), con el acrónimo XM. Su idea es tan sencilla que casi resulta ingenua, pero apunta a una conclusión audaz: además de los parámetros y los datos, los modelos generativos tienen un tercer eje que puede ampliarse.

Sitio web del proyecto: https://explorative-modeling.github.io
Dirección del artículo: https://arxiv.org/abs/2607.27372
Repositorio de código: https://github.com/alexiglad/XM
La raíz del problema: el modelo solo «promedia»
Para entender qué resuelve este artículo, primero hay que entender por qué es difícil la generación.
En el aprendizaje supervisado común (como la clasificación), cada entrada tiene básicamente una sola respuesta correcta, por lo que el modelo solo necesita aprender un mapeo determinista.
Pero la generación es diferente. Cuando le pides al modelo que "genere un perro", la respuesta correcta podría incluso tener infinitas posibilidades. Estas salidas válidas son los distintos modos dentro de la distribución de datos (es decir, los picos independientes de la distribución). Generar es difícil precisamente porque hay que capturar simultáneamente todos estos modos.
El problema radica en que los modelos generativos principales se entrenan utilizando pérdida de reconstrucción (por ejemplo, error cuadrático). Cuando una entrada se empareja aleatoriamente con múltiples objetivos válidos distintos, la solución óptima que puede ofrecer la pérdida de reconstrucción es el promedio de estos objetivos. Y para la mayoría de los datos, este promedio no se encuentra sobre la variedad de datos, sino en el espacio intermedio entre varios modos, pareciéndose a ninguno.
La figura en el artículo es muy intuitiva: si se entrena al modelo para regresar directamente de extremo a extremo sin ninguna técnica, predecirá un solo punto en el centro para tres nubes de puntos, convertirá una foto de un perro en una mancha borrosa y una frase se degradará en la repetición infinita de «the». Esto es lo que se conoce como «mode blurring» (borrado de modo), es decir, la solución óptima es precisamente la que menos se parece a los datos reales.

¿Cómo evitan esto los modelos actuales? La respuesta es descomponer el acto de «generación». La generación autoregresiva predice un solo elemento a la vez, la difusión elimina solo un poco de ruido a la vez, y cada pequeño paso tiene su objetivo reducido casi hasta un solo modo, por lo que la pérdida de reconstrucción ya no promedia.
Este proceso de "generación por división" es precisamente lo que permite a la difusión y la autoregresión generar muestras de alta calidad, pero también es lo que impide que el modelo sea end-to-end.
El autor plantea entonces una pregunta clave: un modelo generativo solo tiene dos cosas que descomponer: cómo se genera y cómo se entrena.
Si dividir la generación destruye el extremo a extremo, ¿por qué no dividir el entrenamiento?

Un bucle for: el núcleo completo del modelado exploratorio
Explorative Modeling descompone el propio ciclo de entrenamiento.
Su mecanismo se puede explicar en una frase: en cada paso de entrenamiento, el modelo ya no genera solo una muestra para forzar el objetivo, sino que genera K candidatos y selecciona solo aquel más cercano a los datos reales para entrenar y retropropagar el gradiente. El artículo lo implementa como un bucle for de 3 a 5 líneas, tan simple que resulta sospechoso (Algoritmo 1).

¿Por qué hacer esto resuelve la ambigüedad del modo?
Cambia el escenario de la vida cotidiana: adivinar dónde caerán los dardos. Si solo te permiten hacer una sola suposición, tu estrategia óptima sería adivinar la posición promedio de todos los dardos, pero ese punto suele estar en un lugar del tablero donde casi no hay dardos clavados. Sin embargo, si se te permite hacer K suposiciones y solo se puntúa la más cercana, la estrategia óptima cambia inmediatamente: distribuirás tus K intentos para que cada uno cubra un grupo diferente de puntos de impacto.

Lo mismo ocurre con el modelo. Cuando se le permite explorar K candidatos, diferentes ruidos de entrada «reclaman» cada uno un modo distinto, en lugar de concentrarse todos en el promedio central. Cuántas exploraciones se realicen, tantos modos podrá capturar con seguridad el modelo.

El autor le dio un nombre a esta capacidad largamente ignorada: expresividad generativa, y señaló que está determinada por el propio objetivo de entrenamiento, independientemente de cuántos parámetros y datos se acumulen, no aumentará por sí sola.

Esto también explica un fenómeno extraño que la industria ha observado durante mucho tiempo: ¿por qué los mejores modelos de hoy dependen tanto de la técnica de «guía» (guidance)?
Lo que se denomina clasificador-free guidance es esencialmente empujar la predicción «lejos» de ese valor promedio borroso. Pero si el modelo en sí no es borroso, ¿por qué empujarlo? La guía es útil precisamente debido a la enfermedad dejada por la ambigüedad del modo.
El artículo también presenta dos direcciones de exploración: Forward y Reverse. La primera fija un objetivo real y busca el más cercano dentro de sus propias generaciones, inclinándose hacia la «completitud» (cubrir todos los modos); la segunda fija una generación y busca el más cercano en los datos reales, inclinándose hacia la «precisión», sin aumentar casi ningún costo computacional, aunque con el riesgo de colapsar en pocos modos. Ambas son complementarias y pueden combinarse.


Tercer eje: cuanto más amplíes, mayores serán los rendimientos
La conclusión más significativa de este artículo es haber validado la "exploración" como un eje real de escalabilidad.
El autor aplica la exploración a modelos de difusión/flujos, modelos Jumpy e incluso modelos de lenguaje de difusión con máscara, observando consistentemente mejoras monotónicas en el rendimiento en tres modalidades: imágenes, video y lenguaje. Más importante aún, la tendencia de los beneficios con respecto al tamaño: cuanto más se escala, más intensos son los beneficios.
Los números proporcionados en el artículo son: a medida que aumenta el tamaño de los datos, el beneficio derivado de la exploración sube del 7% al 36%; a medida que crece el modelo, aumenta del 13% al 23%; cuando la capacidad de cómputo se triplica, el beneficio de eficiencia se duplica más que duplica.
En términos de eficiencia, se logró un aumento de 4.1 veces en la eficiencia de FLOP, 6.2 veces en la eficiencia de muestras y un 47% en la eficiencia de parámetros. En generación de imágenes, elevó aún más la mejor receta actual de RAE hasta alcanzar un FID de 1.43 sin guía en ImageNet, acercándose al nivel más alto de la industria.

Un modelo Large que explora 5 modos, incluso supera a un modelo XLarge con un 47% más de parámetros pero que no realiza exploración.

El significado de esta tendencia no es pequeño. La explicación del autor es: en escalas pequeñas, el modelo está principalmente limitado por los parámetros y los datos, y la expresividad generativa aún no es un cuello de botella; pero una vez que los parámetros y los datos se amplían hasta el punto de «ya no ser una limitación», la expresividad generativa se convierte cada vez más en el verdadero cuello de botella. Y precisamente es lo que se explora para ampliar directamente.
Dado que el cálculo utilizado en el entrenamiento de modelos base reales hoy en día es aproximadamente cuatro órdenes de magnitud mayor que el experimento más grande de este artículo, los autores consideran que los números reportados en el artículo probablemente sean solo un límite inferior de los rendimientos en escalas más grandes.
Verdadero generativo de extremo a extremo
¿Qué sucede si se lleva la exploración al límite? La respuesta vuelve al misterio inicial: los modelos generativos finalmente pueden ser end-to-end.
El autor trata a XM como un modelo end-to-end independiente y lo aplica a tareas de control de robots. En imitación de comportamiento (Behavior Cloning), su política exploratoria logra igualar e incluso superar el desempeño de la política de difusión, que requiere 100 pasos hacia adelante, con solo un único paso hacia adelante de la red. En modelado del mundo orientado a objetivos, el modelo del mundo exploratorio logra un mejor rendimiento promedio utilizando entre 16 y 256 veces menos potencia de inferencia que el Diffuser.


La fuente de esta brecha es clara: los modelos de difusión intercambian expresividad por la generación en cientos de pasos durante la inferencia, mientras que XM de extremo a extremo traslada este costo a la exploración durante el entrenamiento, permitiendo que la inferencia requiera solo una pasada hacia adelante. Manejar múltiples modos es exactamente lo mismo: ya sea descomponerlo lentamente durante la inferencia o explorarlo completamente en una sola vez durante el entrenamiento; este artículo eligió lo segundo.
Presentación del autor
El primer autor de este artículo, Alexi Gladstone, no es desconocido. En julio de 2025, su trabajo sobre Energy-Based Transformers (EBT) generó una considerable discusión en las redes sociales.

Ese trabajo afirma haber superado por primera vez la curva de escalado del Transformer feedforward estándar en múltiples dimensiones, y busca extender el «pensamiento del Sistema 2» a cualquier modo. Consulte el informe de MachineHeart: «¡Llega un nuevo paradigma! El nuevo modelo de energía rompe el límite de escalado de Transformer++, con una tasa de escalado de entrenamiento un 35% más rápida».

El modelado explorativo es coherente con su enfoque habitual: ambos cuestionan si los modelos pueden lograr cosas que una sola inferencia hacia adelante no puede hacer, mediante algún tipo de búsqueda o exploración. Este artículo se basa además en otra teoría desarrollada por él y sus colaboradores (Yilun Du y Heng Ji): Mode Forcing. En el artículo se reconoce abiertamente que, debido a la existencia previa de esa teoría, la mayoría de los resultados de XM fueron primero predichos teóricamente y luego verificados experimentalmente, lo cual es poco común en el ámbito del aprendizaje profundo, donde es habitual "correr los experimentos primero y luego explicarlos".

El autor también reconoce honestamente las limitaciones: la idea de best-of-K en sí misma no es nueva, ya se ha hecho muchas veces antes; su verdadera contribución fue comprender claramente qué hace exactamente este simple bucle: amplifica directamente la expresividad de la generación sin dividir el proceso de generación.
Además, los modelos de lenguaje autoregresivos aún siguen siendo el mayor desafío, y Forward XM puramente de extremo a extremo sigue siendo demasiado costoso en distribuciones extremadamente multimodales (como la generación de imágenes), lo cual se deja para trabajos futuros.
Durante más de una década, nos hemos acostumbrado a ajustar los modelos generativos con dos controles: hacerlos más grandes y alimentarlos con más datos.
El tercer ajuste propuesto en este artículo es bastante sencillo: hacer que el modelo realice varias predicciones y conservar solo la mejor. Pero si la tendencia que revela es válida, entonces a medida que la escala siga creciendo, los dos primeros ajustes eventualmente alcanzarán su límite, mientras que el tercero apenas está comenzando a girar.
Enlace de referencia
https://x.com/AlexiGlad/status/2083230922196107288
Este artículo proviene del canal de WeChat "Machine Heart" (ID: almosthuman2014), autor: Panda
