Huawei presentó cuatro artículos en IJCAI 2026, mostrando la tendencia tecnológica del AI de pasar de "densidad de escala" a "densidad de diseño".Autor y fuente del artículo: Leifengwang

La inteligencia artificial se dirige hacia escenarios reales; la capacidad de ingeniería sistemática es tanto un cuello de botella como una oportunidad de ruptura.
IJCAI-ECAI 2026 se llevará a cabo del 15 al 21 de agosto de 2026 en Bremen, Alemania. Como la conferencia integral de mayor nivel en el campo de la IA, IJCAI ha sido tradicionalmente el examen clave para evaluar los avances de vanguardia de las principales empresas durante el año pasado: quién ha logrado progresos reales en qué dirección y qué líneas tecnológicas están generando consenso; los artículos son la respuesta más directa.
En el momento de la conferencia, AI Science Review también está escaneando sistemáticamente los artículos aceptados en esta conferencia principal para identificar tendencias tecnológicas y direcciones de la industria.
Una tendencia clara es que el costo de la potencia de cómputo de IA sigue siendo elevado, y los rendimientos marginales derivados del aumento del tamaño de los parámetros ya no logran acompanar los costos marginales. Esta realidad económica está redefiniendo la lógica de la innovación tecnológica: de “¿puedemos hacerlo más grande?” a “¿puedemos usarlo de manera más eficiente?”.
Cuatro artículos de Huawei aceptados en IJCAI 2026 proporcionan una ruta técnica para este giro: utilizar diseños de arquitectura más sofisticados y estrategias de entrenamiento para contrarrestar la escasez de datos y obtener una mayor producción de inteligencia por unidad de capacidad de cómputo.
Este cambio de orientación tecnológica también refleja los cambios profundos en la implementación de la IA: cuando la tecnología sale del laboratorio, la competencia ya no se trata de un avance puntual en una sola capacidad, sino de la coordinación sistemática entre precisión, generalización, datos y poder de cómputo: cada etapa puede convertirse en un cuello de botella, pero también en una oportunidad de ruptura.
Los cuatro artículos siguientes, precisamente desde estas cuatro direcciones, muestran la capacidad de ingeniería sistemática y las decisiones tecnológicas de Huawei.
01 Breaking the Scale Barrier: Architecture + Training, Redefining the Capability Limits of Hierarchical ViT
En la carrera de escalado de modelos visuales base, siempre ha existido un "techo" invisible. Los ViT convencionales han avanzado sin cesar en escalado, superando constantemente los límites desde 6B hasta 22B. Sin embargo, los ViT jerárquicos siempre se han estancado por debajo de los 2B parámetros. No es que no quieran hacerlos más grandes, es que no pueden hacerlos más grandes. Los modelos jerárquicos requieren mucho más en términos de datos y estrategias de entrenamiento que los ViT convencionales; aplicar directamente las soluciones de escalado de ViT convencionales no funciona. Esto genera una contradicción estructural: los ViT jerárquicos son inherentemente excelentes en representaciones multiescala y tareas de predicción densa (detección de objetos, segmentación, comprensión de video), pero al no poder escalar su tamaño, su capacidad máxima queda bloqueada.
El artículo del equipo de Huawei, «Distilling and Scaling Hierarchical Vision Transformer to 30B Parameters», eleva el límite de escala de 2B a 30B directamente.

¿Cómo se logra? La respuesta es rediseñar tanto la estructura del modelo como la estrategia de entrenamiento; ambos son indispensables.
El diseño central estructural es la arquitectura Efficient Hierarchical ViT, que garantiza la capacidad de extracción de características multiescala mientras mantiene la eficiencia computacional.
Basado en esta arquitectura, el equipo entrenó modelos densos con 200M a 5B parámetros e introdujo una variante de mezcla de expertos dispersos (SMoE), llevando el número total de parámetros a 30B, el tamaño de parámetros más grande públicamente conocido en el campo de ViT jerárquico hasta la fecha.
En cuanto al entrenamiento, el equipo diseñó un proceso de dos fases:
En la primera fase, se realiza una preentrenación auto-supervisada MAE en ImageNet-21K para que el modelo aprenda las leyes básicas de la representación visual;
En la segunda fase, se logra un salto en capacidades mediante la destilación de conocimiento desde múltiples modelos base generales de vanguardia sobre un conjunto de datos de 27 millones de imágenes.
Los resultados experimentales proporcionan la prueba más contundente. En la evaluación lineal de ImageNet-1K, el modelo MoE con 30B parámetros totales (EHV-5B-MoE) activa solo 6.7B parámetros durante la inferencia y logra una precisión del 89.0%, superando a modelos bajo la arquitectura ViT convencional con un número total de parámetros mayor, como EVA-CLIP-18B. Más importante aún, su mejora de rendimiento no se limita a la clasificación de imágenes: también destaca en tareas de análisis de video y predicción densa. Esto demuestra que EHV aprende no solo características de clasificación, sino representaciones visuales de alta calidad y verdaderamente generalizables.
El equipo de Huawei demostró con este trabajo que los ViT jerárquicos no solo pueden escalarse, sino que también pueden lograr mayor precisión con menos parámetros de activación en la inferencia. El diseño de la arquitectura determina el límite de capacidad del modelo, mientras que la estrategia de entrenamiento determina en qué medida se puede liberar este límite.
02 Input preprocessing: Paradigm shift in the learnable frame selector
El techo de la base del modelo se ha elevado, pero el consumo de capacidad de cómputo no solo se produce en el modelo en sí, sino también en los datos alimentados al modelo, que consumen enormes recursos de cómputo. Al procesar videos, los modelos de lenguaje visual (Video-LLMs) consumen principalmente recursos de cómputo en la codificación de fotogramas. Para controlar los costos, los modelos actuales casi todos utilizan muestreo uniforme: extracción de fotogramas a intervalos iguales.
Sin embargo, los eventos clave en el video nunca se distribuyen uniformemente. Un movimiento importante puede durar solo uno o dos segundos, y si cae justo entre dos puntos de muestreo, se pierde por completo. Por el contrario, esas escenas estáticas prolongadas se codifican repetidamente, desperdiciando recursos computacionales valiosos.
Otro enfoque es el método impulsado por consultas: recuperar fotogramas relevantes según una pregunta específica. Esto es efectivo en escenarios de preguntas y respuestas de video, pero la descripción detallada de video es una tarea "sin consulta", donde este método no es aplicable.
La muestreo uniforme es demasiado grosero, y los métodos impulsados por consultas no son aplicables. ¿Cómo resolverlo? El selector de fotogramas aprendible LFS (Learnable Frame Selector), propuesto por el equipo de datos de IA de Huawei, intenta abordar este problema.
Dirección del artículo: https://arxiv.org/pdf/2601.14594v1
Su idea central es muy directa: en lugar de depender de reglas manuales para seleccionar fotogramas, dejemos que el modelo aprenda por sí mismo "qué mirar".

Este es un paradigma de entrenamiento "del final al principio"; LFS ya no aprende "qué frames obtener una puntuación más alta en un punto intermedio", sino que aprende "qué frames permiten que el modelo grande genere una descripción mejor". ¿Cómo se hace exactamente? Tres diseños clave:
Primero, entrena una red de puntuación para asignar a cada fotograma una puntuación de "importancia del evento".

En segundo lugar, selección de fotogramas por segmentos en lugar de ordenación global. Al seleccionar fotogramas, no se utilizan simplemente los “K fotogramas con la puntuación más alta”, sino que se divide todo el video en varios intervalos de tiempo y se eligen los fotogramas más importantes en cada intervalo. Así se capturan los eventos clave y se garantiza una distribución uniforme de los fotogramas en la línea de tiempo.
Tercero, y el paso más crucial: el método de entrenamiento. Después de que LFS seleccione los fotogramas, los alimenta al Video-LLM congelado para generar descripciones, compara esas descripciones generadas con las descripciones estándar anotadas manualmente, calcula la pérdida y realiza la retropropagación para actualizar los parámetros del selector de fotogramas. Durante todo este proceso, el modelo de lenguaje grande permanece inalterado; LFS actúa como un módulo externo plug-and-play.
Además, el equipo de investigación descubrió una brecha significativa entre los conjuntos de referencia existentes de descripciones detalladas de videos y el reconocimiento humano real. Por lo tanto, desarrollaron un nuevo conjunto de referencia, ICH-CC, cuyos videos provienen completamente de escenarios comerciales reales de cocina del patrimonio cultural inmaterial chino (como cocinas de restaurantes o lecciones de cocina), y todas las descripciones y preguntas fueron redactadas cuidadosamente por humanos, acercándose más a aplicaciones del mundo real.

¿Cómo han sido los resultados del experimento?

LFS proporciona mejoras generales y estables en diversos modelos y benchmarks. Todas las versiones mejoradas con LFS superan a los modelos base en todos los benchmarks de prueba, lo que demuestra que LFS no solo logra buenos resultados en un solo benchmark, sino que también posee cierta generalidad.
Esto también responde a la proposición central del artículo: en lugar de hacer que el modelo calcule de forma rígida sobre fotogramas muestreados uniformemente, es mejor realizar una selección inteligente en la entrada: al elegir los fotogramas correctos, el rendimiento de las tareas posteriores también mejora.

03 Task Adaptation: Characterizing Modular Intervention Instead of Full Model Fine-Tuning
La capacidad de generalización cruzada de los modelos de lenguaje grande siempre ha sido un problema que “suena importante en teoría, pero es difícil de implementar”. Las soluciones dominantes actuales utilizan enrutamiento dinámico por token: cada token debe elegir entre múltiples adaptadores LoRA durante su procesamiento, decidiendo qué camino seguir. Este mecanismo es efectivo, pero tiene un costo considerable: el consumo de cálculo y memoria gráfica permanece elevado, haciendo que el modelo sea lento y exigente con la memoria GPU.
Otro enfoque, el ajuste por representación (ReFT), no modifica los parámetros del modelo, sino que solo edita las representaciones de los tokens de prefijo y sufijo para lograr la adaptación a una sola tarea, siendo mucho más eficiente que LoRA. Sin embargo, tiene dos limitaciones: primero, los propios tokens tienen ambigüedad semántica, por lo que modificar solo los extremos no es lo suficientemente preciso; segundo, carece de un mecanismo de "autoguiado", por lo que cuando el modelo se enfrenta a una tarea nueva que no ha visto antes, no sabe qué capa modificar ni qué representación ajustar.
El equipo de Huawei Cloud, en colaboración con varias universidades, propuso el marco RaMod (Modularidad consciente de la representación), extendiendo con éxito la idea de ReFT a escenarios de generalización entre tareas.

La práctica principal se puede dividir en dos partes:
La primera parte es la representación de módulos dobles y el ajuste fino de parámetros. ReFT solo puede modificar los extremos, mientras que RaMod es mucho más fino: selecciona un subconjunto filtrado por una estrategia desde las representaciones ocultas de las capas intermedias para realizar intervenciones modularizadas. Dónde y cómo modificar se hace de forma selectiva y estratégica. Esto permite guiar con mayor precisión al modelo para resolver tareas que no ha visto antes.
La segunda parte es el programador asíncrono. Lo que más teme la generalización entre tareas es la falta de memoria VRAM; RaMod diseñó un mecanismo de programación activa: asigna memoria VRAM solo según las intervenciones necesarias y la libera activamente una vez utilizada. Así, el overhead de almacenamiento se reduce al mínimo.
Los efectos son inmediatos. Los experimentos demuestran que RaMod no solo tiene un mejor rendimiento de generalización entre tareas, sino que también reduce significativamente los costos: en comparación con los LLMs originales, este método reduce el tiempo de prellenado adicional en un 83%, disminuye la latencia de generación en un 100% y reduce el uso de memoria GPU en un 79%.
En otras palabras, RaMod transformó la adaptación de tareas de “modificar el modelo” a “ajustar las representaciones”: mantiene intacta la estructura principal del modelo y solo realiza ediciones puntuales en los estados ocultos de capas clave. Si esta aproximación es válida, la economía del despliegue de modelos grandes podría reescribirse: un modelo base acompañado de varios módulos de intervención ligeros podría servir escenarios de tarea completamente distintos a bajo costo, sin necesidad de entrenar o cargar una copia completa por cada escenario.
Sin embargo, antes de la “reescritura”, este método de ajuste de representación aún plantea preguntas clave, como si, en escenarios de alta dificultad como el razonamiento complejo, sigue siendo capaz de mantener la precisión mientras se reduce significativamente el costo de cálculo.
04 Rompiendo los datos: expertos en idiomas con roles específicos, entrenamiento progresivo paso a paso
Las tres primeras ponencias abordan cómo utilizar los modelos de manera más eficiente. Pero muchos problemas también enfrentan un desafío real más fundamental: ¿y si ni siquiera hay suficientes datos de entrenamiento?
La tarea de traducción de voz con cambio de código (Code-Switching, CS) requiere traducir voz que mezcla varios idiomas a un idioma objetivo. Esta tarea no solo es compleja en la modelización semántica, sino que la escasez de datos de CS es un problema aún mayor.
Estudios anteriores se basaban principalmente en dos enfoques: bien hacer que el modelo descubriera por sí mismo la representación semántica, con resultados impredecibles; bien invertir grandes cantidades de dinero en anotación manual, lo que resultaba demasiado costoso y limitaba la escala.
El equipo del Centro de Servicios de Traducción de Huawei, en colaboración con la Universidad de Xiamen y la Universidad de Macao, propone en este artículo una nueva aproximación: en lugar de dejar que el modelo descubra por sí mismo las representaciones semánticas en diferentes idiomas, se sugiere alinearlas activamente: crear un “equipo de expertos” independiente para cada idioma, encargado de modelar la semántica de su propio idioma, y luego alinearlos uniformemente.

Dirección del artículo: https://arxiv.org/pdf/2511.10670
Hay dos diseños clave en la implementación específica:
El primero es el proyector de voz MoE (Mixture of Experts). Los proyectores tradicionales tratan todos los idiomas por igual, por lo que su rendimiento no es óptimo. La versión MoE asigna un conjunto especializado de “expertos” a cada idioma, donde cada grupo de expertos se encarga únicamente de modelar las características de voz finas de un idioma específico. El mecanismo de enrutamiento envía automáticamente las características de voz al grupo de expertos correspondiente al idioma.

Para garantizar que la ruta no se desvíe, el artículo también introduce dos pérdidas auxiliares: la pérdida específica del idioma asegura que cada experto aprenda realmente las características del idioma correspondiente, y la pérdida de equilibrio de carga dentro del grupo evita que todos los tokens se acumulen en un solo experto.
El segundo es un paradigma de entrenamiento en múltiples etapas. Si los datos son insuficientes, se compensa con estrategias. Todo el entrenamiento se divide en cuatro pasos: primero, se preentrena por separado el proyector de cada idioma con datos de reconocimiento automático de voz (ASR) para establecer una base de alineación voz-texto; luego, se ensamblan los proyectores de cada idioma en una estructura MoE y se optimizan conjuntamente con pérdidas específicas del idioma y pérdida de equilibrio de carga; a continuación, se transita gradualmente de los datos de ASR a los datos de traducción automática de voz monolingüe (ST), utilizando una pérdida de transición para suavizar la migración; finalmente, se adapta desde los datos de ST a los datos de traducción automática de voz cruzada (CS).
La sutileza de este diseño progresivo radica en que no se pide al modelo que aborde directamente los escasos datos de CS, sino que primero fortalezca sus capacidades básicas con abundantes datos de ASR y ST, y luego avance gradualmente hacia la tarea objetivo.

Se compararon varios modelos base sólidos, incluidos Whisper, SeamlessM4T y LLaST. En los cuatro conjuntos de prueba de Fisher y NTUML2021, el método superó a SeamlessM4T, el mejor rendimiento entre los otros modelos, alcanzando un BLEU máximo de 39.52 y un COMET máximo de 81.33.
La señal que transmite este trabajo es clara: en escenarios interlingüísticos con escasos datos, un diseño arquitectónico detallado y estrategias de entrenamiento progresivas pueden ser más efectivas que simplemente aumentar la cantidad de datos.
Es importante tener en cuenta que esta solución es efectiva como "arma clave" en escenarios con un número limitado de idiomas y calidad de datos controlable, pero su escalabilidad en un sistema de traducción multilingüe general que requiera cubrir decenas de idiomas aún necesita ser demostrada.
05 Cierre: Cambiar la densidad de diseño por el costo de cálculo
30B ViT jerárquico reestructuró la arquitectura del modelo, permitiendo que 6.7 mil millones de parámetros activos superaran a su competidor de 18 mil millones en ImageNet;
LFS realiza una resta en la entrada, bloqueando antes del cálculo un gran volumen de sobrecarga de codificación de fotogramas sin sentido;
RaMod comprime el ajuste completo en una edición puntual de la capa de representación, reduciendo simultáneamente el uso de memoria y la latencia en la adaptación entre tareas;
La traducción de voz con cambio de código utiliza un enfoque MoE y entrenamiento progresivo, demostrando en la categoría con menos datos que la inteligencia arquitectónica a veces puede compensar la escasez de datos.
Cuatro artículos, cuatro direcciones, todos apuntan al mismo núcleo: Huawei está reemplazando la “densidad de escala” con la “densidad de diseño”. Los cuatro artículos provienen de investigación básica, datos de IA, servicios en la nube y el centro de traducción, lo que demuestra que la prioridad de eficiencia ya no es solo una preferencia de un equipo, sino que este enfoque se ha integrado en las decisiones tecnológicas de cada etapa.
Si comparar la competencia de IA de los últimos dos años con una “carrera de minería”, entonces 2026 está mostrando un punto de inflexión: ha comenzado la era de la competencia por las “tecnologías de refinación”. Activación dispersa, filtrado inteligente, adaptación modular, entrenamiento progresivo: estas vías no dependen de más chips y potencia de cómputo, sino de una comprensión más profunda del problema mismo.
Tanto las grandes empresas como las startups ya han superado la carrera de armamentos de parámetros; en la segunda mitad de la IA, el verdadero punto decisivo es la comprensión de los problemas de implementación práctica y la capacidad de ingeniería para resolverlos de manera sistemática.
