Ant Group publica cuatro artículos en IJCAI 2026 sobre la adaptabilidad de la IA en entornos dinámicos

iconMetaEra
Compartir
AI summary iconResumen
Ant Group lanzó cuatro artículos de IA + cripto en IJCAI 2026, centrándose en la adaptabilidad de la IA en entornos dinámicos. La investigación abarca agrupamiento de series temporales dinámicas, mezcla de datos de aprendizaje por refuerzo, optimización bayesiana de alta dimensión y evaluación de calidad de video. Estos estudios buscan resolver desplazamientos de distribución, eficiencia computacional y ecosistemas de AIGC en evolución. Plataformas de noticias on-chain como MetaEra destacaron la profundidad técnica y la relevancia práctica del trabajo.
Ant Group presenta cuatro artículos en IJCAI 2026, explorando sistemáticamente la capacidad de adaptación de la IA en entornos dinámicos.

Autor y fuente del artículo: Leifeng.com

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Incluso el algoritmo más inteligente debe finalmente probarse en un entorno dinámico.

IJCAI-ECAI 2026 se llevará a cabo del 15 al 21 de agosto de 2026 en Bremen, Alemania. En coincidencia con la conferencia, AI Technology Review está escaneando sistemáticamente los artículos aceptados en esta conferencia de élite para identificar tendencias tecnológicas y direcciones industriales.

En华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」, observamos la moderación de las grandes empresas en la competencia de parámetros y la búsqueda de eficiencia en el cálculo.

Las cuatro ponencias seleccionadas de Ant Group apuntan a una línea tecnológica igualmente importante pero con un camino completamente distinto: una exploración sistemática de la capacidad de adaptación a entornos dinámicos.

La precisión del modelo algorítmico sigue rompiendo récords en el laboratorio, pero una vez implementado en el mundo real, la caída en el rendimiento se convierte casi en una norma. La razón es sencilla: el mundo real nunca está estático.

Los escenarios de negocio de Ant Group llevan este "no estacionario" al extremo: más de 1.000 millones de usuarios, más de 8.000 servicios diferentes, donde los picos de pagos y los valles nocturnos pueden diferir en varios órdenes de magnitud; los modelos de control de riesgos deben responder en horas a las iteraciones de las estrategias del crimen cibernético, y la implementación global debe adaptarse a las infraestructuras financieras radicalmente distintas de cada país.

En este entorno, los modelos estáticos de “entrenar una vez, desplegar para siempre” están destinados a caer en la trampa de “buscar la espada marcada en el bote”.

Por eso, la verdadera inteligencia radica en si los algoritmos pueden percibir los cambios en el entorno, ajustar proactivamente sus estrategias y buscar soluciones óptimas en un contexto dinámico. Estos cuatro artículos del Grupo Ant Financial responden, de manera coincidente, a esta pregunta central: ¿cómo hacer que la IA evolucione de un “solucionador estático” a un “adaptador dinámico”?

01 MSRGC-Net: Hacer que la agrupación de series temporales sea "adaptativa" a la distribución de densidad de datos

La agrupación de series temporales consiste en clasificar automáticamente grandes cantidades de secuencias de comportamiento; es una herramienta fundamental para comprender patrones de comportamiento y monitorear señales anómalas.

Pero los métodos actuales tienen cada uno su propia incomodidad:

  • Métodos de similitud (como k-Shape): pueden captar patrones locales, pero deben calcular la distancia entre todos los pares de muestras, lo que se vuelve inviable con grandes volúmenes de datos;
  • Métodos de aprendizaje profundo (como autocodificadores): capacidad de representación potente, pero entrenamiento costoso, ajuste de hiperparámetros complicado y alto consumo de poder computacional;
  • Extracción de características tradicional: depende de características diseñadas manualmente, y la información dinámica temporal clave puede perderse.

El problema mayor es que la distribución de densidad de los datos temporales en la realidad es extremadamente desigual: los datos de transacciones del 11 de noviembre son densos como una tormenta, mientras que los datos de la madrugada son escasos como gotas, pero los métodos tradicionales requieren que le indiques de antemano en cuántas categorías dividirlos, lo cual ya está desalineado con la realidad.

MSRGC-Net, propuesto por Ant Group en colaboración con la Universidad de Ciencia y Tecnología de Chongqing, utiliza un conjunto de estrategias "sin entrenamiento" para evitar la dilema entre precisión y eficiencia computacional.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Dirección del artículo: https://arxiv.org/pdf/2606.12077v1

▎Su lógica central se puede desglosar en tres pasos:

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Paso 1: Codificación de reserva de múltiples escalas (extracción de características). Utilice múltiples redes de estado de eco (ESN) sin entrenar como unidades básicas de cálculo de reserva; solo ajustando el radio espectral, se pueden extraer simultáneamente fluctuaciones locales y tendencias a largo plazo desde la serie temporal original. Tras agrupar todas las muestras, se forma la matriz de características de vista, que sirve como entrada para las etapas posteriores.

Paso dos: construcción del gráfico de anclaje de las "bolas granulares" (modelado estructural), que es la parte más ingeniosa. El algoritmo ya no se enfoca en puntos de datos individuales, sino que divide automáticamente las "bolas granulares" según la densidad local de los datos: las regiones de alta densidad forman pequeñas y numerosas bolas, mientras que las regiones de baja densidad forman grandes y pocas bolas. La escala de datos se reduce de N a M (número de bolas, M < N), y al mismo tiempo se suprime la interferencia de ruido.

Paso 3: Optimización de gráficos multiescala basada en consenso. Los gráficos anclados entre escalas se fusionan mediante una estrategia de consenso, permitiendo que el modelo capture patrones locales microscópicos y tendencias globales macroscópicas, generando finalmente resultados de agrupamiento robustos que no requieren especificar manualmente el número de clústeres.

¿Qué tan efectiva es esta estrategia?

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

En 5 conjuntos de datos de referencia multivariados y 15 métricas de evaluación (NMI, ARI, RI con 5 cada una), MSRGC-Net obtuvo 12 primeros lugares y 2 segundos lugares: una tasa del 80 % de primeros lugares.

Más importante aún, evita el cálculo por pares O(n²) y logra una complejidad casi lineal. En otras palabras: es rápido y preciso, y no necesitas adivinar en cuántas categorías dividirlo.

En los escenarios reales de negocio de Ant, esto significa que el sistema puede ajustar automáticamente la granularidad del agrupamiento según la densidad del tráfico: durante los picos, realiza segmentaciones detalladas para detectar anomalías; durante los valles, utiliza una granularidad más gruesa para ahorrar recursos computacionales, siempre siguiendo los datos.

02 Hacer que la estrategia de mezcla de datos adaptativa del aprendizaje por refuerzo de fuera de línea a en línea

El aprendizaje por refuerzo tiene un famoso problema de "incompatibilidad ambiental": el "desplazamiento de distribución". Un modelo entrenado con datos offline tiende a "olvidar" fácilmente al ponerse en línea, ya que existe una diferencia de distribución entre los datos offline y los datos de interacción en línea, lo que provoca que la estrategia en línea olvide rápidamente el conocimiento adquirido offline.

Las soluciones actuales se reducen a dos: bien fijar una proporción mixta del 50% fuera de línea y 50% en línea, bien utilizar reglas heurísticas para priorizar la muestra de muestras "cerca de la política".

Pero el problema es que las necesidades de la estrategia son completamente diferentes en cada fase: en las etapas iniciales se requieren más datos fuera de línea para consolidar la base, mientras que en las etapas posteriores se necesitan más datos en línea para explorar nuevas posibilidades. Una estrategia fija es como tallar una marca en el bote para buscar la espada caída.

Ant Group, en colaboración con la Universidad Jiaotong de Shanghái, propuso ROAD, convirtiendo la proporción de mezcla de datos de un "parámetro preestablecido" en una "variable de decisión dinámica".

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Dirección del artículo: https://arxiv.org/pdf/2605.14497

Su idea central es interesante: la selección de datos es esencialmente un problema de optimización en dos niveles.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

  • Nivel interno (Inner-Level): Actualización estándar de Q-learning, es decir, minimizar el error de Bellman;
  • Nivel externo (Outer-Level): Tratar la estrategia de mezcla de datos como una variable de decisión meta, con el objetivo de maximizar el retorno esperado de la estrategia en línea.

Se resuelve aproximadamente mediante un algoritmo MAB (Multi-Armed Bandit) en dos capas, permitiendo que la estrategia híbrida se ajuste en tiempo real durante el entrenamiento: cuando se detecta que el modelo comienza a "olvidar" los conocimientos aprendidos en la fase offline, se aumenta automáticamente la proporción de muestreo de datos offline para mantener la base; cuando el modelo tiende a ser conservador y presenta insuficiente exploración, se incrementa oportunamente la proporción de datos en línea para fomentar la experimentación.

Los experimentos se realizaron de manera sólida. El equipo validó el enfoque en tres benchmarks clásicos de aprendizaje por refuerzo de offline a online: AntMaze (robot que busca un objetivo en un laberinto), MuJoCo (control de movimiento de robots biomiméticos) y FrankaKitchen (brazo robótico que realiza operaciones complejas en una cocina). Estas tareas, con distintos niveles de dificultad y espacios de estado variados, permiten evaluar de manera integral la capacidad de generalización del algoritmo.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Para verificar la generalidad del algoritmo ROAD, el equipo de investigación combinó ROAD con varios algoritmos en línea principales, como IQL, PEX, CQL y Cal-QL. Los resultados mostraron que, independientemente del algoritmo subyacente, ROAD siempre logra mejorar de forma estable el rendimiento.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Con PEX+ROAD como ejemplo, este método logra una puntuación promedio general de 71.12 en los 24 tareas de control continuo del benchmark D4RL, ocupando el primer lugar en 18 de las 24 tareas, superando significativamente todas las líneas base, como proporciones fijas, proporciones decrecientes y replay balanceado heurístico.

Es decir, ROAD permite que el modelo encuentre el punto óptimo de equilibrio entre “herencia conservadora” y “exploración agresiva”: ni se estrella al lanzarse ni pierde las oportunidades de mejora que ofrecen los datos en tiempo real. Este método tiene un valor muy claro para escenarios como el lanzamiento de modelos de gestión de riesgos de Ant Group o la optimización en tiempo real de sistemas de recomendación.

03 DSEBO: Hacer que la optimización bayesiana de alta dimensión busque "adaptativamente" en subespacios

La optimización bayesiana es un método clásico para optimizar funciones cajas negras, pero se enfrenta a dificultades con problemas de alta dimensión. Una solución común es la inserción aleatoria: proyectar la optimización en un subespacio de baja dimensión, pero surge un nuevo problema: ¿cuál es realmente la dimensión efectiva?

Los métodos tradicionales dependen ya sea de la experiencia de expertos para fijar dimensiones de subespacio, o bien utilizan un enfoque de prueba y error para estimarlas repetidamente, lo que consume muchos recursos y hace que las dimensiones fijas del subespacio sean difíciles de adaptar a distintas tareas. Además, la dimensión efectiva puede cambiar durante el proceso de optimización: en las etapas iniciales de exploración, una baja dimensión es suficiente, pero en las etapas finales de ajuste fino, puede ser necesario un mayor nivel de detalle en dimensiones más altas.

DSEBO, propuesto por Ant Group en colaboración con la Universidad Normal de East China y la Universidad de Nankín, convierte la dimensión del subespacio en una "variable dinámica" durante el proceso de optimización, permitiendo cambios automáticos según el progreso de la búsqueda.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Dirección del artículo: https://arxiv.org/pdf/2605.23473

El mecanismo central de DSEBO es "ascender gradualmente de bajo a alto":

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

  • Partiendo de un subespacio de baja dimensión, el optimizador genera soluciones candidatas en el espacio de baja dimensión, las cuales se mapean al espacio original mediante una incrustación aleatoria, permitiendo una rápida exploración del contorno general de la función objetivo; luego, la retroalimentación de los resultados impulsa la actualización iterativa del proceso gaussiano;
  • Se observa que tras la convergencia se activa automáticamente la expansión de dimensión, heredando la solución de baja dimensión mediante una matriz de incrustación compartida;
  • Inicialización y optimización continua del subespacio, asegurando que los subespacios se aniden entre sí mediante una matriz de incrustación compartida, formando un ciclo de “exploración de baja dimensión → activación de convergencia → expansión de dimensión → optimización continua” hasta alcanzar el límite del presupuesto de evaluación.

En la etapa de expansión de dimensiones, el grado de expansión tampoco es fijo: el algoritmo ajusta automáticamente según la curva de cambio del valor óptimo actual: si la curva es plana, expande más lentamente para evitar gastos innecesarios; si la curva es pronunciada, expande más rápidamente para capturar rápidamente los beneficios de alta dimensión.

Los resultados experimentales muestran que, en funciones sintéticas (Levy, Griewank, Sphere, D=1000) y tres tareas reales (MSLR, Lasso-Hard, LIMO), DSEBO se comparó uno a uno con una docena de métodos principales como REMBO, SIRBO, BAxUS y TuRBO, obteniendo la mejor solución en casi todas las tareas: superando en precisión y velocidad de convergencia.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Esta estrategia de “explorar en dimensiones bajas y afinar en dimensiones altas” también es muy útil en el desarrollo diario de Ant: la optimización de hiperparámetros de modelos de crédito, la búsqueda de umbrales óptimos para estrategias de control de riesgos y el diseño de experimentos multivariados para campañas de marketing ya no requieren estimaciones intuitivas de expertos; el algoritmo puede “observar y ajustarse en tiempo real”, logrando un funcionamiento automatizado y de alta eficiencia.

04 VGA-BenchV2: Hacer que el benchmark de evaluación de video sea adaptable a la evolución del ecosistema AIGC

Si los tres primeros artículos discuten la adaptación a nivel de algoritmo, VGA-BenchV2 muestra cómo la infraestructura de evaluación se "adapta" a la evolución del ecosistema de tecnologías AIGC. Este es el único trabajo entre los cuatro artículos que se centra en la comprensión de contenido multimodal, reflejando las reservas estratégicas de Ant Group en áreas no financieras como la vida digital y el ecosistema de contenidos.

AIGC ha provocado una explosión en la producción de videos, pero un problema central se ha estancado: ¿cómo evaluamos sistemáticamente la calidad de estos videos generados?

Los indicadores tradicionales de evaluación, como el FVD (evaluar la calidad general y la coherencia temporal), el CLIP Score (evaluar la coherencia semántica entre las imágenes generadas y las descripciones textuales), se centran principalmente en si la imagen es clara, si los movimientos son fluidos y si el texto coincide correctamente. En cuanto a la composición, el uso de la luz y la sombra, o la armonía cromática: estas cualidades perceptivas relacionadas con la “estética” casi no pueden evaluarlas.

Anteriormente en CVPR 2026, Ant Group, en colaboración con la Academia de Cine de Pekín y el Instituto de Inteligencia Artificial General (BIGAI), presentó VGA-Bench, que por primera vez estableció un marco de tres dimensiones para la evaluación estética de videos (calidad estética, etiquetas estéticas, calidad de generación), y construyó una base de evaluación basada en 1.016 prompts, 12 modelos de generación y más de 60.000 videos, permitiendo que la IA aprendiera por primera vez a "apreciar" videos desde una perspectiva profesional.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Enlace al artículo: https://arxiv.org/pdf/2604.10127

Pero los modelos de generación de video evolucionan demasiado rápido; el ritmo de iteración mensual hace que los benchmarks fijos se vuelvan rápidamente “insuficientes”. En este artículo de IJCAI 2026, el equipo presenta aún más VGA-BenchV2.

Ant Group IJCAI 2026 paper roundup: Teaching AI to "adapt on the fly"

Dirección de código abierto:

https://huggingface.co/datasets/BestVictoryLab/VGA-Bench

▎La evolución principal tiene tres puntos:

En primer lugar, se aumentó la cantidad de anotaciones humanas. VGA-BenchV2 añadió 36.000 anotaciones humanas a nivel de tarea, incluyendo 16.200 anotaciones de calidad estética, 13.200 anotaciones de etiquetas estéticas y 6.600 anotaciones de calidad de generación, representando una expansión de 13,46 veces, 11,15 veces y 1,55 veces en comparación con VGA-Bench, respectivamente. Una cantidad más abundante de datos de "preferencias humanas" permite que el evaluador se alinee con mayor precisión con el juicio estético humano.

En segundo lugar, se actualizó la arquitectura del evaluador. El equipo diseñó una arquitectura híbrida: VAQA-Net se encarga de la puntuación estética continua, mientras que VTag-Net y VGQA-Net realizan el reconocimiento de etiquetas y la evaluación de calidad basándose en el gran modelo de lenguaje visual Qwen. La incorporación de modelos grandes elevó la capacidad del evaluador para comprender semántica visual compleja. Los resultados experimentales demuestran que sus evaluaciones en múltiples modelos generativos coinciden altamente con los juicios humanos.

Tercero, se establece un bucle cerrado desde la “evaluación” hasta la “optimización”. Este es el diseño más innovador de VGA-BenchV2: utiliza el evaluador de estética aprendido como señal de recompensa para ajustar directamente los modelos generativos mediante aprendizaje por refuerzo. Esto significa que la benchmark de evaluación ya no es solo un “árbitro”; sus puntuaciones se convierten directamente en señales de optimización que guían a los modelos generativos para iterar continuamente en calidad estética.

De VGA-Bench a VGA-BenchV2, el sistema de evaluación ya no es una regla estática, sino un sistema vivo que evoluciona junto con el ecosistema de generación. Para escenarios de Alibaba Group como comprensión de contenido, revisión de seguridad y optimización de recomendaciones, la capacidad de evaluación de calidad de video no solo se mantiene al día con la evolución del ecosistema AIGC, sino que también impulsa hacia atrás la optimización de los modelos aguas arriba: de la “calificación” a la “optimización”, se cierra el ciclo.

Conclusión: Incluso el algoritmo más inteligente debe finalmente probarse en un entorno dinámico.

Cuatro artículos abordan respectivamente el aprendizaje no supervisado, el aprendizaje por refuerzo, la optimización de caja negra y la evaluación multimodal, apuntando todos hacia la misma trayectoria técnica: la transición de paradigma de estático a dinámico.

Los datos experimentales también respaldan la efectividad de esta ruta: MSRGC-Net obtuvo 12 primeros lugares y 2 segundos lugares en 15 métricas; ROAD superó las estrategias actuales en múltiples tareas de aprendizaje por refuerzo de offline a online; DSEBO logró mejoras cuantificables en problemas de optimización de mil dimensiones; VGA-BenchV2 mostró resultados de evaluación en múltiples modelos generativos altamente coherentes con el juicio humano.

Al observar la estrategia general de Ant siguiendo esta ruta tecnológica, se revela una estructura clara de “impulsores dobles”: por un lado, se profundiza en modelos de series temporales, aprendizaje por refuerzo y algoritmos de optimización en escenarios financieros clave; por otro, se adelanta la implementación de infraestructuras de comprensión y evaluación multimodal en el ecosistema digital y de contenido.

Al final, por más inteligente que sea el algoritmo, debe ser probado en un entorno dinámico. El verdadero valor de estos cuatro artículos quizás radique en que todos surgieron de un contexto empresarial real: los escenarios de negocio de Ant no son un “telón de fondo” para los artículos, sino la fuente de los problemas, el origen de los datos y el campo de prueba de los resultados.

Y quizás, esto es precisamente lo que hace única a la industria en la investigación de IA: no solo "publican artículos", sino que buscan soluciones capaces de resistir cambios dinámicos para problemas del mundo real.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.