Mensaje de ChainThink, 9 de septiembre: según el anuncio oficial, Ant Group ha lanzado oficialmente y abierto el código del primer modelo de lenguaje multimodal nativo de la serie Ling, Ling-3.0-flash-VL.
Este modelo se basa en la arquitectura MoE de Ling-3.0-flash, con un total de 124B parámetros y 5.5B parámetros activados por inferencia. Admite nativamente entradas de imagen, texto y video, con una ventana de contexto de hasta 256K tokens.
Al mismo tiempo, se introduce un mecanismo de retroalimentación visual, transformando la ejecución de tareas de una generación única en un ciclo cerrado de «observar → actuar → verificar → corregir», y manteniendo la capacidad de Ling-3.0-flash como nodo de ejecución eficiente en el flujo de trabajo del Agente.
