ChainThink melaporkan, pada 9 September, menurut pengumuman rasmi, Ant Group secara rasmi melancarkan dan membuka sumber model besar multimodal asli pertama dalam siri Ling-3.0-flash-VL.
Model ini dikembangkan berdasarkan arsitektur MoE Ling-3.0-flash, dengan jumlah parameter keseluruhan 124B, mengaktifkan 5.5B parameter sekali inferensi, menyokong input gambar, teks, dan video secara asli, dengan jendela konteks hingga 256K token.
Sambil memperkenalkan mekanisme umpan balik visual, tugas pelaksanaan dialihkan daripada penghasilan sekali jadi kepada kitar tertutup «mengamati → bertindak → mengesahkan → memperbaiki», serta meneruskan keupayaan Ling-3.0-flash sebagai nod pelaksanaan berkesan dalam alur agen.
