ChainThink mengumumkan, pada 5 Agustus, menurut pengumuman resmi, Antelope AI (inclusionAI) secara resmi membuka bobot Ling-3.0-flash, sekaligus menyediakan versi asli BF16 dan versi kuantisasi FP8.
Kedua versi menggunakan lisensi MIT, telah dirilis di Hugging Face dan ModelScope, dan mendukung penyebaran mandiri melalui SGLang atau vLLM.
Di antaranya, versi BF16 berukuran sekitar 255 GB, sedangkan versi FP8 sekitar 128 GB, volume hampir setengahnya. FP8 menyimpan parameter dengan presisi lebih rendah, sehingga menurunkan ambang batas penyimpanan dan memori GPU;
Dalam 4 ujian yang terdaftar resmi, selisih maksimum antara FP8 dan BF16 adalah 1,57 poin.
Ling-3.0-flash memiliki total parameter sebanyak 12,4 miliar, dengan 5,1 miliar parameter yang diaktifkan setiap kali generasi, mendukung konteks hingga 256.000 token, terutama dirancang untuk tugas Agent seperti pemrograman, pencarian, penelitian mendalam, dan pemanggilan alat.
Ulasan resmi menyatakan bahwa model ini mencapai atau melampaui model sebelumnya dengan parameter triliunan, Ring-2.6-1T, pada sebagian besar benchmark.
