ChainThink melaporkan, pada 5 Ogos, menurut pengumuman rasmi, Antelope AI (inclusionAI) secara rasmi membuka timbangan Ling-3.0-flash, sambil menyediakan versi asli BF16 dan versi kuantisasi FP8.
Kedua-dua versi menggunakan lesen MIT, telah dilancarkan di Hugging Face dan ModelScope, dan menyokong pelaksanaan sendiri melalui SGLang atau vLLM.
Di antaranya, versi BF16 berukuran sekitar 255GB, manakala versi FP8 berukuran sekitar 128GB, hampir separuh saiznya. FP8 menyimpan parameter dengan ketepatan lebih rendah, yang dapat mengurangkan ambang penyimpanan dan memori grafik;
Dalam 4 ujian yang disenaraikan secara rasmi, perbezaan maksimum antara FP8 dan BF16 ialah 1.57 mata.
Ling-3.0-flash mempunyai jumlah parameter sebanyak 12.4 bilion, dengan 5.1 bilion parameter yang diaktifkan setiap kali penghasilan, menyokong konteks Token 256,000, dan terutama ditujukan untuk tugas Agent seperti pemrograman, carian, penyelidikan mendalam, dan pemanggilan alat.
Ulasan rasmi menyatakan bahawa model ini mencapai atau melampaui model triliun parameter sebelumnya, Ring-2.6-1T, pada kebanyakan tolok ukur.
