Adakah kecepatan dan harga boleh dicapai bersamaan, kini menjadi medan pertarungan baharu dalam model gambar generatif.Penulis artikel, sumber: AIBase
Latar belakang pengumuman
Microsoft secara rasmi melancarkan varian ringan model penghasil gambar buatan sendiri, MAI-Image-2.6-Flash, pada September, dan kini telah membuka pra-pandangan awam melalui Microsoft Foundry. Sebagai versi berkesan tinggi bagi MAI-Image-2.6 yang menduduki tangga teratas dalam senarai teknik bulan lepas, pelancaran model ini menandakan langkah komprehensif Microsoft dalam menyesuaikan penghasilan gambar AI untuk aplikasi perindustrian yang memerlukan keseimbangan antara arus tinggi, latensi rendah, dan sensitiviti kos.
Kinerja
Data ujian menunjukkan bahawa kelajuan penghasilan imej MAI-Image-2.6-Flash mencapai 2.8 kali ganda GPT-Image-2-Medium, dengan peningkatan kecekapan keseluruhan sebanyak 72%. Dengan secara besar-besaran mengurangkan latensi inferens dan beban pengiraan, varian ini secara penuh mewarisi kemampuan penghasilan dan penyuntingan inti model utama, menyokong penghasilan teks-ke-imej presisi tinggi serta penyuntingan imej per objek tempatan.
Peningkatan arsitektur
Selain itu, siri MAI-Image-2.6 secara keseluruhan membawa beberapa peningkatan peringkat arkaitektur, termasuk penyokongan sehingga lima gambar rujukan untuk menjamin konsistensi watak dan produk dalam gambar berbilang, integrasi fungsi penjejakan rangkaian dengan Bing Search untuk melengkapi maklumat gambar dunia nyata, serta penyokongan asli tambahan untuk nisbah aspek dinamik dan output resolusi lebih tinggi.
Dalam strategi penentuan harga komersial, versi Flash menurunkan harga setiap juta Token untuk input teks, input gambar, dan output gambar masing-masing kepada $1.75, $2.50, dan $19, mencapai pengurangan biaya lebih dari 50% berbanding model utama.
Microsoft secara rasmi mencadangkan penggunaan model utama untuk reka bentuk perniagaan dan aset pengeluaran akhir yang menuntut kualiti gambar dan render teks yang tinggi, manakala versi Flash ditujukan secara tepat kepada aplikasi interaktif, iterasi kreatif pantas, dan proses automatik berskala besar. Matriz model multimodal yang menyeimbangkan prestasi ekstrem dan nilai terbaik, mencerminkan trend industri di mana AI generatif bergerak daripada kejayaan teknologi tunggal kepada pelaksanaan kejuruteraan ber throughput tinggi dan kos rendah.
