Apakah kecepatan dan harga dapat dicapai sekaligus, sedang menjadi medan pertempuran baru dalam persaingan model gambar generatif.Penulis artikel, sumber: AIBase
Latar belakang rilis
Microsoft secara resmi meluncurkan varian ringan dari model generasi gambar buatan sendiri, MAI-Image-2.6-Flash, pada bulan September, dan kini telah membuka pra-peluncuran publik melalui Microsoft Foundry. Sebagai versi efisien dari MAI-Image-2.6 yang menduduki peringkat atas daftar teknologi bulan lalu, peluncuran model ini menandai langkah Microsoft dalam memperluas penempatan komprehensifnya di bidang generasi gambar AI untuk aplikasi industri yang membutuhkan konsistensi tinggi, latensi rendah, dan sensitivitas biaya.
Performa
Data pengujian menunjukkan bahwa kecepatan generasi gambar MAI-Image-2.6-Flash mencapai 2,8 kali lebih cepat dibanding GPT-Image-2-Medium, dengan peningkatan efisiensi komprehensif hingga 72%. Sambil secara signifikan mengurangi latensi inferensi dan beban komputasi, varian ini secara utuh mewarisi kemampuan inti generasi dan pengeditan model utama, mendukung generasi teks-ke-gambar presisi tinggi serta pengeditan gambar tingkat objek lokal.
Peningkatan arsitektur
Selain itu, seri MAI-Image-2.6 secara keseluruhan membawa sejumlah peningkatan arsitektural, termasuk dukungan hingga lima gambar referensi untuk memastikan konsistensi karakter dan produk multi-gambar, integrasi fitur penentuan lokasi jaringan dengan Bing Search untuk melengkapi informasi gambar dunia nyata, serta penambahan dukungan asli untuk rasio aspek dinamis dan output resolusi lebih tinggi.
Dalam strategi penetapan harga komersial, versi Flash menurunkan harga masing-masing menjadi $1,75, $2,50, dan $19 per juta token untuk input teks, input gambar, dan output gambar, mencapai pengurangan biaya lebih dari 50% dibandingkan model utama.
Microsoft secara resmi merekomendasikan penggunaan model utama untuk desain komersial dan aset produksi akhir yang menuntut kualitas gambar dan render teks tinggi, sementara versi Flash secara spesifik ditujukan untuk aplikasi interaktif, iterasi kreatif cepat, dan proses otomatisasi berskala besar. Matriks model multimodal yang menyeimbangkan kinerja ekstrem dan harga sangat kompetitif ini mencerminkan tren industri di mana AI generatif bergerak dari terobosan teknologi tunggal menuju implementasi teknis ber-throughput tinggi dan biaya rendah.
