La capacité à allier vitesse et prix devient un nouveau champ de bataille pour la concurrence entre les modèles d’images génératives.Auteur et source de l'article : AIBase
Contexte de la publication
Microsoft lance officiellement en septembre la version allégée de son modèle de génération d'images développé en interne, MAI-Image-2.6-Flash, qui est désormais disponible en préversion publique via Microsoft Foundry. En tant que version hautement efficace de MAI-Image-2.6, qui figure parmi les premiers modèles du classement technique du mois dernier, ce lancement marque le déploiement complet de Microsoft dans le domaine de la génération d'images par IA, en ciblant des scénarios industriels exigeant une haute concurrence, une faible latence et une sensibilité aux coûts.
Performance
Les données de test montrent que la vitesse de génération d'images de MAI-Image-2.6-Flash atteint 2,8 fois celle de GPT-Image-2-Medium, avec une amélioration globale de l'efficacité de 72 %. Tout en réduisant considérablement la latence d'inférence et la charge de calcul, cette variante conserve intégralement les capacités centrales de génération et d'édition du modèle principal, permettant une génération d'images à partir de texte à haute précision ainsi qu'une édition d'images au niveau local des objets.
Mise à niveau de l'architecture
En outre, la série MAI-Image-2.6 apporte plusieurs améliorations architecturales, notamment la prise en charge de jusqu'à cinq images de référence pour garantir la cohérence des personnages et produits multi-images, l'intégration d'une fonction de localisation web avec Bing pour compléter les informations d'images du monde réel, ainsi qu'une prise en charge native des rapports d'aspect dynamiques et des sorties à résolution plus élevée.
Sur la stratégie de tarification commerciale, la version Flash réduit les coûts par million de tokens à 1,75 $ pour l'entrée texte, 2,50 $ pour l'entrée image et 19 $ pour la sortie image, soit une réduction de plus de 50 % par rapport au modèle principal.
Microsoft recommande d'appliquer le modèle principal aux designs commerciaux et aux actifs de production finale exigeant une qualité d'image et un rendu textuel élevés, tandis que la version Flash est précisément ciblée sur les applications interactives, les itérations créatives rapides et les processus automatisés à grande échelle. Cette matrice de modèles multimodaux alliant performance extrême et rapport qualité-prix optimal reflète la tendance industrielle actuelle consistant à passer d'une simple percée technologique à une mise en œuvre industrielle à haut débit et à faible coût de l'IA générative.
