速度與價格能否兼得,正成為生成式圖像模型競爭的新戰場。文章作者、來源:AIBase
發布背景
微軟於9月正式推出自主研發圖像生成模型的輕量化版本 MAI-Image-2.6-Flash,並已透過 Microsoft Foundry 開啟公開預覽。作為上月登頂技術排行榜前列的 MAI-Image-2.6 的高效能版本,此模型的推出標誌著微軟在 AI 圖像生成領域全面佈局高併發、低延遲及成本敏感型工業級應用場景。
Performance
測試數據顯示,MAI-Image-2.6-Flash 的圖像生成速度達到 GPT-Image-2-Medium 的 2.8 倍,整體綜合效率提升達 72%。在大幅減少推理延遲與計算開銷的同時,該變體完整繼承了主模型的核心生成與編輯能力,支援高精度的文本到圖像生成以及局部物件級圖像編輯。
架構升級
In addition, the MAI-Image-2.6 series brings multiple architectural upgrades, including support for up to 5 reference images to ensure consistency across multiple images of characters and products, integration of Bing search for web-based location to supplement real-world image information, and native support for dynamic aspect ratios and higher-resolution outputs.
在商業化定價策略上,Flash 版本將文本輸入、圖像輸入和圖像輸出的每百萬 Token 價格分別下探至 1.75 美元、2.50 美元和 19 美元,較主模型實現了超過 50% 的顯著降本。
Microsoft 建議將主模型應用於對畫質和文字渲染要求嚴苛的商業設計與最終生產資產,而將 Flash 版本精準定位於互動式應用、快速創意迭代以及大規模自動化流程。這套兼顧極端效能與極致性價比的多模態模型矩陣,反映了當前生成式 AI 從單一技術突破向高吞吐量、低成本工程化落地演進的行業趨勢。
