AI 寫代碼的能力經常讓開發者「雙手離開鍵盤」,但對於設計師而言,AI 生成的圖片距離能交稿總是差了好幾步。
在圖像設計的工作流程中,人物需要抠圖、素材需要改字,各類商品的擺放也需不時調整,但包裝上的文字和瓶身的形狀則不能隨之更改。若需求不斷調整,仍需持續修改局部,以確保整張圖保持協調。
這些細節決定了 AI 生圖能否進入真正的創作流程。對設計師、電商運營和內容創作者來說,如今圖像模型的瓶頸,在於每一次提出的修改指令能否準確完成。
本週日,阿里 Qwen 正式開源圖片生成模型 Qwen-Image-2.1,以小型模型的規模解決了大部分生產力難題:它實現了文生圖與圖像編輯一體化,原生支援透明圖生成,最高可接收 10 張參考圖,並進一步強化了局部編輯、人像與商品保真度。

它成為了 Qwen 圖像系列目前最平衡、性價比最高的開源生圖模型。公開評測結果顯示,Qwen-Image-2.1 在開源模型中排名第一,得分甚至超過了 Nano Banana 2.0。要知道,這個模型的視覺生成部分參數量僅為 7B。
在 X 等平台上,已有提前獲得體驗資格的用戶釋出生成結果,獲得好評如潮。有包含大量文字內容的示意圖:

生成具有真實照片質感的圖片:

也有嘗試各種不同濾鏡、打光風格的:

人們認為 Qwen-Image-2.1 在指令遵循、抽卡成功率以及實際效果上都令人印象深刻。基於新模型的能力,我們已經可以串起素材生成、組合與修改的工作流,用 AI 來解決很多複雜的修圖問題。
能力與效率
據介紹,Qwen-Image-2.1 的視覺生成部分採用 20 層 Single-Stream DiT,參數量為 7B,原生支援 2K。該模型在評測基準中實現了超越體量的水平:Qwen-Image-2.1 的總分為 60.28。相比之下,Nano Banana 2.0 為 59.82,GPT Image 1.5 為 59.65。它已經能夠與多款閉源圖像模型同場競爭。

Qwen-Image-Bench 評測圖表。
視覺生成部分僅有 7B 參數,更顯其能力水準值得關注:其在較小的生成模組中同時整合了圖像生成、透明素材生成與多圖編輯功能(生成與編輯統一管道),為開發者部署與客製化圖像工具提供了更輕量的起點。
在性能表現優異的同時,Qwen-Image-2.1 還對模型的推理過程進行了優化,核心思路是減少不必要的重複計算。
在一次圖像編輯中,輸入的參考圖和編輯指令不會隨著每一步生成而改變。因此,新模型使用混合粒度注意力結構,文本部分(系統前綴、編輯指令)遵循傳統 Token 級因果掩碼,逐詞進行嚴格的序列計算以保證語義邏輯理解的連貫性,圖像生成部分則採用 Chunk 級掩碼,並通過 KV Cache 的機制在首步計算後緩存這些靜態上下文,供後續生成步驟複用。

This means AI will now process reference materials first and reuse existing results when gradually generating target images; this optimization is particularly noticeable with multiple image inputs, helping to improve inference efficiency and reduce VRAM consumption.
由於 Qwen-Image-2.1 目前最多支援 10 張參考圖,此項優化顯得至關重要。輸入內容越豐富,如何處理參考資訊與控制重複計算就越值得關注。至於具體能節省多少時間與顯存,仍需結合硬體、精度、解析度與輸入數量來判斷。
直接生成可用透明素材
要說新版本 Qwen-Image 最貼近設計需求的能力,那就是透明圖生成了。
一般圖片素材通常包含完整背景。若要將主體應用於海報、商品詳情頁或另一張圖片中,通常需要先進行抠圖,處理輪廓、縫隙和邊緣。透明圖片則包含額外的透明度資訊,可讓背景從主體周圍或部分區域透出,便於後續疊加與組合。
Qwen-Image-2.1 原生支援透明圖生成,可根據提示詞自動判斷生成的是普通圖片還是透明圖,用戶在描述素材時即可提出透明背景的要求。目前展示的範例包括節慶插畫、人物素材、裝飾元素,以及由多個物件構成的複雜組合,均對應設計工作中常見的素材需求。我們也嘗試了一下:

對於創作者來說這是個好消息,現在我們可以得到直接可用的素材了,工作直接少了几道工序。
當然,這些透明素材生成後仍可繼續修改。例如,同一幅插畫人物可以調整表情,圖片中的文字也可以修改內容。編輯對象既可以是人物的視覺細節,也可以是素材中的文字。
這與設計時的實際修改需求非常接近:活動名稱更換了,但圖案仍需保留;表情要更輕鬆一些,人物仍需能被識別為同一角色。將生成與編輯整合至同一模型後,這些後續要求也有了統一的處理入口。
Of course, Qwen-Image-2.1 supports processing existing photos.


官方提供了從真實照片中提取所需內容並獲得 RGBA 透明圖的範例。其中的 A 代表透明度通道,用於描述圖片各處的透明程度。
Clearly, this capability serves both generation from scratch and the reuse of existing images. Creators can first provide a photo and then request the model to extract the desired subject as material for subsequent design.
Qwen-Image 系列此前曾推出獨立的 Qwen-Image-Layered,探索透明圖相關能力。此次 Qwen-Image-2.1 則將原生透明圖生成與編輯整合進通用圖像模型,進一步提升了便利性。
多圖編輯所需的準確、開源 AI 模型也已出現
當一張圖的需求來自多個物件時,編輯任務會進一步複雜化。
例如,若想將指定的衣物、鞋子、包包和帽子穿戴在同一名模特身上,每張參考圖都有不同作用,模型便需區分人物與商品,將它們置於合理位置,並盡可能保留各自的特徵。
Qwen-Image-2.1 最高支援 10 張參考圖輸入。我們試了試,讓奧特曼和達里奧坐下來談談。使用了 7 張圖片:兩個人對峙的照片(改個表情)、背景房間、單人沙發、咖啡杯(倒上咖啡)、落地燈、電壁爐、矮桌,最終生成一張完整的效果圖。

現在也能快速為一個人展示不同服裝的穿搭效果,你現在還能將不同的單人照片合成為多人合照。
Technically, they test not only how many images an AI model can accept as input, but also whether the reference objects can be properly positioned in the final image, with coordinated proportions, placement, and overall style.
組合出整體畫面後,通常還會進行局部調整。
Qwen-Image-2.1 提供圈選、塗抹和獨立遮罩等方式,讓用戶更明確地表達編輯位置。例如,你可以用幾種顏色標出不同區域,要求一次修改同時去掉照片中人物的部分穿戴、把頭髮改色。

這種互動讓空間位置與文字要求建立起對應關係。對於涉及多個區域的編輯,用戶可以分別指出哪裡需要刪除、哪裡需要替換,以及希望改成什麼。
塗抹方式適合直接標出新增物件的位置,但直接在原圖上圈選或塗抹也會遮住一部分畫面。為此,模型還支援透過額外的遮罩圖片指定編輯區域,這讓原圖資訊能夠完整地輸入模型。對於包含人物和商品的設計來說,這種保留能力尤為關鍵。

文字準確性、畫面質感
更換髮型或場景時,人像仍應保留原有的身份特徵;商品更換擺放環境時,包裝文字、紋理和形狀也需盡可能保持一致。否則,即使畫面美觀,也可能無法用於原本的展示任務。Qwen-Image-2.1 重點強調了人像與商品兩類場景的編輯保真能力,效果看起來不錯。
我們試了一下,例如讓它將小學《資訊科技 三年級上冊》這頁的截圖裡面, DeepSeek 的歡迎語「我是 DeepSeek ,你好,我能幫上什麼忙嗎?」,再把深度思考(R1)改成最新版本的深度思考按鈕,再點亮:

除了生成和編輯之外,Qwen-Image-2.1 也持續提升了對文字與人物的表現。無論是文字密集的圖文頁面、資訊圖表、論文配圖,內容的準確性與排版美觀度都已提升至顯著水平。

在人像部分,Qwen-Image-2.1 進一步增強了光影與細節表現。現在 AI 生成的圖像,不論是人物的髮絲、服裝紋理、面部細節還是環境光線,都變得更加協調,畫面質感更加細膩了。
此外,還具備更優秀的全景圖生成、資訊圖、三視圖和分鏡圖生成能力,擴展了靜態圖像生成與編輯的應用範圍,為角色展示、視覺策劃等任務提供了更多可能性。我們試用了社區製作的 Qwen 二次元形象生成一系列分鏡插畫:

這些能力結合在一起,讓 Qwen-Image-2.1 覆蓋了更完整的圖片處理流程,現在我們可以基於單一 AI 模型完成大量工作:先使用多張參考圖構建畫面,再對區域進行調整,同時盡量保留人物與商品的關鍵特徵。一個視覺生成部分僅有 7B 的開源 AI 最終能將返工減少到什麼程度,將是後續實測中值得關注的問題。
應用空間有多大?
The release of Qwen-Image-2.1 shows that image models are increasingly covering more detailed stages of the creative process, and this trend is accelerating.
無論是透明素材的輸出、多圖參考、局部編輯與保真度能力的提升,都增加了 AI 模型進入實際工作流程的可能性。對於創作者而言,這意味著更多的素材製作與調整工作,都可以透過更簡單的方式交由開源生圖模型完成;而對開發者來說,新模型的開源也為圍繞這些能力構建設計工具、應用與定制工作流提供了新的基礎。
我們可以大膽預測,隨著 Qwen-Image-2.1 這類圖像模型的開源,社區還會進一步將生成與編輯能力融入更多內容製作場景,讓更多人用上適合自己需求的創作工具。當這些 AI 能力成為日常軟體中隨手可用的功能,從想法到視覺作品的門檻,或許就能再次大幅降低。
Currently, the open weights of Qwen-Image-2.1 have been released on Hugging Face and ModelScope, and the technical report has been uploaded to the GitHub repository.
部落格:https://qwen.ai/blog?id=qwen-image-2.1
GitHub:https://github.com/QwenLM/Qwen-Image-2.1
Model Scope:https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:澤南
