Kadalasan ay nagpapahintulot sa mga developer ang kakayahan ng AI sa paggawa ng code na «humiwalay sa keyboard», ngunit para sa mga designer, ang mga larawang nilikha ng AI ay malayo pa sa pagkakaroon ng isang kahandaan para ipasa.
Sa workflow ng pagdidisenyo ng imahe, kailangan ng paghihiwalay ng mga tao, pagbabago ng teksto sa mga materyales, at patuloy na pag-aayos ng posisyon ng iba't ibang produkto, ngunit ang teksto sa pakete at hugis ng bote ay hindi dapat magbago. Kung patuloy ang pagbabago ng mga kahilingan at kailangan pa ring i-edit ang mga lokal na bahagi upang panatilihin ang pagkakasundo ng buong imahe.
Ang mga detalyeng ito ang nagdedesisyon kung kaya ng AI-generated image na pumasok sa totoong proseso ng paggawa. Para sa mga designer, e-commerce operator, at content creators, ang bottleneck ng mga image model ngayon ay kung kaya bang matupad nang tama ang bawat utos sa pagbabago.
Kaninang Linggo, Ali Qwen Ipinakilala nang opisyal ang open-source image generation model na Qwen-Image-2.1, na lutasin ang karamihan sa mga hamon sa produktibidad sa pamamagitan ng maliit na sukat: ito ay nagtatagpo ng text-to-image at image editing sa isang sistema, may native support para sa pagbuo ng transparent images, maaaring tumanggap ng hanggang 10 reference images, at pinahusay pa ang local editing, facial at product fidelity.

Naging ito Qwen Ang image series ay ang pinakabalansed at pinakamahusay na halaga sa mga open-source image generation model. Ayon sa mga pampublikong pagsusuri, ang Qwen-Image-2.1 ay nakuha ang unang lugar sa mga open-source model, kahit na higit pa sa Nano Banana 2.0. Dapat tandaan na ang parameter count ng visual generation component ng model ay lamang 7B.
Sa mga platform tulad ng X, may mga user na nakakuha ng early access na nag-post ng kanilang mga resulta, at maraming magandang puna. May mga screenshot na naglalaman ng malaking halaga ng teksto:

Gumawa ng mga larawan na may katotohanang texture ng litrato:

Mayroon ding pagsubok sa iba’t ibang filter at estilo ng ilaw:

Pinaniniwalaan ng mga tao na ang Qwen-Image-2.1 ay nakakaimpress sa pagpapatupad ng mga utos, tagumpay sa pag-draw, at praktikal na epekto. Batay sa kakayahan ng bagong modelo, kaya namin ngayong i-automate ang workflow ng paggawa, pagsasama, at pagbabago ng mga materyales upang gamitin ang AI para lutasin ang maraming kumplikadong problema sa pag-edit.
Kakayahan at efisiyensiya
Ayon sa impormasyon, ang visual generation component ng Qwen-Image-2.1 ay gumagamit ng 20-layer Single-Stream DiT na may 7B na parametric, at may native suporta para sa 2K. Nakamit ng modelo ito ang antas na hihigit sa laki nito sa mga benchmark: ang kabuuang marka ng Qwen-Image-2.1 ay 60.28. Sa kumpara, ang Nano Banana 2.0 ay 59.82, at ang GPT Image 1.5 ay 59.65. Nakakapag-competitive na ito sa iba’t ibang proprietary image models.

Mga grapiko ng pagsubok sa Qwen-Image-Bench.
Ang visual generation na bahagi ay mayroon lamang na 7B na parameter, na nagiging mas nakakaakit sa antas ng kakayahan nito: ito ay nagtatampok ng kakayahan sa paggawa ng imahe, paggawa ng transparent assets, at multi-image editing sa isang mas maliit na generation module (isang pinagsamang pipeline para sa paggawa at pag-edit), na nagbibigay ng mas magaan na punto para sa mga developer sa pag-deploy at pag-customize ng mga image tool.
Samantalang magandang ang performance, pinabuti rin ng Qwen-Image-2.1 ang proseso ng inference ng modelo, ang pangunahing ideya ay ang pagbawas ng hindi kinakailangang paulit-ulit na pagkalkula.
Sa isang pag-edit ng imahe, ang input na reference image at edit instruction ay hindi nagbabago sa bawat hakbang ng pag-generate. Kaya, gumagamit ang bagong modelo ng hybrid-granularity attention structure: ang teksto (system prefix, edit instruction) ay sumusunod sa tradisyonal na token-level causal masking, na nagpapagana ng masinsinang sequence computation sa bawat salita upang mapanatili ang konsistensya sa pag-unawa sa semantikong lohika, habang ang bahaging pag-generate ng imahe ay gumagamit ng chunk-level masking at gumagamit ng mekanismo ng KV Cache upang i-cache ang mga static context pagkatapos ng unang pagkalkula, upang muling gamitin sa mga susunod na hakbang ng pag-generate.

Ibig sabihin nito na ang AI ay mag-aayos muna ng mga sanggunian bago paulit-ulit na gamitin ang mga resultang ito habang ginagawa ang target image; ang pagpapabuti na ito ay mas makabuluhan sa mga input na maraming imahe, at nakakatulong upang pataasin ang efficiency ng pag-iisip at bawasan ang paggamit ng VRAM.
Dahil ngayon ay suportahan na ng Qwen-Image-2.1 ang pinakamaraming 10 reference images, mahalaga ang pag-optimize na ito. Mas malaki ang input, mas mahalaga ang pagtrato sa reference information at pagkontrol sa pag-uulit ng computation. Ang eksaktong halaga ng oras at VRAM na matitipid ay depende sa hardware, precision, resolution, at bilang ng input.
Direktang lumikha ng magagamit na transparent na materyales
Ang kakayahan ng bagong bersyon ng Qwen-Image na pinakamalapit sa mga pangangailangan ng disenyo ay ang pagbuo ng transparent na imahe.
Ang karaniwang mga imahe ay may buong background. Upang gamitin ang pangunahing elemento nito sa poster, product page, o ibang imahe, kadalasan ay kailangan munang i-remove ang background, at i-adjust ang kontur, puwang, at mga gilid. Ang mga transparent na imahe ay naglalaman ng karagdagang impormasyon sa transparency na nagpapahintulot sa background na makita sa paligid o ilang bahagi ng pangunahing elemento, na nagpapadali sa pagpapalipat at pagkombina.
Ang Qwen-Image-2.1 ay may natatanging suporta sa pagbuo ng mga imahe na may transparent background, at awtomatikong masusukat kung ang resulta ay karaniwang imahe o imahe na may transparent background batay sa prompt. Ang mga user ay maaaring humiling ng transparent background habang naglalarawan ng mga materyales. Ang mga halimbawa na ipinapakita ay kasama ang mga pambihirang ilustrasyon, mga elemento ng tao, mga dekoratibong elemento, at mga kumplikadong kombinasyon na binubuo ng maraming bagay—lahat ay karaniwang mga pangangailangan sa disenyo. Subukan namin rin:

Magandang balita para sa mga creator, ngayon ay mayroon na tayong direktang gamitin na materyales, at nawala na ang ilang mga hakbang sa trabaho.
Oo, ang mga transparent na elemento na ito ay maaaring baguhin pa pagkatapos ng paggawa. Halimbawa, ang iisang character sa illustration ay maaaring baguhin ang kanyang ekspresyon, at ang teksto sa larawan ay maaaring baguhin ang nilalaman. Ang mga bagay na maaaring i-edit ay maaaring ang mga visual na detalye ng karakter o ang teksto sa elemento.
Malapit ito sa tunay na pangangailangan sa pagbabago noong disenyo: nagbago ang pangalan ng aktibidad, ngunit kailangan pa ring panatilihin ang disenyo; mas masaya ang mga ekspresyon, ngunit dapat pa ring makikilala ang mga karakter bilang parehong tao. Pagkatapos isama ang pagbuo at pag-edit sa iisang modelo, mayroon na silang iisang punto ng pagtrato para sa mga sumusunod na hiling.
Oo, ang Qwen-Image-2.1 ay sumusuporta sa pagproseso ng mga umiiral na larawan.


Binigyan ng opisyal ang isang halimbawa ng pagkuha ng kailangang laman mula sa totoong larawan upang makakuha ng RGBA transparent image. Ang A dito ay nangangahulugan ng alpha channel, na ginagamit upang ilarawan ang antas ng transparency sa bawat bahagi ng imahe.
Nakikita na ang kakayahang ito ay naglilingkod sa pagbuo mula sa sero, pati na rin sa paggamit muli ng mga umiiral na larawan. Maaari ng mga tagagawa na unang magbigay ng larawan, at pagkatapos ay hilingin sa modelo na kunin ang mga pangunahing elemento nito bilang materyales para sa susunod na disenyo.
Bago ay ipinakilala ng Qwen-Image series ang hiwalay na Qwen-Image-Layered upang suriin ang mga kakayahan tungkol sa transparent images. Ngayon, ang Qwen-Image-2.1 ay nagtatampok na ng native na pagbuo at pag-edit ng transparent images sa loob ng pangkalahatang image model, na nagpapalakas pa ng kahandaan.
Mayroon na rin ang akurat, open-source AI model na kailangan para sa multi-image editing
Kapag ang isang imahe ay may kahilingan mula sa maraming objekto, mas kumplikado ang pag-edit.
Halimbawa, kung nais mong isuot ang isang partikular na damit, sapatos, bag, at salop sa iisang model, bawat larawang pang-referensya ay may iba’t ibang papel, kaya kailangan ng modelo na magkakaiba ng tao at produkto, ilagay ang mga ito sa tamang posisyon, at panatilihin ang kanilang mga katangian habang maaari.
Ang Qwen-Image-2.1 ay sumusuporta sa pinakamataas na 10 na input na reference image. Sinubukan namin ito, upang ipakilala si Ultraman at si Dario na mag-usap. Ginamit namin 7 na imahe: larawan ng dalawang tao na nakatayo sa harap (palitan ang ekspresyon), background na silid, isang solong upuan, baso ng kape (puno ng kape), floor lamp, electric fireplace, at maliit na mesa, at nagbuo ng isang kompletong resultang imahe.

Maaari rin ngayong mabilis na makita ang epekto ng iba’t ibang pagkakasuot ng damit, at maaari mo ring i-combine ang mga ок individual na larawan upang gawing group photo.
Teknikal na ito ay sinusubok hindi lamang kung gaano karaming mga larawan ang maaaring tanggapin ng AI model, kundi kung ang mga referensya ay maaaring maging tama sa huling imahe—ang proporsyon, posisyon, at pangkalahatang istilo ay magkakasundo.
Nakakapagbuo na ng buong imahe, karaniwang may karagdagang pagpapalit sa mga detalye.
Ang Qwen-Image-2.1 ay nag-aalok ng mga paraan tulad ng pagpili, pagpapakel, at hiwalay na mask upang mas maayos na ipahayag ng mga user ang posisyon ng pag-edit. Halimbawa, maaari mong gamitin ang iba’t ibang kulay para markahan ang iba’t ibang rehiyon, at hilingin ang isang pagbabago na mag-alis nang sabay-sabay ng bahagi ng damit ng tao sa larawan at palitan ang kulay ng buhok.

Ang ganitong interaksyon ay nagtatayo ng ugnayan sa pagitan ng posisyon ng espasyo at mga kahilingan sa teksto. Para sa pag-edit na naglalaman ng maraming rehiyon, ang user ay maaaring tukuyin nang hiwalay kung saan kailangang tanggalin, kung saan kailangang palitan, at ano ang nais na baguhin.
Ang paraan ng pagpapalit ay angkop para direktang tukuyin ang posisyon ng mga bagong objekto, ngunit ang direkta na pagpapalibot o pagpapalit sa orihinal na imahe ay maaaring magkasya sa bahagi ng imahe. Dahil dito, ang modelo ay sumusuporta rin sa paggamit ng karagdagang mask na imahe upang tukuyin ang rehiyon ng pag-edit, na nagpapahintulot sa orihinal na impormasyon na maipasa nang buo sa modelo. Para sa mga disenyo na naglalaman ng mga tao at produkto, ang kakayahang panatilihin ang impormasyon ay lalong mahalaga.

Accuracy ng teksto, kalidad ng imahe
Kahit magbago ang hairstyle o escena, dapat panatilihin ng portrait ang mga orihinal na katangian ng personalidad; kahit magbago ang kapaligiran ng pagkakapila ng produkto, kailangan din na manatili ang mga teksto, textura, at hugis ng pakete. Kung hindi, kahit maganda ang imahe, maaaring hindi ito maaaring gamitin para sa orihinal na pagpapakita. Pinapakita ng Qwen-Image-2.1 ang kakayahan sa pag-edit ng pagpapanatili sa dalawang uri ng escena—portrait at produkto—at tila maganda ang epekto.
Subukan namin ito, halimbawa ay ikuha ang screenshot ng pahina na ito mula sa Elementary School 'Information Technology, Grade 3, First Semester', DeepSeek Ang pagbati: "Ako ay DeepSeek , nagkita tayo!」 ay maging 「Kamusta, paano ko kayo matutulungan?」, at palitan ang Deep Thinking (R1) ng pinakabagong bersyon ng button para sa Deep Thinking, at i-light up:

Sa labas ng pagbuo at pag-edit, patuloy na pinabuting ng Qwen-Image-2.1 ang pagganap nito sa teksto at mga tao. Anuman ang mga pahina na may malaking dami ng teksto, mga infographics, o mga larawan sa pananaliksik, ang katumpakan ng nilalaman at ang kagandahan ng pagkakasunod-sunod ay pinabuti sa isang makabuluhang antas.

Sa bahagi ng portrait, pinapalakas ng Qwen-Image-2.1 ang pagpapakita ng liwanag at detalye. Ngayon, mas nauugnay ang mga buhok, tekstura ng damit, detalye ng mukha, at liwanag sa paligid sa mga larawang nilikha ng AI, at mas marami ang kagandahan ng tekstura.
Mayroon ding mas mahusay na kakayahan sa pagbuo ng panoramic view, infographics, three-view, at storyboard images, na nagpapalawak sa aplikasyon ng pagbuo at pag-edit ng static images, at nagbibigay ng higit pang posibilidad para sa mga gawain tulad ng pagpapakita ng karakter at visual planning. Subukan namin ang paggamit ng community-made Qwen anime character upang lumikha ng isang serye ng storyboard illustrations:

Ang pagsasama-sama ng mga kakayahan na ito ay nagbibigay-daan sa Qwen-Image-2.1 na sakop ang mas kompletong chuwe ng pagproseso ng imahe; ngayon, maaari nating gamitin ang isang AI model upang matapos ang maraming gawain—una, ayusin ang komposisyon gamit ang maraming reference image, pagkatapos ay i-adjust ang mga rehiyon, habang pinapanatili ang mga pangunahing katangian ng mga tao at produkto. Ang pagkakaroon ng isang open-source AI na may 7B na visual generation component ay maaaring magdulot ng anumang antas ng pagbabawas sa pagrerepaso, isang tanong na dapat tandaan sa susunod na practical testing.
Ano ang sukat ng aplikasyon?
Ang paglalabas ng Qwen-Image-2.1 ay nagpapakita na ang mga modelo ng imahe ay patuloy na sumasakop sa mas maraming detalyadong bahagi ng proseso ng paggawa, at ang trend na ito ay nagsisigla nang mas mabilis.
Ang pagpapabuti sa paglabas ng transparent素材, paggamit ng maraming imahe bilang referensya, lokal na pag-edit, at pagpapabuti sa fidelity ay nagdaragdag ng posibilidad na masukol ang AI model sa aktwal na workflow. Para sa mga creator, ibig sabihin nito na mas maraming gawain sa paggawa at pag-adjust ng mga素材 ay maaaring ipagkaloob sa open-source image generation models sa mas simpleng paraan; habang para sa mga developer, ang pagbubukas ng bagong model ay nagbibigay ng bagong pundasyon para sa pagbuo ng mga design tool, aplikasyon, at custom workflow na nakabatay sa mga kakayahan na ito.
Maaari nating masasaligan na ipaabot na kasabay ng pag-open source ng mga image model tulad ng Qwen-Image-2.1, magpapatuloy ang komunidad na i-integrate ang mga kakayahang pagbuo at pag-edit sa mas maraming mga skenaryo sa paggawa ng nilalaman, upang bigyan ng mas maraming tao ang mga kasangkapan sa paglikha na angkop sa kanilang pangangailangan. Kapag naging karaniwan at madaling gamitin ang mga kakayahang AI sa mga pang-araw-araw na software, maaaring mabawasan muli nang malaki ang hadlang mula sa ideya patungo sa isang visual na gawa.
Kasalukuyan, ang mga open weights ng Qwen-Image-2.1 ay ipinakalabas na sa Hugging Face at ModelScope, at ang teknikal na ulat ay nai-upload na sa GitHub repository.
Blog: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
Nakuha mula sa WeChat public account na "Machine Heart" (ID: almosthuman2014), may-akda: Zeanan
