Kemampuan AI menulis kod sering membolehkan pembangun 'melepaskan tangan dari papan kekunci', tetapi bagi pelukis, gambar yang dihasilkan oleh AI masih jauh daripada boleh diserahkan.
Dalam alur kerja reka bentuk imej, individu perlu dipotong keluar, bahan perlu diubah hurufnya, dan susunan pelbagai produk perlu disesuaikan secara berkala, tetapi teks pada pembungkusan dan bentuk botol tidak boleh berubah. Jika keperluan terus berubah dan perlu dilakukan pembaikan separa untuk memastikan keseluruhan gambar tetap selaras.
Perincian ini menentukan sama ada gambar AI boleh memasuki proses kreatif sebenar. Bagi reka bentuk, pengendali e-dagang, dan pencipta kandungan, batasan model gambar semasa ini ialah sama ada setiap arahan pengubahsuaian yang diajukan boleh dilaksanakan dengan tepat.
Ahad minggu ini, Ali Qwen Melancarkan secara rasmi model penghasil gambar Qwen-Image-2.1, yang menyelesaikan sebahagian besar cabaran produktiviti dengan saiz model kecil: ia menggabungkan teks-ke-gambar dan penyuntingan gambar, menyokong secara asli penghasilan gambar telus, boleh menerima sehingga 10 gambar rujukan, serta memperkukuhkan penyuntingan tempatan, ketepatan wajah, dan ketepatan produk.

Ia menjadi Qwen Model penghasil gambar open-source paling seimbang dan berharga terbaik semasa ini. Hasil ujian terbuka menunjukkan bahawa Qwen-Image-2.1 mendapat tempat pertama di kalangan model open-source, dengan skor bahkan melebihi Nano Banana 2.0. Perlu diingat, parameter bahagian penghasilan visual model ini hanya 7B.
Pengguna yang telah mendapat akses percubaan awal di platform seperti X telah memperlihatkan hasil generasi, mendapat ulasan positif daripada ramai. Terdapat gambar contoh yang mengandungi kandungan teks yang banyak:

Hasilkan gambar dengan kualiti foto sebenar:

Juga mencuba pelbagai jenis penapis dan gaya pencahayaan:

Orang percaya bahawa Qwen-Image-2.1 sangat mengesankan dalam mengikuti arahan, kejayaan tarikan, dan kesan sebenar. Berdasarkan kemampuan model baru, kami kini boleh menggabungkan alur kerja penghasilan, penggabungan, dan pengubahsuaian bahan, serta menggunakan AI untuk menyelesaikan banyak masalah penyuntingan gambar yang kompleks.
Kemampuan dan kecekapan
Menurut maklumat, bahagian penghasilan visual Qwen-Image-2.1 menggunakan Single-Stream DiT 20 lapisan dengan jumlah parameter 7B, dan menyokong 2K secara asli. Model ini mencapai prestasi melebihi saiznya dalam ujian piawai: jumlah skor Qwen-Image-2.1 ialah 60.28. Sebagai perbandingan, Nano Banana 2.0 mendapat 59.82 dan GPT Image 1.5 mendapat 59.65. Model ini sudah mampu bersaing dengan pelbagai model gambar tertutup.

Grafik penilaian Qwen-Image-Bench.
Bahagian penghasilan visual hanya mempunyai 7B parameter, menjadikan tahap kemampuan ini lebih menarik perhatian: ia mampu menggabungkan penghasilan gambar, penghasilan bahan transparan, dan penyuntingan pelbagai gambar dalam modul penghasilan yang lebih kecil (alur penghasilan dan penyuntingan terpadu), memberikan titik permulaan yang lebih ringan kepada pembangun untuk melaksanakan dan menyesuaikan alat gambar.
Sambil memberikan prestasi yang baik, Qwen-Image-2.1 juga mengoptimumkan proses inferens model, dengan idea utama mengurangkan pengiraan berulang yang tidak perlu.
Dalam satu proses penyuntingan imej, gambar rujukan dan arahan penyuntingan yang dimasukkan tidak berubah sepanjang setiap langkah penghasilan. Oleh itu, model baharu menggunakan struktur perhatian grub campuran: bahagian teks (imbuhan sistem, arahan penyuntingan) mengikuti penutup sebabiah token tradisional, melakukan pengiraan urutan yang ketat perkataan demi perkataan untuk menjamin kekonsistenan pemahaman logik semantik, manakala bahagian penghasilan imej menggunakan penutup per Chunk, serta menggunakan mekanisme KV Cache untuk menyimpan konteks statik ini selepas pengiraan langkah pertama, supaya boleh digunakan semula pada langkah penghasilan seterusnya.

Ini bermaksud bahawa AI sekarang akan memproses bahan rujukan terlebih dahulu, lalu mengulangi penggunaan hasil yang telah ada semasa menghasilkan gambar sasaran secara bertahap. Pengoptimuman ini memberi kesan yang lebih ketara apabila terdapat banyak input gambar, membantu meningkatkan kecekapan inferens dan mengurangkan beban memori GPU.
Kerana Qwen-Image-2.1 kini menyokong sehingga 10 gambar rujukan, pengoptimuman ini menjadi sangat penting. Semakin kaya kandungan input, semakin penting untuk menangani maklumat rujukan dan mengawal pengiraan berulang. Mengenai berapa banyak masa dan ingatan grafik yang boleh dijimatkan, ia masih perlu dinilai berdasarkan peranti keras, ketepatan, resolusi, dan bilangan input.
Hasilkan bahan telus yang boleh digunakan secara langsung
Kemampuan versi terbaru Qwen-Image yang paling dekat dengan keperluan reka bentuk ialah penghasilan gambar telus.
Bahan gambar biasa biasanya mempunyai latar belakang penuh. Untuk menggunakan subjeknya dalam poster, halaman butiran produk, atau gambar lain, seringkali diperlukan proses pemisahan latar belakang, pengolahan kontur, celah, dan tepi. Gambar telus mengandungi maklumat kebolehtelusan tambahan yang membolehkan latar belakang kelihatan melalui sekeliling atau sebahagian kawasan subjek, memudahkan penindihan dan penggabungan seterusnya.
Qwen-Image-2.1 menyokong penghasilan gambar transparan secara asli, boleh menentukan secara automatik sama ada gambar biasa atau gambar transparan berdasarkan arahan, pengguna boleh meminta latar belakang transparan semasa menggambarkan bahan. Contoh yang dipaparkan termasuk ilustrasi perayaan, bahan orang, elemen hiasan, serta gabungan kompleks yang terdiri daripada banyak objek—semuanya memenuhi keperluan bahan biasa dalam kerja rekaan. Kami juga telah mencuba:

Ini adalah berita baik untuk pencipta, kerana sekarang kita boleh mendapatkan bahan yang boleh digunakan terus, mengurangkan beberapa langkah kerja.
Tentu, bahan transparan ini boleh dipindahtangani selepas dihasilkan. Sebagai contoh, watak ilustrasi yang sama boleh disesuaikan ekspresinya, dan teks dalam gambar boleh diubah kandungannya. Objek suntingan boleh berupa butiran visual watak atau teks dalam bahan tersebut.
Ini sangat dekat dengan keperluan pengubah asli semasa rekaan: nama aktiviti telah ditukar, tetapi corak masih perlu dikekalkan; ekspresi perlu lebih santai, sementara watak masih perlu dikenali sebagai watak yang sama. Selepas permintaan susulan dimasukkan ke dalam model yang sama, semua keperluan ini kini mempunyai satu entri pengurusan yang seragam.
Tentu, Qwen-Image-2.1 menyokong pemprosesan gambar yang sudah ada.


Pihak rasmi memberikan contoh mengekstrak kandungan yang diperlukan daripada gambar sebenar untuk mendapatkan gambar transparan RGBA. A mewakili saluran kelegapan, yang digunakan untuk menggambarkan tahap kelegapan di setiap bahagian gambar.
Terlihat bahawa kemampuan ini melayani kedua-dua penghasilan dari sifar dan penggunaan semula gambar yang sudah ada. Pencipta boleh terlebih dahulu menyediakan gambar, kemudian meminta model untuk mengekstrak subjek yang diperlukan daripadanya sebagai bahan untuk rekaan seterusnya.
Siri Qwen-Image sebelum ini telah melancarkan Qwen-Image-Layered yang berdiri sendiri untuk mengkaji kemampuan berkaitan imej telus. Dalam Qwen-Image-2.1 ini, penghasilan dan penyuntingan imej telus asli telah diintegrasikan ke dalam model imej am, meningkatkan keselesaan lebih lanjut.
Model AI terbuka yang tepat untuk penyuntingan banyak gambar juga sudah ada
Apabila permintaan satu gambar datang daripada beberapa objek, tugas penyuntingan akan menjadi lebih kompleks.
Sebagai contoh, jika ingin memakai pakaian, kasut, beg, dan topi tertentu pada model yang sama, setiap gambar rujukan mempunyai fungsi yang berbeza, model perlu membezakan antara orang dan produk, meletakkannya pada kedudukan yang munasabah, dan sebanyak mungkin mengekalkan ciri-ciri masing-masing.
Qwen-Image-2.1 menyokong hingga 10 gambar rujukan. Kami mencuba, meminta Ultraman dan Dario duduk berbincang. Menggunakan 7 gambar: gambar dua orang berhadapan (ubah ekspresi), latar belakang ruangan, kerusi tunggal, cawan kopi (diisi kopi), lampu lantai, perapian dinding elektrik, meja rendah, dan akhirnya menghasilkan satu gambar keseluruhan yang lengkap.

Pakaian dan aksesori yang berbeza kini juga boleh dengan cepat menunjukkan kesan pakaian seseorang, dan anda kini juga boleh menggabungkan gambar individu yang berbeza menjadi gambar bersama banyak orang.
Secara teknikal, ia menguji bukan sahaja berapa banyak gambar yang boleh diterima oleh model AI, tetapi juga sama ada objek rujukan boleh berada di tempat yang betul dalam gambar akhir, dengan nisbah, kedudukan, dan gaya keseluruhan yang selari.
Setelah gambar keseluruhan disusun, biasanya akan ada penyesuaian terperinci.
Qwen-Image-2.1 menyediakan cara-cara seperti pemilihan, pengecatan, dan topeng bebas untuk membolehkan pengguna menyatakan lokasi suntingan dengan lebih jelas. Sebagai contoh, anda boleh menandakan pelbagai kawasan dengan warna yang berbeza, dan meminta satu suntingan untuk menghapuskan sebahagian pakaian orang dalam gambar serta mengubah warna rambut secara serentak.

Interaksi ini membina hubungan antara posisi ruang dan keperluan teks. Untuk pengeditan yang melibatkan beberapa kawasan, pengguna boleh menunjukkan secara berasingan di mana penghapusan diperlukan, di mana penggantian diperlukan, dan apa yang diinginkan untuk ditukar.
Cara menggosok sesuai untuk menandakan lokasi objek baru secara langsung, tetapi memilih atau menggosok secara langsung pada gambar asal juga akan menutup sebahagian gambar. Oleh itu, model juga menyokong penggunaan imej topeng tambahan untuk menentukan kawasan suntingan, membolehkan maklumat gambar asal dimasukkan ke dalam model secara lengkap. Untuk rekaan yang mengandungi orang dan produk, kemampuan mengekalkan ini sangat penting.

Kejituan teks, kualiti gambar
Walaupun gaya rambut atau latar belakang berubah, ciri-ciri identiti wajah harus tetap dipertahankan; apabila produk diletakkan dalam persekitaran yang berbeza, teks, tekstur, dan bentuk pembungkusan juga perlu serupa sebanyak mungkin. Jika tidak, walaupun gambar kelihatan menarik, ia mungkin tidak sesuai untuk tugas paparan asalnya. Qwen-Image-2.1 menekankan kemampuan pengeditan yang setia untuk dua jenis adegan—wajah dan produk—dan kesannya kelihatan agak baik.
Kami telah mencuba sedikit, contohnya meminta ia mengambil tangkapan skrin halaman ini daripada Buku Teknologi Maklumat Tahun 3, Jilid Atas, DeepSeek Selamat datang, saya adalah DeepSeek ,很高兴见到你!」改为「你好,我能帮上什么忙吗?」,并将深度思考(R1)改为最新版本的深度思考按钮,然后点亮:

Selain penghasilan dan penyuntingan, Qwen-Image-2.1 juga terus meningkatkan prestasi dalam teks dan wajah. Baik pada halaman gambar dengan teks padat, infografik, atau gambar ilustrasi kertas akademik, ketepatan kandungan dan keindahan susunan telah ditingkatkan kepada tahap yang ketara.

Dalam bahagian wajah, Qwen-Image-2.1 telah meningkatkan lagi persembahan cahaya dan butiran. Sekarang, gambar yang dihasilkan oleh AI menjadi lebih selari dalam hal rambut, tekstur pakaian, butiran muka, dan cahaya persekitaran, dengan kualiti gambar yang lebih halus.
Selain itu, terdapat kemampuan yang lebih baik dalam menghasilkan pemandangan luas, infografik, pandangan tiga sisi, dan gambar storyboard, yang memperluas jangkauan aplikasi penghasilan dan penyuntingan gambar statik, memberikan lebih banyak kemungkinan untuk tugas-tugas seperti pameran watak dan perancangan visual. Kami telah mencuba, menggunakan imej Qwen buatan komuniti untuk menghasilkan siri ilustrasi storyboard:

Kombinasi kemampuan ini membolehkan Qwen-Image-2.1 menutupi rantai pemprosesan imej yang lebih lengkap; kini kita boleh menyelesaikan banyak tugas berdasarkan satu model AI—mengatur adegan menggunakan beberapa gambar rujukan, kemudian menyesuaikan kawasan sambil mempertahankan ciri-ciri utama orang dan produk. Sejauh mana pengurangan kerja semula yang boleh dicapai oleh AI sumber terbuka dengan hanya 7B untuk bahagian penghasilan visual akan menjadi isu yang perlu diperhatikan dalam ujian sebenar seterusnya.
Berapa besar ruang aplikasi?
Pelancaran Qwen-Image-2.1 memperlihatkan bahawa model imej sedang merangkumi lebih banyak tahap terperinci dalam proses kreatif, dan tren ini semakin mempercepat.
Kenaikan dalam kemampuan output bahan transparan, rujukan banyak gambar, penyuntingan tempatan dan ketepatan meningkatkan kemungkinan model AI memasuki alur kerja sebenar. Bagi pencipta, ini bermakna lebih banyak kerja penghasilan dan penyesuaian bahan boleh diserahkan kepada model gambar sumber terbuka dengan cara yang lebih mudah; manakala bagi pembangun, pembukaan sumber model baharu memberikan asas baharu untuk membina alat reka bentuk, aplikasi, dan alur kerja tersuai berdasarkan kemampuan ini.
Kita boleh meramal dengan berani bahawa dengan pembukaan sumber model gambar seperti Qwen-Image-2.1, komuniti akan terus mengintegrasikan kemampuan penghasilan dan penyuntingan ke dalam lebih banyak skenario pembuatan kandungan, membolehkan lebih ramai orang menggunakan alat kreatif yang sesuai dengan keperluan mereka. Apabila kemampuan AI ini menjadi fungsi yang boleh digunakan dengan mudah dalam perisian harian, rintangan dari idea kepada karya visual mungkin sekali akan berkurang secara besar-besaran sekali lagi.
Sekarang, bobot terbuka Qwen-Image-2.1 telah diterbitkan di Hugging Face dan ModelScope, dan laporan teknikal telah diunggah ke repositori GitHub.
Blog: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Lingkup Model: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
Artikel ini berasal daripada akaun微信公众号 "Machine Heart" (ID: almosthuman2014), penulis: Zeanan
