Qwen-Image-2.1 Menjadi Generator Gambar Open-Source Teratas dengan Peningkatan Pengeditan dan Transparansi

icon MarsBit
Bagikan
AI summary iconRingkasan
Qwen dari Alibaba telah meluncurkan Qwen-Image-2.1, sebuah generator gambar open-source yang menempati peringkat pertama di antara model-model open-source. Alat dengan 7 miliar parameter ini mendukung generasi transparan, pengeditan multi-referensi, dan penyempurnaan lokal. Qwen-Image-2.1 unggul dibanding Nano Banana 2.0 dalam benchmark dan meningkatkan efisiensi melalui inferensi yang dioptimalkan. Seiring perkembangan likuiditas dan pasar kripto, alat regulasi seperti CFT semakin populer. Peluncuran Qwen menambah dorongan untuk transparansi AI open-source.

Kemampuan AI dalam menulis kode sering memungkinkan pengembang untuk 'melepaskan tangan dari keyboard', tetapi bagi desainer, gambar yang dihasilkan AI masih jauh dari siap untuk diserahkan.

Dalam alur kerja desain gambar, tokoh perlu dipisahkan dari latar, bahan perlu diubah teksnya, dan penataan berbagai produk perlu disesuaikan sesekali, tetapi teks pada kemasan dan bentuk botol tidak boleh berubah. Jika permintaan terus berubah dan perlu dilakukan perubahan lokal terus-menerus agar keseluruhan gambar tetap koheren.

Detail-detail ini menentukan apakah gambar AI dapat memasuki proses kreatif yang sebenarnya. Bagi desainer, operator e-commerce, dan pencipta konten, saat ini hambatan pada model gambar terletak pada apakah setiap instruksi perubahan yang diajukan dapat diselesaikan dengan akurat.

Minggu ini, Alibaba Qwen Merilis secara resmi model generasi gambar Qwen-Image-2.1 sebagai model kecil yang menyelesaikan sebagian besar tantangan produktivitas: model ini menggabungkan teks-ke-gambar dan pengeditan gambar dalam satu sistem, mendukung secara native pembuatan gambar transparan, menerima hingga 10 gambar referensi, serta memperkuat pengeditan lokal, keakuratan wajah, dan produk.

Qwen

It became Qwen Model generasi gambar ini saat ini merupakan model open-source paling seimbang dan paling hemat biaya. Hasil evaluasi publik menunjukkan bahwa Qwen-Image-2.1 menduduki peringkat pertama di antara model open-source, dengan skor bahkan melebihi Nano Banana 2.0. Perlu diketahui, jumlah parameter pada bagian generasi visual model ini hanya 7B.

Di platform seperti X, pengguna yang telah mendapatkan akses awal telah membagikan hasil generasinya, mendapat banyak pujian. Ada tangkapan layar dengan konten teks yang sangat banyak:

Qwen

Menghasilkan gambar dengan kualitas foto nyata:

Qwen

Juga mencoba berbagai filter dan gaya pencahayaan yang berbeda:

Qwen

Orang-orang menganggap Qwen-Image-2.1 sangat mengesankan dalam hal kepatuhan terhadap perintah, tingkat keberhasilan tarikan, serta efek nyata. Berdasarkan kemampuan model baru ini, kami kini dapat menghubungkan alur kerja generasi, kombinasi, dan modifikasi bahan, menggunakan AI untuk menyelesaikan banyak masalah pengeditan gambar yang kompleks.

Kemampuan dan efisiensi

Diketahui bahwa bagian generasi visual Qwen-Image-2.1 menggunakan Single-Stream DiT dengan 20 lapisan, memiliki 7 miliar parameter, dan secara native mendukung resolusi 2K. Model ini mencapai kinerja di atas ukurannya dalam benchmark: total skor Qwen-Image-2.1 adalah 60,28. Sebagai perbandingan, Nano Banana 2.0 mendapat skor 59,82 dan GPT Image 1.5 mendapat skor 59,65. Model ini sudah mampu bersaing dengan berbagai model gambar tertutup lainnya.

Qwen

Grafik evaluasi Qwen-Image-Bench.

Bagian generasi visual hanya memiliki 7B parameter, membuat kemampuan ini semakin menarik: ia secara bersamaan menyediakan kemampuan generasi gambar, generasi elemen transparan, dan pengeditan multi-gambar (pipelines generasi dan pengeditan terpadu), memberikan titik awal yang lebih ringan bagi pengembang dalam menerapkan dan menyesuaikan alat gambar.

Sambil mempertahankan kinerja yang baik, Qwen-Image-2.1 juga mengoptimalkan proses inferensi model, dengan pendekatan inti mengurangi perhitungan berulang yang tidak perlu.

Dalam sebuah proses pengeditan gambar, gambar referensi dan instruksi pengeditan yang dimasukkan tidak berubah seiring setiap langkah generasi. Oleh karena itu, model baru menggunakan struktur perhatian campuran tingkat granularitas: bagian teks (prefiks sistem, instruksi pengeditan) mengikuti masking kausal tingkat token tradisional, melakukan perhitungan urutan ketat kata demi kata untuk memastikan konsistensi pemahaman logika semantik, sementara bagian generasi gambar menggunakan masking tingkat chunk dan memanfaatkan mekanisme KV Cache untuk menyimpan konteks statis ini setelah perhitungan langkah pertama, sehingga dapat digunakan kembali pada langkah-langkah generasi berikutnya.

Qwen

Ini berarti AI sekarang akan terlebih dahulu memproses bahan referensi, lalu memanfaatkan hasil yang sudah ada secara berulang saat menghasilkan gambar target secara bertahap. Optimasi ini memiliki efek yang lebih jelas saat menggunakan beberapa input gambar, membantu meningkatkan efisiensi inferensi dan mengurangi beban memori GPU.

Karena Qwen-Image-2.1 sekarang mendukung hingga 10 gambar referensi, optimasi ini menjadi sangat penting. Semakin kaya konten input, semakin penting untuk memahami cara menangani informasi referensi dan mengendalikan perhitungan berulang. Mengenai seberapa besar waktu dan memori GPU yang dapat dihemat, perlu dipertimbangkan berdasarkan perangkat keras, presisi, resolusi, dan jumlah input.

Hasilkan bahan transparan yang siap pakai

Kemampuan Qwen-Image versi baru yang paling mendekati kebutuhan desain adalah generasi gambar transparan.

Bahan gambar biasa biasanya memiliki latar belakang lengkap. Untuk menggunakan subjeknya pada poster, halaman detail produk, atau gambar lain, seringkali diperlukan proses penghapusan latar belakang terlebih dahulu, termasuk pemrosesan kontur, celah, dan tepi. Gambar transparan menyertakan informasi transparansi tambahan yang memungkinkan latar belakang tampak muncul di sekitar atau sebagian area subjek, sehingga memudahkan penumpukan dan penggabungan selanjutnya.

Qwen-Image-2.1 secara native mendukung pembuatan gambar transparan, dapat secara otomatis menentukan apakah gambar yang dihasilkan adalah gambar biasa atau gambar transparan berdasarkan petunjuk; pengguna dapat langsung meminta latar belakang transparan saat menggambarkan elemen. Contoh yang ditampilkan mencakup ilustrasi perayaan, elemen karakter, elemen dekoratif, serta kombinasi kompleks yang terdiri dari beberapa objek—semuanya sesuai dengan kebutuhan elemen desain yang umum. Kami juga mencoba:

Qwen

Ini adalah kabar baik bagi para kreator, sekarang kita bisa mendapatkan bahan yang siap pakai, sehingga mengurangi beberapa langkah kerja.

Tentu, bahan transparan ini dapat terus dimodifikasi setelah dibuat. Misalnya, karakter ilustrasi yang sama dapat menyesuaikan ekspresinya, dan teks dalam gambar dapat diubah isinya. Objek yang diedit bisa berupa detail visual karakter maupun teks dalam bahan tersebut.

Ini sangat dekat dengan kebutuhan revisi asli saat desain: nama kegiatan diubah, tetapi pola tetap harus dipertahankan; ekspresi harus lebih santai, sementara karakter tetap harus dapat diidentifikasi sebagai tokoh yang sama. Setelah permintaan lanjutan ini dimasukkan ke dalam model yang sama, semua permintaan tersebut kini memiliki titik masuk pemrosesan yang terpadu.

Of course, Qwen-Image-2.1 supports processing existing photos.

Qwen

Qwen

Pihak resmi memberikan contoh ekstraksi konten yang diperlukan dari foto asli untuk mendapatkan gambar transparan RGBA. A mewakili saluran transparansi, yang digunakan untuk menggambarkan tingkat transparansi di berbagai bagian gambar.

Terlihat bahwa kemampuan ini melayani baik pembuatan dari nol maupun pemanfaatan ulang gambar yang sudah ada. Kreator dapat terlebih dahulu menyediakan foto, lalu meminta model untuk mengekstrak subjek yang dibutuhkan sebagai bahan untuk desain selanjutnya.

Sebelumnya, seri Qwen-Image pernah meluncurkan Qwen-Image-Layered yang terpisah untuk mengeksplorasi kemampuan terkait gambar transparan. Kini, Qwen-Image-2.1 mengintegrasikan generasi dan pengeditan gambar transparan secara native ke dalam model gambar umum, sehingga meningkatkan kenyamanan lebih lanjut.

Model AI terbuka yang akurat juga tersedia untuk pengeditan multi-gambar

Ketika permintaan sebuah gambar berasal dari beberapa objek, tugas pengeditan menjadi semakin kompleks.

Misalnya, jika ingin mengenakan pakaian, sepatu, tas, dan topi tertentu pada model yang sama, setiap gambar referensi memiliki peran berbeda, sehingga model perlu membedakan antara orang dan produk, menempatkannya pada posisi yang tepat, serta mempertahankan fitur masing-masing sebanyak mungkin.

Qwen-Image-2.1 mendukung hingga 10 gambar referensi. Kami mencobanya, meminta Ultraman dan Dario duduk berbincang. Menggunakan 7 gambar: foto dua orang saling berhadapan (ubah ekspresi), latar ruangan, kursi tunggal, cangkir kopi (diisi kopi), lampu lantai, perapian listrik, meja rendah, menghasilkan gambar efek akhir yang lengkap.

Qwen

Sekarang, berbagai pakaian juga dapat dengan cepat menampilkan efek gaya berpakaian seseorang, dan Anda juga dapat menggabungkan foto tunggal menjadi foto bersama beberapa orang.

Secara teknis, mereka menguji tidak hanya seberapa banyak gambar yang dapat diterima oleh model AI, tetapi juga apakah objek referensi dapat berada di posisi yang tepat dalam gambar akhir, dengan proporsi, posisi, dan gaya keseluruhan yang koheren.

Setelah menyusun gambar keseluruhan, biasanya dilanjutkan dengan penyesuaian bagian-bagian tertentu.

Qwen-Image-2.1 menyediakan berbagai cara seperti pemilihan, penggoresan, dan masker independen untuk membantu pengguna lebih jelas menyatakan lokasi pengeditan. Misalnya, Anda dapat menandai berbagai area dengan warna berbeda dan meminta perubahan sekaligus, seperti menghapus bagian pakaian tokoh dalam foto serta mengubah warna rambut.

Qwen

Interaksi ini menciptakan hubungan antara posisi spasial dan permintaan teks. Untuk pengeditan yang melibatkan beberapa area, pengguna dapat secara terpisah menunjukkan di mana perlu dihapus, di mana perlu diganti, dan apa yang diinginkan sebagai penggantinya.

Metode menggambar cocok untuk secara langsung menandai lokasi objek baru, tetapi memilih atau menggambar langsung di gambar asli juga akan menutupi sebagian gambar. Untuk itu, model juga mendukung penggunaan gambar masker tambahan untuk menentukan area pengeditan, sehingga informasi gambar asli dapat dimasukkan ke dalam model secara utuh. Kemampuan untuk mempertahankan informasi ini sangat penting untuk desain yang mencakup orang dan produk.

Qwen

Akurasi teks, kualitas gambar

Meskipun gaya rambut atau latar belakang diubah, fitur identitas wajah harus tetap dipertahankan; ketika produk ditempatkan di lingkungan baru, teks kemasan, tekstur, dan bentuknya juga perlu tetap konsisten sebanyak mungkin. Jika tidak, gambar meskipun terlihat menarik, mungkin tidak dapat digunakan untuk tugas tampilan aslinya. Qwen-Image-2.1 secara khusus menekankan kemampuan pemeliharaan keakuratan dalam pengeditan wajah dan produk, dan hasilnya tampak cukup baik.

Kami mencoba beberapa hal, misalnya meminta agar mengambil tangkapan layar halaman ini dari Buku Teknologi Informasi Kelas 3 Semester 1 sekolah dasar, DeepSeek Selamat datang, saya adalah DeepSeek , senang bertemu denganmu!」 menjadi 'Halo, ada yang bisa saya bantu?', lalu ganti Deep Thinking (R1) dengan tombol Deep Thinking versi terbaru, dan nyalakan:

Qwen

Selain generasi dan pengeditan, Qwen-Image-2.1 juga terus meningkatkan kinerja dalam teks dan karakter. Baik pada halaman gambar dengan teks padat, infografis, maupun ilustrasi makalah, akurasi konten dan keindahan tata letak telah ditingkatkan secara signifikan.

Qwen

Pada bagian potret, Qwen-Image-2.1 secara lebih lanjut meningkatkan representasi cahaya dan detail. Sekarang, gambar yang dihasilkan AI menjadi lebih selaras dalam hal rambut orang, tekstur pakaian, detail wajah, serta cahaya lingkungan, dengan kualitas gambar yang lebih halus.

Selain itu, ada kemampuan generasi pemandangan luas, infografis, tiga tampilan, dan gambar storyboard yang lebih baik, yang memperluas cakupan aplikasi generasi dan pengeditan gambar statis, memberikan lebih banyak kemungkinan untuk tugas-tugas seperti pemajangan karakter dan perencanaan visual. Kami mencobanya, menggunakan karakter Qwen buatan komunitas untuk menghasilkan serangkaian ilustrasi storyboard:

Qwen

Kombinasi kemampuan-kemampuan ini memungkinkan Qwen-Image-2.1 mencakup rantai pemrosesan gambar yang lebih lengkap; sekarang kita dapat menyelesaikan sejumlah besar pekerjaan berdasarkan satu model AI, yaitu dengan mengatur adegan menggunakan beberapa gambar referensi, lalu menyesuaikan area tertentu, sambil tetap mempertahankan fitur kunci tokoh dan produk. Seberapa besar pengurangan revisi yang dapat dicapai oleh AI open-source dengan hanya 7B parameter pada bagian generasi visual akan menjadi pertanyaan penting yang perlu diuji secara praktis di masa mendatang.

Seberapa besar ruang aplikasi?

Peluncuran Qwen-Image-2.1 menunjukkan bahwa model gambar semakin mencakup lebih banyak tahap halus dalam proses kreatif, dan tren ini semakin mempercepat.

Baik peningkatan dalam output bahan transparan, referensi multi-gambar, kemampuan pengeditan lokal, maupun keakuratan meningkatkan kemungkinan penerapan model AI dalam alur kerja nyata. Bagi pencipta, ini berarti lebih banyak pekerjaan pembuatan dan penyesuaian bahan dapat diselesaikan dengan cara yang lebih sederhana melalui model generasi gambar open-source; sementara bagi pengembang, peluncuran model baru secara open-source juga memberikan dasar baru untuk membangun alat desain, aplikasi, dan alur kerja khusus berdasarkan kemampuan-kemampuan ini.

Kita bisa dengan berani memprediksi bahwa seiring dengan open-source-nya model gambar seperti Qwen-Image-2.1, komunitas akan semakin mengintegrasikan kemampuan generasi dan pengeditan ke dalam lebih banyak skenario pembuatan konten, sehingga lebih banyak orang dapat menggunakan alat kreatif yang sesuai dengan kebutuhan mereka. Ketika kemampuan AI ini menjadi fitur yang tersedia secara instan di perangkat lunak sehari-hari, hambatan dari ide hingga karya visual mungkin sekali lagi dapat diturunkan secara signifikan.

Saat ini, bobot terbuka Qwen-Image-2.1 telah dirilis di Hugging Face dan ModelScope, dan laporan teknis telah diunggah ke repositori GitHub.

Blog: https://qwen.ai/blog?id=qwen-image-2.1

GitHub: https://github.com/QwenLM/Qwen-Image-2.1

Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1

Artikel ini berasal dari akun WeChat "Machine Heart" (ID: almosthuman2014), penulis: Zeanan

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.