Qwen-Image-2.1, Geliştirilmiş Düzenleme ve Şeffaflık ile En Üst Düzey Açık Kaynak Görüntü Oluşturucu Oluyor

icon MarsBit
Paylaş
AI summary iconÖzet
Alibaba'nın Qwen'i, açık kaynak modeller arasında birinci sırada yer alan Qwen-Image-2.1 adlı bir açık kaynak görüntü oluşturucu çıkardı. 7 milyar parametreli bu araç, şeffaf üretimi, çoklu referans düzenleme ve yerel incelemeyi destekliyor. Benchmark testlerinde Nano Banana 2.0'ı geçiyor ve optimize edilmiş çıkarım yoluyla verimliliği artırıyor. Likidite ve kripto piyasaları gelişirken, CFT gibi düzenleyici araçlar popülerlik kazanıyor. Qwen'in çıkışı, açık kaynak AI şeffaflığı yönündeki çabaya katkı sağlıyor.

Yapay zeka, kod yazma yeteneğiyle geliştiricilerin "ellerini klavyeden kaldırmasına" sıklıkla olanak tanır, ancak tasarımcılar için AI tarafından oluşturulan görseller, teslim edilebilir duruma gelmek için hâlâ birkaç adım ötededir.

Görsel tasarım iş akışında, karakterlerin arka planından çıkarılması, malzemelerin metinlerinin değiştirilmesi ve çeşitli ürünlerin konumlarının ara sıra ayarlanması gerekir; ancak ambalajdaki yazılar ve şişenin şekli değişmemelidir. Gereksinimler sürekli değişirse, tüm görselin uyumlu kalması için yerel değişiklikler yapmaya devam edilmelidir.

Bu detaylar, AI tabanlı görsel oluşturma işleminin gerçek yaratıcı süreçlere girmesini belirler. Tasarımcılar, e-ticaret operatörleri ve içerik üreticileri için günümüzde görsel modellerinin sınırlaması, her bir değiştirme talimatının doğru şekilde tamamlanabilmesidir.

Bu hafta Pazar,阿里 Qwen Qwen-Image-2.1 resim üretme modeli resmi olarak açık kaynak hale getirildi; küçük boyutlu bir model olarak çoğu üretkenlik sorununu çözdü: metinden resme ve resim düzenleme işlevlerini birleştirdi, şeffaf resim oluşturmaya doğrudan destek veriyor, en fazla 10 referans resmi kabul edebiliyor ve lokal düzenleme, portre ve ürün sadakatini daha da güçlendirdi.

Qwen

O, oldu Qwen Görsel serisi, şu anda en dengeli ve maliyet-etkin açık kaynak görsel oluşturma modelidir. Açık değerlendirmeler, Qwen-Image-2.1'in açık kaynak modeller arasında birinci olduğunu ve Nano Banana 2.0'ı bile aşan puanlar aldığını göstermektedir. Bu modelin görsel üretme kısmının parametre sayısı sadece 7B'dir.

X gibi platformlarda erken erişim hakkı kazanan kullanıcılar, oluşturulan sonuçları paylaştı ve büyük ilgi gördü. Çok sayıda metin içeren ekran görüntüleri yer aldı:

Qwen

Gerçek fotoğraf kalitesinde resimler oluşturun:

Qwen

Aynı zamanda çeşitli filtre ve ışık stillerini denemek de vardır:

Qwen

Qwen-Image-2.1, komut takibi, çekim başarı oranı ve gerçek etki açısından etkileyici olarak kabul ediliyor. Yeni modelin yeteneklerine dayanarak, materyal oluşturma, birleştirme ve düzenleme iş akışlarını birleştirebiliyor ve AI ile birçok karmaşık fotoğraf düzenleme sorununu çözebiliyoruz.

Yetenek ve verimlilik

Qwen-Image-2.1'in görsel üretimi, 20 katmanlı Single-Stream DiT kullanarak 7B parametre ile oluşturulmuştur ve doğrudan 2K desteği sunar. Bu model, değerlendirme standartlarında boyutundan daha yüksek bir performans göstermiştir: Qwen-Image-2.1'in toplam puanı 60,28'dir. Buna karşılık, Nano Banana 2.0 için bu değer 59,82 ve GPT Image 1.5 için 59,65'tir. Zaten birçok kapalı kaynaklı görsel modelle rekabet edebilmektedir.

Qwen

Qwen-Image-Bench değerlendirme grafiği.

Görsel oluşturma bölümü yalnızca 7B parametre içeriyor ve bu da böyle bir yetenek seviyesini daha da dikkat çekici hale getiriyor: Küçük bir oluşturma modülünde aynı anda görsel üretme, şeffaf malzeme oluşturma ve çoklu görsel düzenleme yeteneklerini (üretim ve düzenleme için tek bir pipeline) bir araya getiriyor; bu da geliştiriciler için görsel araçları dağıtma ve özelleştirme konusunda daha hafif bir başlangıç noktası sunuyor.

Performansı iyi olurken, Qwen-Image-2.1 aynı zamanda modelin çıkarım sürecini optimize etti, temel fikir gereksiz tekrarlı hesaplamaları azaltmaktır.

Bir görüntü düzenleme işlemi sırasında, girilen referans görüntüsü ve düzenleme talimatları her bir üretim adımında değişmez. Bu nedenle, yeni model, karışık incelikte dikkat yapısını kullanır; metin kısmı (sistem öneki, düzenleme talimatları) geleneksel Token düzeyi nedeni maskesi takip eder ve anlamsal mantık anlayışının tutarlılığını sağlamak için kelimeler bazında katı bir sıra hesaplaması yapar; görüntü üretimi kısmı ise Chunk düzeyinde maskelenir ve KV Cache mekanizması aracılığıyla ilk adımda hesaplanan bu statik bağlamlar önbelleğe alınır ve sonraki üretim adımları tarafından yeniden kullanılır.

Qwen

Bu, AI'nın artık referans materyalleri önceden işleyip, hedef görselleri adım adım oluştururken mevcut sonuçları yeniden kullanmasını anlamına gelir; bu optimizasyon, çoklu görsel girişi olan durumlarda daha belirgin bir etki gösterir ve çıkarım verimliliğini artırır, GPU belleği tüketimini azaltır.

Şu anda Qwen-Image-2.1 en fazla 10 referans resmi desteklediği için bu optimizasyon çok önemlidir. Girdi ne kadar zenginse, referans bilgilerini nasıl işleyeceğiniz ve tekrarlı hesaplamaları nasıl kontrol edeceğiniz o kadar dikkat çekicidir. Tam olarak ne kadar zaman ve GPU belleği tasarruf edileceği, donanım, hassasiyet, çözünürlük ve girdi sayısı ile ilgilidir.

Doğrudan kullanıma hazır şeffaf malzeme oluşturun

Yeni Qwen-Image sürümünün tasarım ihtiyaçlarına en yakın yeteneği, şeffaf görsel oluşturmaktır.

Standart görsel malzemeler genellikle tam arka plana sahiptir. Bunların ana nesnelerini pano, ürün detay sayfası veya başka bir görselde kullanmak için genellikle öncelikle arka planı çıkarmak, konturları, boşlukları ve kenarları işlemek gerekir. Şeffaf görseller ise, arka planın ana nesnenin etrafında veya bazı bölgelerde görünmesini sağlayan ek şeffaflık bilgilerini içerir ve daha sonra üst üste yerleştirme ve birleştirme işlemlerini kolaylaştırır.

Qwen-Image-2.1, şeffaf görüntülerin doğrudan oluşturulmasını destekler ve talimatlarla otomatik olarak normal bir resim mi yoksa şeffaf bir resim mi üretileceğine karar verir. Kullanıcılar, malzeme tanımlarında şeffaf arka plan isteğinde bulunabilir. Şu anda gösterilen örnekler, festivallere ait illüstrasyonlar, karakter malzemeleri, dekoratif unsurlar ve birden fazla nesneden oluşan karmaşık kombinasyonlardır; bunların hepsi tasarım çalışmalarında sıkça karşılaşılan malzeme ihtiyaçlarına karşılık gelir. Aşağıdaki denemeyi de yaptık:

Qwen

Yaratıcılar için iyi bir haber, artık doğrudan kullanılabilir malzemelere sahip olabiliyoruz ve işler doğrudan birkaç aşamadan kurtuluyor.

Elbette, bu şeffaf malzemeler oluşturulduktan sonra da düzenlenebilir. Örneğin, aynı resim karakterinin ifadesi değiştirilebilir, resimdeki metin içeriği güncellenebilir. Düzenlenecek nesne, karakterin görsel detayları olabileceği gibi malzemede yer alan metinler de olabilir.

Bu, tasarım sırasında gerçek değişiklik gereksinimlerine çok yakındır: etkinlik adı değiştirildi, ancak görsel hala korunmalıdır; ifadeler daha hafif olmalı, karakterler aynı kişi olarak tanınabilir olmalıdır. Üretim ve düzenleme aynı modele dahil edildikten sonra, bu sonraki talepler için tek bir tutarlı işlenme noktası oluşturuldu.

Elbette, Qwen-Image-2.1, mevcut fotoğrafları işlemeyi destekler.

Qwen

Qwen

Resmi fotoğraflardan gerekli içerikleri çıkararak RGBA şeffaf görüntüler elde etme örneği resmi olarak verilmiştir. Buradaki A, şeffaflık kanalını temsil eder ve görüntünün her yerindeki şeffaflık düzeyini tanımlar.

Görüldüğü gibi, bu yetenek sıfırdan oluşturmaya hizmet ederken, mevcut resimlerin yeniden kullanımını da kapsar. Oluşturucular, önce bir fotoğraf sağlayabilir ve ardından modelden gerekli nesneleri çıkararak sonraki tasarım için malzeme oluşturmasını isteyebilir.

Qwen-Image serisi daha önce bağımsız Qwen-Image-Layered'i tanıtarak şeffaf görsellerle ilgili yetenekleri araştırmıştı. Bu sefer Qwen-Image-2.1, şeffaf görsel üretimi ve düzenlemeyi genel görsel modele entegre ederek kolaylığı daha da artırmaktadır.

Çoklu resim düzenleme için doğru, açık kaynaklı AI modelleri de mevcut.

Bir görselin talebi birden fazla nesne tarafından geldiğinde, düzenleme görevi daha da karmaşıklaşır.

Örneğin, belirli bir giysi, ayakkabı, çanta ve şapka aynı model üzerine giydirilmek istenirse, her referans görüntüsünün farklı bir rolü vardır ve model, kişiyi üründen ayırmalı, bunları uygun yerlere yerleştirmeli ve mümkün olduğunca her birinin özelliklerini korumalıdır.

Qwen-Image-2.1, en fazla 10 referans görsel girişi destekler. Otoman ve Dario'nun oturup konuşmasını denedik. 7 görsel kullanıldı: iki kişinin karşı karşıya geldiği fotoğraf (ifade değiştirildi), arka plan odası, tek kişilik koltuk, kahve fincanı (kahve dolduruldu), yere monte edilen lamba, elektrikli şömine, düşük masa; nihayetinde tam bir efekt görseli oluşturuldu.

Qwen

Farklı giyim eşyalarını şimdi hızlıca bir kişinin giyim görünümüne uygulayabilirsiniz. Aynı zamanda farklı tekil fotoğrafları birleştirerek çoklu fotoğraf oluşturabilirsiniz.

Teknik olarak, bunlar yalnızca AI modelinin kaç resim girişi alabileceğini değil, referans nesnelerinin son görüntüde doğru oranda, konumda ve genel stilde yerini alıp alamayacağını da test eder.

Toplu görüntü oluşturuldu, ardından genellikle ayrıntılı ayarlamalar yapılır.

Qwen-Image-2.1, kullanıcıların düzenleme konumunu daha net ifade etmeleri için seçim, boyama ve bağımsız maskeleme gibi yöntemler sunar. Örneğin, farklı bölgeleri farklı renklerle işaretleyerek bir fotoğraftaki kişinin giysilerini aynı anda kaldırıp saç rengini değiştirmenizi isteyebilirsiniz.

Qwen

Bu etkileşim, mekansal konum ile metin gereksinimleri arasında bir ilişki kurar. Çoklu bölgeleri içeren düzenlemelerde, kullanıcılar nereden silineceğini, nereden değiştirileceğini ve neyle değiştirilmek istediğini ayrı ayrı belirtebilir.

Yöntem, yeni nesnelerin konumlarını doğrudan işaretlemek için uygundur, ancak orijinal resim üzerinde doğrudan daire çizmek veya boyamak, görüntünün bir kısmını gizleyebilir. Bu nedenle, model, düzenleme bölgesini belirlemek için ek bir maske resmi kullanmayı da destekler; bu sayede orijinal resmin tüm bilgileri modele tam olarak sağlanır. İnsanlar ve ürünler içeren tasarımlar için bu koruma yeteneği özellikle kritiktir.

Qwen

Metin doğruluğu, ekran kalitesi

Saç stili veya sahne değiştirildiğinde, portre hala orijinal kimlik özelliklerini korumalıdır; ürünün konum ortamı değiştirildiğinde, ambalaj metni, dokusu ve şekli mümkün olduğunca tutarlı olmalıdır. Aksi takdirde, görüntü ne kadar güzel olursa olsun, orijinal gösterim görevi için kullanılamaz. Qwen-Image-2.1, portre ve ürün türü sahnelerin düzenleme tutarlılığını vurgulamaktadır ve görünüş olarak iyi sonuçlar vermektedir.

Bir deneme yaptık, örneğin ilkokul 3. sınıf Bilgi Teknolojisi ders kitabının bu sayfasının ekran görüntüsünü içine alarak, DeepSeek Hoş geldiniz, ben DeepSeek Merhaba, nasıl yardımcı olabilirim? Derinlemesine Düşünme (R1) butonunu en son sürümüne güncelleyin ve etkinleştirin:

Qwen

Üretim ve düzenleme dışında, Qwen-Image-2.1 metin ve insan figürleri üzerindeki performansını da geliştirmeye devam etti. Metin yoğun görsel sayfalar, bilgi grafikleri ve makale görsellerinde, içerik doğruluğu ve düzenlemelerin estetik kalitesi önemli ölçüde artırıldı.

Qwen

Yüz portreleri kısmında, Qwen-Image-2.1 ışık ve detay gösterimini daha da geliştirdi. Artık AI tarafından oluşturulan görüntülerde, kişinin saç telleri, kıyafet dokuları, yüz detayları ve çevre ışığı daha uyumlu hale gelmiş, görüntü kalitesi daha ince bir hale gelmiştir.

Ayrıca daha iyi bir panormik görüntü, infografik, üç görünüş ve sahne çizimi oluşturma yeteneği de mevcuttur; bu yetenekler, statik görüntü oluşturma ve düzenleme uygulamalarını genişleterek karakter gösterimi, görsel planlama gibi görevler için daha fazla imkan sunar. Topluluk tarafından oluşturulan Qwen anime karakterini kullanarak bir dizi sahne çizimi denedik:

Qwen

Bu yeteneklerin bir araya gelmesiyle Qwen-Image-2.1, daha tam bir görsel işleme zincirini kapsıyor; şimdi bir AI modeli üzerinden çok sayıda referans görsel kullanarak sahneyi organize edebiliyor, bölgeleri ayarlayabiliyor ve aynı zamanda karakterlerin ve ürünlerin kritik özelliklerini koruyabiliyor. Sadece 7B görsel üretme kısmına sahip bir açık kaynak AI'nın geri dönüşümleri ne kadar azaltabileceğinin, sonraki gerçek dünya testlerinde dikkat edilmesi gereken bir sorun olacak.

Uygulama alanının boyutu nedir?

Qwen-Image-2.1'in piyasaya sürülmesi, görüntü modellerinin yaratım sürecinin daha fazla detaylı aşamasını kapsadığını ve bu eğilimin giderek hızlandığını gösteriyor.

Şeffaf materyal çıkışı, çoklu referans resimler, kısmi düzenleme ve sadakat yeteneklerindeki iyileştirmeler, AI modellerinin gerçek iş akışlarına girmesini artırıyor. Yaratıcılar için, bu, daha fazla materyal üretimi ve ayarlamasının daha basit bir şekilde açık kaynaklı görsel oluşturma modellerine bırakılması anlamına geliyor; geliştiriciler için ise yeni modelin açık kaynak olması, bu yetenekler etrafında tasarım araçları, uygulamalar ve özelleştirilmiş iş akışları oluşturmak için yeni bir temel sunuyor.

Qwen-Image-2.1 gibi görsel modellerin açık kaynak olmasıyla, topluluk üretme ve düzenleme yeteneklerini daha fazla içerik oluşturma senaryosuna entegre edecek ve daha fazla kişi kendi ihtiyaçlarına uygun yaratım araçlarını kullanabilecek. Bu AI yetenekleri günlük yazılımlarda kolayca erişilebilir hale geldiğinde, fikirden görsel bir esere geçişin engeli tekrar büyük ölçüde düşebilir.

Şu anda, Qwen-Image-2.1'in açık ağırlıkları Hugging Face ve ModelScope'a yayınlanmıştır ve teknik rapor GitHub deposuna yüklenmiştir.

Blog: https://qwen.ai/blog?id=qwen-image-2.1

GitHub: https://github.com/QwenLM/Qwen-Image-2.1

Model Kapsamı: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1

Bu yazı, WeChat hesabından "Makine Kalbi" (ID: almosthuman2014) tarafından yazılmıştır, yazar: Zeynan

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.