AIがコードを書く能力は、開発者に「両手をキーボードから離す」ことをよく可能にするが、デザイナーにとっては、AIが生成した画像が納品可能なレベルに達するまでにはまだ数段階の距離がある。
画像デザインのワークフローでは、人物の切り抜き、素材の文字変更、各種商品の配置の都度調整が必要ですが、パッケージの文字やボトルの形状は変更してはなりません。要望が繰り返し変わる場合、部分的な修正を継続して行い、全体のバランスを保つ必要があります。
これらの詳細が、AI画像生成が本格的な制作プロセスに入れるかどうかを決定します。デザイナー、EC運営、コンテンツクリエイターにとって、現在の画像モデルのボトルネックは、毎回の修正指示が正確に実行できるかどうかにあります。
今週日曜日、阿里 Qwen 正式にオープンソース化された画像生成モデル Qwen-Image-2.1 は、小規模モデルの規模でほとんどの生産性の課題を解決します。テキストから画像生成と画像編集を一体化し、透明画像のネイティブ対応を実現。最大10枚の参照画像を受け付け、局部編集、人物および商品の忠実度をさらに強化しました。

それは成了 Qwen 現在、画像シリーズで最もバランスが取れ、コストパフォーマンスが最高のオープンソース画像生成モデルです。公開評価結果によると、Qwen-Image-2.1はオープンソースモデルで第1位となり、Nano Banana 2.0を上回るスコアを記録しました。このモデルの視覚生成部分のパラメータ数はわずか7Bであることをご理解ください。
Xなどのプラットフォームで、事前に体験資格を取得したユーザーが生成結果を公開し、好評を博しています。大量のテキストを含むイメージが掲載されています:

リアルな写真質感の画像を生成:

さまざまなフィルターと照明スタイルを試したこともあります:

Qwen-Image-2.1は、指示の順守、ガチャの成功確率、実際の効果において非常に印象的であると評価されています。新モデルの能力を活用することで、素材の生成、組み合わせ、編集のワークフローを統合し、AIを用いて多くの複雑な画像編集の課題を解決できるようになりました。
能力と効率
Qwen-Image-2.1の視覚生成部分は、20層のSingle-Stream DiTを採用し、パラメータ数は7Bで、ネイティブに2Kをサポートしています。このモデルは評価ベンチマークで規模を上回る性能を発揮し、Qwen-Image-2.1の総得点は60.28です。対照的に、Nano Banana 2.0は59.82、GPT Image 1.5は59.65です。このモデルは、複数のクローズドソース画像モデルと同等の競争力を有しています。

Qwen-Image-Bench評価チャート。
ビジョン生成部分はわずか7Bパラメータであり、この能力レベルはさらに注目に値します。小さな生成モジュールに画像生成、透明素材生成、複数画像編集の機能を統合(生成と編集を同一パイプラインで実現)し、開発者が画像ツールをデプロイまたはカスタマイズするための軽量な出発点を提供します。
性能が優れている一方で、Qwen-Image-2.1はモデルの推論プロセスを最適化し、不要な繰り返し計算を削減することを核心的な方針としています。
画像編集において、入力される参照画像と編集指示は、各ステップの生成に伴って変更されません。したがって、新しいモデルは混合粒度アテンション構造を採用しており、テキスト部分(システムプレフィックス、編集指示)は従来のトークンレベルの因果マスクに従い、単語ごとに厳密なシーケンス計算を実行して意味的ロジックの整合性を確保します。一方、画像生成部分はチャンクレベルのマスクを用い、KVキャッシュのメカニズムにより、最初の計算後にこれらの静的コンテキストをキャッシュし、後続の生成ステップで再利用します。

これにより、AIはまず参照資料を処理し、ターゲット画像を段階的に生成する際に既存の結果を再利用します。この最適化は複数の画像入力時に特に顕著であり、推論効率の向上とVRAM消費の削減に貢献します。
現在、Qwen-Image-2.1は最大10枚の参照画像をサポートしているため、この最適化は極めて重要です。入力内容が豊富になるほど、参照情報をどのように処理し、重複計算を制御するかが注目されます。具体的にどれだけの時間とVRAMを節約できるかは、ハードウェア、精度、解像度、および入力数に応じて異なります。
直接利用可能な透明素材を生成
新バージョンのQwen-Imageが設計要件に最も近い能力は、透明画像の生成です。
一般的画像素材は完整的な背景を含んでいます。その主体をポスター、商品詳細ページ、または別の画像に使用するには、通常、まず切り抜きを行い、輪郭、隙間、エッジを処理する必要があります。透明画像は追加の透明度情報が含まれており、背景が主体の周囲や一部の領域から透けて見えるため、後続の重ね合わせや組み合わせが容易です。
Qwen-Image-2.1は透明画像の生成をネイティブでサポートしており、プロンプトに応じて通常の画像と透明画像を自動的に判別して生成します。ユーザーは素材の説明の際に透明背景を要求できます。現在公開しているサンプルには、祝祭用イラスト、人物素材、装飾要素、および複数のオブジェクトから構成される複雑なコンポジションが含まれており、これらはデザイン作業で一般的な素材要件に対応しています。また、以下のような試行も行いました:

クリエイターにとってこれは良いニュースです。今ではすぐに使える素材が手に入り、作業工程が数段階減りました。
もちろん、これらの透明素材を生成した後も引き続き編集できます。たとえば、同じイラストのキャラクターの表情を変更したり、画像内のテキストの内容を編集したりできます。編集対象は、キャラクターの視覚的詳細でも、素材内のテキストでも可能です。
これは設計時の実際の変更要件に非常に近いです:イベント名が変更されましたが、図案はそのまま維持する必要があります;表情はよりリラックスしたものにし、キャラクターは依然として同じ人物であることが識別できるようにします。生成と編集を同一モデルに統合したことで、これらの後続要件も一貫した処理エントリーポイントを持つようになりました。
もちろん、Qwen-Image-2.1は既存の写真を処理できます。


公式では、実際の写真から必要なコンテンツを抽出し、RGBA透明画像を得る例を示しています。ここで、Aはアルファチャンネルを表し、画像の各部分の透明度を示します。
この機能は、ゼロから生成するだけでなく、既存の画像の再利用もカバーしています。クリエイターはまず写真を提供し、その後、モデルに画像内の必要な被写体を抽出して、次のデザインの素材として使用するよう指示できます。
Qwen-Imageシリーズは以前、透明画像関連の機能を探索するために独立したQwen-Image-Layeredをリリースしました。今回、Qwen-Image-2.1では、ネイティブな透明画像の生成と編集を汎用画像モデルに統合し、利便性をさらに向上させました。
複数画像編集に必要な正確なオープンソースAIモデルも登場しました
一枚の画像の要件が複数のオブジェクトから来る場合、編集タスクはさらに複雑になります。
たとえば、指定された服、靴、バッグ、帽子を同じモデルに着せたい場合、各参照画像には異なる役割があり、モデルは人物と商品を区別し、それらを適切な位置に配置して、それぞれの特徴を可能な限り保持する必要があります。
Qwen-Image-2.1は最大10枚の参照画像を入力できます。実際に試して、ウルトラマンとダリオに座って話させました。7枚の画像を使用:二人が対峙する写真(表情を変更)、背景の部屋、片肘掛けソファ、コーヒーカップ(コーヒーを注いだ状態)、床置きランプ、電気暖炉、低めのテーブル。最終的に、完成した効果図を生成しました。

異なる衣装を着せた際の全体の見た目をすぐに確認できるようになり、現在では複数の個人写真を組み合わせて多人数の集合写真を作成することもできます。
技術的には、それらはAIモデルがどれだけ多くの画像を入力として受け取れるかだけでなく、参照対象が最終的な画像内で適切な位置と比例関係を保ち、全体のスタイルと調和しているかを試しています。
全体の画面を組み立てた後、通常は部分的な調整が続きます。
Qwen-Image-2.1は、選択、塗りつぶし、独立マスクなどの方法を提供し、ユーザーが編集位置をより明確に指定できるようにします。たとえば、複数の色で異なる領域をマークし、写真内の人物の一部の衣装を削除し、髪の色を変更するように一度に指示できます。

このインタラクションにより、空間的な位置とテキストの要件が対応付けられます。複数の領域を編集する場合、ユーザーはそれぞれどこを削除し、どこを置き換え、何に変更したいかを明確に指定できます。
マスキング方式は、追加対象の位置を直接示すのに適していますが、元の画像に直接囲みやマスキングを施すと、一部の画像情報が隠れてしまいます。そのため、モデルは追加のマスク画像を通じて編集領域を指定することもサポートしており、これにより元の画像の情報が完全にモデルに投入されます。人物や商品を含むデザインにおいて、この情報保持機能は特に重要です。

文字の正確性、画面の質感
ヘアスタイルやシーンを変更しても、人物のアイデンティティ特徴は維持されるべきです。商品の配置環境を変更した場合でも、パッケージのテキスト、テクスチャー、形状は可能な限り一致させる必要があります。そうでなければ、画面上は美しく見えても、元の表示タスクには適さない可能性があります。Qwen-Image-2.1は、人物と商品の2つのシーンにおける編集の忠実性に重点を置いており、効果は良好に見えます。
私たちは試してみました。たとえば、小学『情報技術 3年上冊』のこのページのスクリーンショットをそれに渡して、 DeepSeek こんにちは、私は DeepSeek 「こんにちは、何かお手伝いできますか?」に変更し、深度思考(R1)を最新バージョンの深度思考ボタンに変更し、点灯:

生成と編集のほか、Qwen-Image-2.1 は文字と人物の表現もさらに改善しました。文字が密集した画像ページ、インフォグラフィック、論文の図版において、内容の正確性とレイアウトの美しさが顕著に向上しています。

人物部分において、Qwen-Image-2.1は光と影、および細部の表現をさらに強化しました。AIが生成する画像では、人物の髪の毛、衣装のテクスチャー、顔の細部、環境光がより調和し、画質がより繊細になりました。
さらに、パンラマ画像、インフォグラフィック、三面図、シナリオボードの生成能力も向上しており、静的画像の生成と編集の応用範囲を拡張し、キャラクターの表示やビジュアルプランニングなどのタスクに新たな可能性をもたらしています。我々はコミュニティが作成したQwenの2次元キャラクターを使用して、一連のシナリオボードイラストを生成してみました:

これらの機能を組み合わせることで、Qwen-Image-2.1はより包括的な画像処理パイプラインをカバーし、1つのAIモデルに基づいて、複数の参照画像を使って構図を構成し、領域を調整しながら、人物や商品の重要な特徴を可能な限り保持することが可能になりました。7BのオープンソースAIモデルが、再作業をどの程度削減できるかは、今後の実証テストで注目すべき課題です。
アプリケーションの市場規模はどのくらいですか?
Qwen-Image-2.1のリリースにより、画像モデルが創作プロセスのより詳細な段階をカバーしつつあり、この傾向はますます速まっていることがわかります。
透明素材の出力、複数画像の参照、局所編集および忠実度の向上により、AIモデルが実際のワークフローに導入される可能性が高まりました。クリエイターにとっては、より多くの素材作成や調整作業を、より簡単な方法でオープンソースの画像生成モデルに任せられるようになります。開発者にとっては、新しいモデルのオープンソース化により、これらの機能を基にしたデザインツールやアプリケーション、カスタムワークフローの構築に新たな基盤が提供されます。
Qwen-Image-2.1のような画像モデルのオープンソース化に伴い、コミュニティはさらに生成および編集機能をさまざまなコンテンツ制作シーンに統合し、より多くの人が自身のニーズに合った創作ツールを利用できるようになるでしょう。これらのAI機能が日常のソフトウェアで簡単に利用できる標準機能となったとき、アイデアからビジュアル作品へのハードルは再び大きく低下するかもしれません。
現在、Qwen-Image-2.1のオープンウェイトはHugging FaceおよびModelScopeにリリースされ、技術レポートはGitHubリポジトリにアップロードされました。
ブログ: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
モデルスコープ:https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
本文は微信公衆アカウント「機械の心」(ID:almosthuman2014)より、著者:澤南
