Здатність ШІ писати код часто дозволяє розробникам «відірвати руки від клавіатури», але для дизайнерів зображення, згенеровані ШІ, завжди відрізняються від готових до здачі на кілька кроків.
У робочому процесі дизайну зображень персонажів потрібно видаляти з фону, матеріали — змінювати текст, а розташування різних товарів — час від часу корегувати, але текст на упаковці та форма пляшки не повинні змінюватися. Якщо вимоги постійно змінюються, потрібно продовжувати вносити локальні зміни, щоб зберегти гармонійність всього зображення.
Ці деталі визначають, чи може генерація зображень за допомогою ШІ увійти у справжній процес створення. Для дизайнерів, е-комерційних менеджерів та креативних авторів сьогодні обмеженням моделей зображень є здатність точно виконувати кожну вказану зміну.
Цього неділі, Алі Qwen Офіційно відкрито вихідний код моделі генерації зображень Qwen-Image-2.1, яка розв’язує більшість проблем продуктивності за розміром малих моделей: вона об’єднує генерацію зображень з текстом та редагування зображень, нативно підтримує генерацію зображень з прозорістю, може приймати до 10 зображень-посилань та покращила локальне редагування, точність портретів та товарів.

Воно стало Qwen Поточна найбільш збалансована та найбільш вигідна відкрита модель для генерації зображень. Результати незалежного тестування показали, що Qwen-Image-2.1 посідає перше місце серед відкритих моделей, набравши навіть більше балів, ніж Nano Banana 2.0. Варто зазначити, що кількість параметрів у візуальній частині цієї моделі становить лише 7B.
На платформах, таких як X, користувачі, які отримали доступ до експериментальної версії раніше, вже опублікували результати генерації — всі отримали позитивні відгуки. Є скріншоти з великою кількістю текстового контенту:

Створення зображень з реалістичною фотореалістичною текстурою:

Також були спроби різних фільтрів і стилів освітлення:

Вважається, що Qwen-Image-2.1 вражає виконанням інструкцій, успішністю витягування та практичними результатами. На основі можливостей нової моделі ми вже можемо створити робочий процес генерації, комбінування та редагування матеріалів, використовуючи ШІ для вирішення багатьох складних завдань ретушування.
Здібності та ефективність
За даними, візуальна генерація Qwen-Image-2.1 використовує 20-шарову Single-Stream DiT з обсягом параметрів 7 млрд і нативно підтримує 2K. Модель досягла результатів, що перевищують її розмір, на тестових наборах: загальний бал Qwen-Image-2.1 становить 60,28. Навпаки, Nano Banana 2.0 має 59,82, а GPT Image 1.5 — 59,65. Вона вже здатна конкурувати з кількома закритими моделями зображення.

Діаграми оцінки Qwen-Image-Bench.
Візуальна генерація має лише 7 мільярдів параметрів, що робить такий рівень здібностей ще більш захопливим: вона поєднує в собі генерацію зображень, створення прозорих елементів та редагування кількох зображень (єдина конвеєрна система для генерації та редагування), надаючи розробникам більш легковагу основу для розгортання та налаштування інструментів для роботи з зображеннями.
При відмінній продуктивності Qwen-Image-2.1 також оптимізував процес виведення моделі, основна ідея якого полягає у зменшенні непотрібних повторних обчислень.
Під час редагування зображення вхідні зображення-референси та інструкції редагування не змінюються на кожному кроці генерації. Тому нова модель використовує гібридну структуру уваги з різним рівнем деталізації: текстова частина (системний префікс, інструкції редагування) дотримується традиційного каскадного маскування на рівні токенів, забезпечуючи строгу послідовну обробку слово за словом для збереження послідовності семантичного розуміння, тоді як частина генерації зображення використовує маскування на рівні чанків і за допомогою механізму KV Cache кешує ці статичні контексти після першого обчислення для повторного використання на наступних кроках генерації.

Це означає, що AI спочатку підготує референсні матеріали, а потім повторно використовуватиме отримані результати під час поступового генерування цільових зображень. Така оптимізація особливо ефективна при багато зображеннях на вхід, що допомагає підвищити ефективність висновування та зменшити навантаження на пам’ять GPU.
Оскільки Qwen-Image-2.1 зараз підтримує до 10 зображень-посилань, ця оптимізація стає надзвичайно важливою. Чим більше вхідних даних, тим більше значення має правильна обробка інформації з посилань та контроль над повторними обчисленнями. Щодо того, скільки саме часу й відеопам’яті можна зекономити — це залежить від апаратного забезпечення, точності, роздільної здатності та кількості вхідних даних.
Пряме створення прозорих матеріалів
Тим, що найбільш відповідає вимогам дизайну у новій версії Qwen-Image, є генерація зображень із прозорим фоном.
Звичайні зображення зазвичай мають повний тло. Щоб використати основний об’єкт на плакаті, сторінці товару або іншому зображенні, часто потрібно спочатку виділити його, обробити контури, щілини та краї. Прозорі зображення містять додаткову інформацію про прозорість, що дозволяє тлу проступати навколо або частково через основний об’єкт, спрощуючи подальше накладання та комбінування.
Qwen-Image-2.1 нативно підтримує генерацію зображень з прозорим фоном, автоматично визначаючи, чи потрібно створювати звичайне зображення чи зображення з прозорим фоном, згідно з описом користувача. Поточні приклади включають святкові ілюстрації, елементи персонажів, декоративні елементи та складні композиції з кількох об’єктів — усі вони відповідають поширеним потребам у дизайні. Ми також спробували:

Це чудова новина для творців — зараз ми можемо отримувати готові матеріали, що скорочує роботу на кілька етапів.
Звичайно, після створення цих прозорих матеріалів їх можна далі редагувати. Наприклад, для того самого ілюстрованого персонажа можна змінити вираз обличчя, а текст на зображенні — змінити вміст. Об’єктом редагування може бути як візуальна деталь персонажа, так і текст у матеріалі.
Це дуже близько до справжніх вимог до змін при проектуванні: назву акції змінили, але малюнок потрібно зберегти; емоції мають бути більш розслабленими, а персонажі повинні залишатися впізнаваними як той самий персонаж. Після об’єднання генерації та редагування в одну модель, ці наступні вимоги отримали єдиний точку введення.
Звичайно, Qwen-Image-2.1 підтримує обробку існуючих фотографій.


Офіційний приклад показує, як витягти необхідний вміст з реальних фотографій і отримати RGBA-прозоре зображення. Буква A позначає канал прозорості, який визначає ступінь прозорості різних частин зображення.
Як видно, ця функція підходить як для створення з нуля, так і для повторного використання існуючих зображень. Автори можуть спочатку надати фотографію, а потім вимагати, щоб модель виділила необхідний об’єкт, який потім можна використовувати як матеріал для подальшого дизайну.
Раніше серія Qwen-Image випустила окремий Qwen-Image-Layered для дослідження можливостей, пов’язаних із прозорими зображеннями. Тепер Qwen-Image-2.1 інтегрував нативне створення та редагування прозорих зображень у універсальну модель зображень, що дало додаткову зручність.
Для редагування з кількома зображеннями також з’явився точний відкритий AI-модель
Коли вимоги до зображення походять від кількох об’єктів, завдання редагування стає ще складнішим.
Наприклад, якщо потрібно одягнути на одного й того ж манекена вказану одяг, взуття, сумку та капелюх, кожна з опорних зображень має різну функцію, тому модель повинна розрізняти персонажа та товар, розмістити їх у відповідних місцях і максимально зберегти їхні характеристики.
Qwen-Image-2.1 підтримує до 10 зображень-посилань. Ми спробували — залишили Ольтімана та Даріо сидіти й розмовляти. Використано 7 зображень: фотографія двох людей, що стоять навпроти один одного (змінено вираз обличчя), фон кімнати, одиночний диван, кавова чашка (наповнена кавою), настінна лампа, електричний камін, низький стіл — у підсумку отримано повну зображення.

Різні одяг і аксесуари тепер також можна швидко надіти на людину, щоб побачити ефект, і зараз ви також можете поєднувати різні фотографії однієї особи, щоб створити фотографію з кількома людьми.
Технічно вони перевіряють не лише, скільки зображень може приймати модель ШІ, а й чи зможуть об’єкти-посилання правильно розташуватися в кінцевому зображенні, чи будуть пропорції, позиція та загальний стиль скоординовані.
Після створення загальної картини зазвичай виконуються локальні коректування.
Qwen-Image-2.1 надає такі способи, як обведення, замальовування та незалежні маски, щоб користувачі могли чіткіше вказувати місця редагування. Наприклад, ви можете позначити різні області різними кольорами і вимагати одночасно видалити частину одягу з людини на фото та змінити колір волосся.

Ця взаємодія встановлює відповідність між просторовим розташуванням та текстовими вимогами. Для редагування, що стосується кількох областей, користувач може окремо вказати, де потрібно видалити, де замінити та на що бажає змінити.
Метод розмальовки підходить для безпосереднього позначення місця нових об’єктів, але прямий обвід або розмальовка на оригінальному зображенні може приховати частину зображення. Тому модель також підтримує використання додаткової маски для визначення області редагування, що дозволяє повністю передати інформацію з оригінального зображення моделі. Для дизайну, що містить людей і товари, ця здатність зберігати інформацію є особливо важливою.

Точність тексту, якість зображення
Навіть якщо змінено причіску або сцену, обличчя повинно зберігати свої оригінальні ідентифікаційні риси; якщо змінено місце розташування товару, текст на упаковці, текстура та форма також повинні залишатися якомога більш схожими. В іншому випадку, навіть якщо зображення виглядає гарно, воно може не підходити для початкової задачі відображення. Qwen-Image-2.1 особливо підкреслює здатність редагування збереження деталей у сценах з портретами та товарами — результат виглядає досить добре.
Ми спробували, наприклад, зробити знімок екрана цієї сторінки з початкової школи «Інформаційні технології, 3 клас, частина 1» DeepSeek Вітаю, я DeepSeek , раді вас бачити!» змінити на «Привіт, чим можу допомогти?», а потім замінити глибоке мислення (R1) на останню версію кнопки глибокого мислення та увімкнути:

Крім генерації та редагування, Qwen-Image-2.1 також покращив відтворення тексту та персонажів. Точність вмісту та естетика композиції на сторінках з великою кількістю тексту, інфографіках та ілюстраціях до наукових статей були значно підвищені.

У частині портрету Qwen-Image-2.1 значно покращила передачу світла і деталей. Зараз зображення, згенеровані штучним інтелектом, — незалежно від волосся, текстури одягу, деталей обличчя чи освітлення оточення — стали більш гармонійними, а якість зображення — більш тонкою.
Крім того, з’явилися покращені можливості генерації панорамних зображень, інфографіки, трьох видів та сценарійних зображень, що розширюють застосування статичних зображень та редагування, надаючи більше можливостей для відображення персонажів, візуального планування тощо. Ми спробували використати створені спільнотою Qwen-образи для генерації серії сценарійних ілюстрацій:

Ці здібності разом дозволяють Qwen-Image-2.1 охопити більш повний ланцюжок обробки зображень: зараз ми можемо на основі однієї моделі ШІ виконати велику кількість завдань — спочатку створити композицію за кількома зразковими зображеннями, потім відкоригувати області, зберігаючи при цьому ключові характеристики людей та товарів. Те, наскільки сильно вдасться зменшити необхідність повторної роботи за допомогою відкритої моделі ШІ з розміром лише 7B, стане питанням, яке варто вивчати у подальших тестах.
Який обсяг застосунку?
Випуск Qwen-Image-2.1 показує, що зображення моделі охоплюють все більше деталей у процесі створення, і ця тенденція прискорюється.
Підвищення якості виводу прозорих зображень, здатності до багатокадрового посилання, локального редагування та збереження деталей збільшує можливість інтеграції AI-моделей у реальні робочі процеси. Для творців це означає, що більше роботи зі створенням та налаштуванням матеріалів можна передати відкритим генеративним моделям простішим способом; для розробників відкриття нової моделі надає нову основу для створення інструментів дизайну, застосунків та налаштованих робочих процесів на основі цих можливостей.
Ми можемо сміливо передбачити, що з відкриттям таких моделей зображень, як Qwen-Image-2.1, спільнота додасте можливості генерації та редагування до ще більшого числа сценаріїв створення контенту, дозволивши більшій кількості людей використовувати інструменти створення, що відповідають їхнім потребам. Коли ці можливості ШІ стануть звичайними функціями у повсякденному програмному забезпеченні, бар’єр між ідеєю та візуальним твором, можливо, знову значно знизиться.
Наразі відкриті ваги Qwen-Image-2.1 опубліковано на Hugging Face та ModelScope, а технічний звіт завантажено до сховища GitHub.
Блог: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
Цей матеріал з відомості WeChat «Machine Heart» (ID: almosthuman2014), автор: Цзє Нань
