Qwen-Image-2.1 становится лучшим открытым генератором изображений с улучшенными функциями редактирования и прозрачностью

icon MarsBit
Поделиться
AI summary iconСводка
Alibaba запустила Qwen-Image-2.1 — открытый генератор изображений, занимающий первое место среди открытых моделей. Инструмент с 7 млрд параметров поддерживает генерацию с прозрачностью, многократное редактирование и локальную доработку. Он превосходит Nano Banana 2.0 по результатам тестов и повышает эффективность за счет оптимизированного вывода. По мере развития ликвидности и криптовалютных рынков растет популярность регуляторных инструментов, таких как CFT. Запуск Qwen усиливает стремление к прозрачности открытых ИИ-решений.

Способность ИИ писать код часто позволяет разработчикам «отойти от клавиатуры», но для дизайнеров изображения, сгенерированные ИИ, всё ещё далеко от того, чтобы быть готовыми к сдаче.

В рабочем процессе дизайна изображений персонажей нужно вырезать, элементы требуют замены текста, расположение различных товаров необходимо периодически корректировать, но текст на упаковке и форма бутылки не должны меняться. Если требования постоянно изменяются, необходимо продолжать вносить локальные правки, чтобы сохранить согласованность всей картинки.

Эти детали определяют, сможет ли генерация изображений с помощью ИИ перейти в настоящий творческий процесс. Для дизайнеров, операторов электронной коммерции и создателей контента сегодня основным ограничением моделей изображений является точность выполнения каждой команды на изменение.

В это воскресенье, Али Qwen Официально открыт исходный код модели генерации изображений Qwen-Image-2.1, которая с помощью компактной архитектуры решает большинство задач повышения производительности: она объединяет генерацию изображений по тексту и редактирование изображений, нативно поддерживает создание изображений с прозрачным фоном, принимает до 10 опорных изображений и дополнительно улучшила локальное редактирование, а также точность воспроизведения портретов и товаров.

Qwen

Оно стало Qwen На данный момент это самый сбалансированный и наиболее выгодный по соотношению цены и качества открытый генеративный модель для изображений. Результаты открытых тестов показали, что Qwen-Image-2.1 занял первое место среди открытых моделей, набрав даже больше баллов, чем Nano Banana 2.0. Стоит отметить, что количество параметров в визуальной генерирующей части этой модели составляет всего 7 млрд.

На таких платформах, как X, пользователи, получившие предварительный доступ к тестированию, уже опубликовали результаты генерации, и они получили множество положительных отзывов. Среди них — скриншоты с большим объемом текстового содержимого:

Qwen

Создать изображения с реалистичной фотографической текстурой:

Qwen

Также были попытки использовать различные фильтры и стили освещения:

Qwen

Пользователи считают, что Qwen-Image-2.1 впечатляет в следовании инструкциям, вероятности успешного извлечения и практической эффективности. Благодаря возможностям новой модели мы теперь можем объединить рабочие процессы генерации, комбинирования и редактирования материалов, используя ИИ для решения многих сложных задач ретуши.

Способности и эффективность

Согласно информации, визуальная генерация Qwen-Image-2.1 использует 20-слойный Single-Stream DiT с объемом параметров 7 млрд и нативно поддерживает разрешение 2K. Модель показала результаты, превосходящие ее размер: общий балл Qwen-Image-2.1 составляет 60,28. Для сравнения, Nano Banana 2.0 набрал 59,82, а GPT Image 1.5 — 59,65. Она уже способна конкурировать с рядом закрытых изображений.

Qwen

Графики оценки Qwen-Image-Bench.

Визуальная генерация использует всего 7 млрд параметров, что делает такой уровень возможностей еще более примечательным: в меньшем генерирующем модуле объединены функции создания изображений, генерации прозрачных элементов и редактирования нескольких изображений (единая конвейерная система генерации и редактирования), предоставляя разработчикам более легкий старт для развертывания и настройки инструментов для работы с изображениями.

При отличной производительности Qwen-Image-2.1 также оптимизировал процесс вывода модели, основная идея которого заключается в сокращении избыточных повторных вычислений.

В процессе редактирования изображений входные опорные изображения и инструкции по редактированию не изменяются на каждом шаге генерации. Поэтому новая модель использует структуру гибридного внимания с разной степенью детализации: текстовая часть (системный префикс, инструкции по редактированию) следует традиционному маскированию на уровне токенов с посимвольным строгим последовательным вычислением для обеспечения согласованности семантического понимания, а часть генерации изображений применяет маскирование на уровне чанков и с помощью механизма KV Cache кэширует эти статические контексты после первого вычисления для повторного использования на последующих шагах генерации.

Qwen

Это означает, что ИИ теперь сначала обрабатывает справочные материалы, а затем повторно использует полученные результаты при постепенном создании целевого изображения. Такая оптимизация особенно эффективна при использовании нескольких входных изображений и способствует повышению эффективности вывода и снижению потребления видеопамяти.

Поскольку Qwen-Image-2.1 теперь поддерживает до 10 опорных изображений, эта оптимизация становится критически важной. Чем богаче входные данные, тем важнее становится вопрос обработки опорной информации и управления повторными вычислениями. Конкретная экономия времени и видеопамяти зависит от аппаратного обеспечения, точности, разрешения и количества входных данных.

Непосредственно создавайте прозрачные ресурсы, готовые к использованию

Способность новой версии Qwen-Image, наиболее точно соответствующая требованиям дизайна, — это генерация прозрачных изображений.

Обычные изображения обычно содержат полный фон. Чтобы использовать основной объект на плакате, странице товара или другом изображении, часто необходимо сначала вырезать объект, обработать контуры, зазоры и края. Прозрачные изображения содержат дополнительную информацию о прозрачности, позволяющую фону просвечивать вокруг или частично через объект, что упрощает последующее наложение и комбинирование.

Qwen-Image-2.1 нативно поддерживает генерацию изображений с прозрачным фоном, автоматически определяя по запросу, следует ли создавать обычное изображение или изображение с прозрачным фоном. Пользователь может указать требование прозрачного фона при описании элемента. Приведённые примеры включают праздничные иллюстрации, элементы персонажей, декоративные элементы и сложные композиции из нескольких объектов — всё это типичные требования в дизайне. Мы также попробовали:

Qwen

Это отличная новость для создателей контента — теперь у нас есть готовые материалы, и нам пришлось убрать несколько этапов работы.

Конечно, эти прозрачные элементы можно продолжать редактировать после создания. Например, у одного и того же персонажа можно изменить выражение лица, а текст на изображении — отредактировать содержание. Объектом редактирования могут быть как визуальные детали персонажа, так и текстовые элементы.

Это очень близко к реальным требованиям к изменениям при разработке: название мероприятия изменилось, но рисунок должен остаться прежним; эмоции должны стать более расслабленными, персонажи должны оставаться узнаваемыми как один и тот же персонаж. После объединения генерации и редактирования в одну модель все последующие требования получили единый пункт обработки.

Конечно, Qwen-Image-2.1 поддерживает обработку существующих фотографий.

Qwen

Qwen

Официальный пример показывает, как из реальных фотографий извлекать необходимые данные и получать RGBA-прозрачные изображения. Буква A обозначает канал прозрачности, который описывает степень прозрачности в различных областях изображения.

Как видно, эта функция поддерживает как генерацию с нуля, так и повторное использование существующих изображений. Создатели могут сначала загрузить фотографию, а затем попросить модель выделить нужный объект для использования в последующем дизайне.

Ранее серия Qwen-Image представила отдельную версию Qwen-Image-Layered для изучения возможностей, связанных с прозрачными изображениями. Теперь Qwen-Image-2.1 интегрировала нативную генерацию и редактирование прозрачных изображений в универсальную модель изображений, что дополнительно повысило удобство.

Точная открытая AI-модель для редактирования нескольких изображений также появилась

Когда запрос на изображение исходит от нескольких объектов, задача редактирования становится еще более сложной.

Например, если вы хотите надеть на одного и того же манекена определенную одежду, обувь, сумку и шляпу, каждая опорная картинка выполняет свою функцию, и модель должна различать человека и товар, размещать их в соответствующих позициях и максимально сохранять их особенности.

Qwen-Image-2.1 поддерживает ввод до 10 опорных изображений. Мы попробовали: заставили Ультрамана и Далио сесть и поговорить. Использовали 7 изображений: фотография двух людей, стоящих друг напротив друга (изменённое выражение лица), фоновая комната, кресло-качалка, кружка с кофе (наполненная кофе), напольная лампа, электрический камин, низкий стол, в результате получилось полноценное изображение.

Qwen

Сейчас можно быстро визуализировать, как будет выглядеть человек в разных нарядах, а также объединять фотографии нескольких людей в одну групповую фотографию.

Технически они проверяют не только, сколько изображений может принять модель ИИ, но и能否 объекты ссылки правильно расположиться в финальном изображении, с правильными пропорциями, позицией и согласованностью общего стиля.

После создания общей картины обычно следуют детальные корректировки.

Qwen-Image-2.1 предоставляет такие способы, как выделение областей, закрашивание и независимые маски, чтобы пользователи могли более точно указать места для редактирования. Например, вы можете использовать несколько цветов для обозначения разных областей и запросить одновременное удаление части одежды на человеке на фотографии и изменение цвета волос.

Qwen

Этот интерфейс устанавливает соответствие между пространственными позициями и текстовыми требованиями. При редактировании, затрагивающем несколько областей, пользователь может указать, где нужно удалить, где заменить и на что именно.

Метод мазков подходит для прямого указания местоположения новых объектов, но прямое выделение или закрашивание на исходном изображении также может закрыть часть изображения. Для этого модель также поддерживает использование дополнительного изображения маски для указания области редактирования, что позволяет полностью передать информацию исходного изображения модели. Для дизайнов, содержащих людей и товары, эта способность сохранения особенно важна.

Qwen

Точность текста, качество изображения

При смене прически или фона лицо должно сохранять свои оригинальные идентификационные черты; при изменении среды размещения товара текст на упаковке, текстура и форма должны оставаться максимально согласованными. В противном случае, даже если изображение выглядит красиво, оно может не подойти для исходной задачи отображения. Qwen-Image-2.1 особо подчеркивает способность редактирования с сохранением точности для сцен с портретами и товарами — результат выглядит неплохо.

Мы попробовали, например, сделать скриншот этой страницы из учебника «Информационные технологии» для 3 класса начальной школы, DeepSeek Приветствие: «Я DeepSeek «Рад вас видеть!» изменить на «Здравствуйте, чем могу помочь?», затем заменить «Глубокое мышление (R1)» на кнопку «Глубокое мышление» последней версии и включить:

Qwen

Помимо генерации и редактирования, Qwen-Image-2.1 также продолжил улучшать качество работы с текстом и персонажами. Точность содержания и эстетика компоновки на страницах с плотным текстом, информационных графиках и иллюстрациях к научным статьям были значительно повышены.

Qwen

В части портретов Qwen-Image-2.1 значительно улучшила передачу света и деталей. Теперь изображения, сгенерированные ИИ, становятся более гармоничными: от волос и текстуры одежды до деталей лица и освещения окружающей среды, качество изображения стало более тонким.

Кроме того, улучшены возможности генерации панорамных изображений, инфографики, трехвидовых чертежей и сценариев, что расширяет применение генерации и редактирования статических изображений и открывает новые возможности для задач, таких как демонстрация персонажей и визуальное планирование. Мы попробовали использовать созданные сообществом Qwen-персонажи в аниме-стиле для генерации серии сценариев:

Qwen

Эти возможности в совокупности позволяют Qwen-Image-2.1 охватить более полный цикл обработки изображений: теперь мы можем выполнять множество задач на основе одной модели AI — сначала организовывать композицию с использованием нескольких опорных изображений, затем корректировать области, одновременно максимально сохраняя ключевые характеристики персонажей и товаров. То, насколько сильно открытая AI-модель с визуальной генерацией всего в 7 млрд параметров сможет сократить необходимость переделок, станет важным вопросом для последующих практических тестов.

Каков потенциал применения?

Выпуск Qwen-Image-2.1 показывает, что модели изображений охватывают все более детализированные этапы процесса создания, и эта тенденция ускоряется.

Повышение качества вывода прозрачных изображений, способности к использованию нескольких изображений в качестве参考, локальному редактированию и сохранению деталей увеличивает вероятность интеграции моделей ИИ в реальные рабочие процессы. Для создателей это означает, что большую часть работы по созданию и корректировке материалов можно теперь проще поручить открытым генеративным моделям; для разработчиков же открытие новых моделей предоставляет новую основу для создания инструментов дизайна, приложений и настраиваемых рабочих процессов на основе этих возможностей.

Мы можем смело предположить, что с открытием таких моделей изображений, как Qwen-Image-2.1, сообщество将进一步 интегрировать возможности генерации и редактирования в еще больше сценариев создания контента, позволив большему числу людей использовать инструменты создания, соответствующие их потребностям. Когда эти возможности ИИ станут повседневными функциями, доступными в любом программном обеспечении, барьер между идеей и визуальным произведением, возможно, снова значительно снизится.

Сейчас открытые веса Qwen-Image-2.1 опубликованы на Hugging Face и ModelScope, технический отчет загружен в репозиторий GitHub.

Блог: https://qwen.ai/blog?id=qwen-image-2.1

GitHub: https://github.com/QwenLM/Qwen-Image-2.1

Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1

Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1

Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Цзэнань

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.