A capacidade da IA de escrever código frequentemente permite que os desenvolvedores "afastem as mãos do teclado", mas para os designers, as imagens geradas pela IA ainda estão a várias etapas de serem entregues.
No fluxo de trabalho de design gráfico, é necessário isolar figuras, alterar textos nos elementos e ajustar periodicamente a disposição dos produtos, mas o texto na embalagem e o formato da garrafa não podem mudar. Se as solicitações continuarem sendo alteradas, ainda será necessário fazer ajustes locais para manter a coerência geral da imagem.
Esses detalhes determinam se a geração de imagens por IA pode entrar no fluxo de criação real. Para designers, operadores de e-commerce e criadores de conteúdo, o gargalo atual dos modelos de imagem está em cada instrução de modificação proposta ser executada com precisão.
Este domingo, Alibaba Qwen Lançamento oficial do modelo de geração de imagens Qwen-Image-2.1 como código aberto, resolvendo a maioria dos desafios de produtividade com o tamanho de um modelo pequeno: ele integra geração de imagem a partir de texto e edição de imagem, suporta nativamente a geração de imagens transparentes, aceita até 10 imagens de referência e aprimora ainda mais a edição local, fidelidade de retratos e produtos.

Tornou-se Qwen O modelo de geração de imagens open-source mais equilibrado e com melhor custo-benefício atualmente. Resultados de avaliações públicas mostram que o Qwen-Image-2.1 alcançou o primeiro lugar entre modelos open-source, superando até mesmo o Nano Banana 2.0. É importante notar que a parte de geração visual deste modelo possui apenas 7B de parâmetros.
Em plataformas como o X, usuários que obtiveram acesso antecipado já divulgaram os resultados gerados, recebendo muitos elogios. Há capturas de tela com grandes quantidades de conteúdo textual:

Gerar imagens com aparência de fotos reais:

Também houve tentativas com diversos filtros e estilos de iluminação:

As pessoas consideram o Qwen-Image-2.1 impressionante em termos de seguimento de instruções, taxa de sucesso em sorteios e efeitos práticos. Com base nas novas capacidades do modelo, já conseguimos integrar fluxos de trabalho de geração, combinação e modificação de materiais, utilizando IA para resolver muitos problemas complexos de edição de imagens.
Capacidade e eficiência
Segundo informações, a parte de geração visual do Qwen-Image-2.1 utiliza 20 camadas de Single-Stream DiT, com 7B de parâmetros e suporte nativo a 2K. O modelo alcançou desempenho superior ao seu tamanho nos benchmarks: o Qwen-Image-2.1 obteve pontuação total de 60,28. Em comparação, o Nano Banana 2.0 obteve 59,82 e o GPT Image 1.5 obteve 59,65. Ele já consegue competir diretamente com diversos modelos de imagem proprietários.

Gráfico de avaliação do Qwen-Image-Bench.
A parte de geração visual possui apenas 7B parâmetros, tornando ainda mais notável esse nível de capacidade: ela integra, em um módulo de geração menor, as funcionalidades de geração de imagens, geração de elementos transparentes e edição de múltiplas imagens (fluxo unificado de geração e edição), oferecendo aos desenvolvedores um ponto de partida mais leve para implantar e personalizar ferramentas de imagem.
Ao manter um bom desempenho, o Qwen-Image-2.1 também otimizou o processo de inferência do modelo, com a ideia central de reduzir cálculos repetitivos desnecessários.
Em um processo de edição de imagem, a imagem de referência e as instruções de edição não mudam a cada passo de geração. Portanto, o novo modelo utiliza uma estrutura de atenção de granularidade mista: a parte textual (prefixo do sistema, instruções de edição) segue uma máscara causal tradicional em nível de token, realizando cálculos sequenciais rigorosos palavra por palavra para garantir a coerência na compreensão semântica; já a parte de geração de imagem emprega uma máscara em nível de chunk e, por meio do mecanismo KV Cache, armazena esses contextos estáticos após o cálculo inicial, reutilizando-os nos passos subsequentes de geração.

Isso significa que a IA agora processará primeiro os materiais de referência e reutilizará os resultados já obtidos ao gerar gradualmente as imagens de destino; essa otimização é ainda mais evidente com múltiplas entradas de imagem, ajudando a aumentar a eficiência de inferência e reduzir o consumo de memória de vídeo.
Como o Qwen-Image-2.1 agora suporta até 10 imagens de referência, essa otimização torna-se crucial. Quanto mais rica for a entrada, mais importante se torna lidar com as informações de referência e controlar cálculos repetidos. Quanto ao tempo e à memória de vídeo economizados exatamente, isso ainda depende do hardware, precisão, resolução e número de entradas.
Gerar diretamente ativos transparentes utilizáveis
A capacidade do novo Qwen-Image mais próxima das necessidades de design é a geração de imagens transparentes.
Imagens comuns geralmente possuem fundos completos. Para usar o elemento principal em cartazes, páginas de detalhes de produtos ou outra imagem, frequentemente é necessário primeiro isolar o objeto, tratando contornos, fendas e bordas. Imagens transparentes contêm informações adicionais de transparência, permitindo que o fundo apareça ao redor ou em partes do objeto, facilitando a sobreposição e combinação posteriores.
O Qwen-Image-2.1 oferece suporte nativo à geração de imagens transparentes, podendo automaticamente determinar se a imagem gerada será normal ou transparente com base no prompt. O usuário pode solicitar um fundo transparente ao descrever o elemento. Os exemplos apresentados incluem ilustrações festivas, elementos de personagens, elementos decorativos e combinações complexas compostas por múltiplos objetos — todos correspondendo a necessidades comuns de design. Também tentamos:

É uma ótima notícia para criadores, pois agora podemos obter materiais prontos para uso, eliminando várias etapas do processo.
Claro, esses elementos transparentes também podem ser modificados após a geração. Por exemplo, o mesmo personagem ilustrado pode ter sua expressão ajustada e o texto na imagem pode ser alterado. Os objetos editáveis podem ser os detalhes visuais do personagem ou o texto presente no elemento.
Isso está muito próximo da necessidade real de modificação no design: o nome da campanha foi alterado, mas o padrão ainda precisa ser mantido; as expressões devem ser mais descontraídas, mas os personagens ainda devem ser reconhecíveis como o mesmo personagem. Após integrar a geração e a edição no mesmo modelo, essas exigências subsequentes passaram a ter uma entrada de tratamento unificada.
Claro, o Qwen-Image-2.1 suporta o processamento de fotos já existentes.


A equipe oficial forneceu um exemplo de como extrair o conteúdo desejado de fotos reais para obter uma imagem transparente RGBA. O A representa o canal de transparência, usado para descrever o grau de transparência em cada parte da imagem.
Visivelmente, essa funcionalidade serve tanto para geração do zero quanto para a reutilização de imagens existentes. Os criadores podem primeiro fornecer uma foto e depois solicitar ao modelo que extraia o elemento desejado, para usar como material para design posterior.
A série Qwen-Image anteriormente lançou o Qwen-Image-Layered independente para explorar capacidades relacionadas a imagens transparentes. Agora, o Qwen-Image-2.1 integra nativamente a geração e edição de imagens transparentes no modelo de imagem geral, aumentando ainda mais a conveniência.
O modelo de IA aberto e preciso necessário para edição de múltiplas imagens também está disponível
Quando uma imagem tem requisitos provenientes de múltiplos objetos, a tarefa de edição se torna ainda mais complexa.
Por exemplo, se desejar vestir uma peça de roupa, sapatos, bolsa e chapéu específicos no mesmo modelo, cada imagem de referência desempenha um papel diferente, e o modelo precisa distinguir entre a pessoa e os produtos, posicionando-os de forma adequada e preservando, sempre que possível, suas características individuais.
O Qwen-Image-2.1 suporta até 10 imagens de referência como entrada. Experimentamos, fazendo Ultraman e Dario sentarem para conversar. Utilizamos 7 imagens: foto de duas pessoas em confronto (alterando a expressão facial), fundo da sala, poltrona individual, xícara de café (com café despejado), lampada de piso, lareira elétrica e mesa baixa, gerando finalmente uma imagem final completa.

Agora também é possível visualizar rapidamente como diferentes roupas ficam em uma pessoa, e você pode combinar fotos individuais para criar fotos em grupo.
Tecnicamente, elas testam não apenas quantas imagens o modelo de IA pode receber como entrada, mas também se os objetos de referência estão corretamente posicionados na imagem final, com proporções, localização e estilo geral coerentes.
A imagem geral foi composta; normalmente, ajustes locais seguem em seguida.
O Qwen-Image-2.1 oferece recursos como seleção, pincel e máscaras independentes, permitindo que os usuários expressem com mais clareza as áreas a serem editadas. Por exemplo, você pode usar várias cores para marcar diferentes regiões e solicitar uma única modificação que remova simultaneamente as roupas da pessoa na foto e altere a cor do cabelo.

Essa interação estabelece uma correspondência entre a posição espacial e os requisitos de texto. Para edições que envolvem múltiplas áreas, o usuário pode indicar separadamente onde deve ser excluído, onde deve ser substituído e o que se deseja alterar.
O método de pintura é adequado para indicar diretamente a localização dos novos objetos, mas selecionar ou pintar diretamente sobre a imagem original também pode ocultar parte da imagem. Para isso, o modelo também suporta o uso de uma imagem de máscara adicional para especificar a área de edição, permitindo que as informações da imagem original sejam inseridas integralmente no modelo. Para designs que incluem pessoas e produtos, essa capacidade de preservação é especialmente crucial.

Precisão do texto, qualidade da imagem
Mesmo após alterar o penteado ou o cenário, os retratos devem manter suas características identitárias originais; ao mudar o ambiente de exposição de um produto, os textos, texturas e formatos da embalagem também devem ser mantidos o mais consistentes possível. Caso contrário, mesmo que a imagem pareça atraente, pode não ser adequada para a finalidade original de exibição. O Qwen-Image-2.1 destaca especialmente a capacidade de manter a fidelidade em edições de retratos e produtos, e os resultados parecem bastante bons.
Tentamos, por exemplo, fazer com que ele capture a tela desta página do livro de Tecnologia da Informação do 3º ano do ensino fundamental, volume 1, DeepSeek Ola, eu sou DeepSeek ,很高兴见到你!」改成「你好,我能帮上什么忙吗?」,再把深度思考(R1)改成最新版本的深度思考按钮,再点亮:

Além da geração e edição, o Qwen-Image-2.1 também aprimorou continuamente o desempenho em texto e personagens. Tanto em páginas com muito texto e imagens, infográficos quanto ilustrações de artigos acadêmicos, a precisão do conteúdo e a qualidade estética da disposição foram elevadas a um nível notável.

Na parte retrato, o Qwen-Image-2.1 aprimorou ainda mais a representação de luz e sombra e os detalhes. Agora, as imagens geradas por IA apresentam maior coerência nos fios de cabelo, texturas de roupas, detalhes faciais e iluminação ambiental, com uma qualidade visual mais refinada.
Além disso, há melhores capacidades de geração de panoramas, infográficos, vistas triplas e sequências de cenas, que ampliam o escopo de aplicação da geração e edição de imagens estáticas, oferecendo mais possibilidades para tarefas como apresentação de personagens e planejamento visual. Experimentamos e usamos a imagem de Qwen criada pela comunidade para gerar uma série de ilustrações de sequências de cenas:

Essas capacidades, combinadas, permitem que o Qwen-Image-2.1 cubra uma cadeia de processamento de imagens mais completa. Agora podemos realizar uma grande quantidade de tarefas com base em um único modelo de IA: primeiro organizar a cena usando várias imagens de referência, depois ajustar áreas específicas, mantendo ao máximo as características-chave das pessoas e dos produtos. O grau em que um modelo de geração visual de apenas 7B aberto poderá reduzir os retrabalhos será uma questão importante a ser avaliada nos testes práticos subsequentes.
Qual é o potencial do aplicativo?
O lançamento do Qwen-Image-2.1 nos mostra que os modelos de imagem estão abrangendo etapas cada vez mais detalhadas do processo criativo, e essa tendência está se acelerando.
Seja na saída de elementos transparentes, na referência de múltiplas imagens, no aprimoramento da edição local e da fidelidade, todos esses avanços aumentam a possibilidade de os modelos de IA serem integrados aos fluxos de trabalho reais. Para criadores, isso significa que mais tarefas de criação e ajuste de ativos podem ser realizadas de forma mais simples por meio de modelos de geração de imagens de código aberto; já para desenvolvedores, a abertura do novo modelo oferece uma nova base para construir ferramentas de design, aplicações e fluxos de trabalho personalizados em torno dessas capacidades.
Podemos prever com confiança que, com a abertura de modelos de imagem como o Qwen-Image-2.1, a comunidade integrará ainda mais capacidades de geração e edição em mais cenários de criação de conteúdo, permitindo que mais pessoas acessem ferramentas de criação adaptadas às suas necessidades. Quando essas capacidades de IA se tornarem funções facilmente disponíveis em softwares cotidianos, a barreira entre a ideia e a obra visual poderá ser novamente reduzida significativamente.
Atualmente, os pesos abertos do Qwen-Image-2.1 já foram lançados no Hugging Face e no ModelScope, e o relatório técnico já foi carregado no repositório do GitHub.
Blog: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Model Scope: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
Este artigo é do公众号 da WeChat "Machine Heart" (ID: almosthuman2014), autor: Zeanan
