Khả năng viết mã của AI thường giúp các nhà phát triển “nhấc tay khỏi bàn phím”, nhưng đối với các nhà thiết kế, hình ảnh do AI tạo ra vẫn còn cách xa việc có thể giao bản cuối cùng.
Trong quy trình thiết kế hình ảnh, nhân vật cần được tách nền, tài liệu cần thay đổi chữ, vị trí sắp xếp các sản phẩm cần được điều chỉnh định kỳ, nhưng chữ trên bao bì và hình dạng chai không được thay đổi. Nếu yêu cầu liên tục được điều chỉnh, vẫn cần tiếp tục sửa đổi từng phần để giữ cho toàn bộ hình ảnh hài hòa.
Những chi tiết này quyết định liệu hình ảnh do AI tạo ra có thể bước vào quy trình sáng tạo thực sự hay không. Đối với các nhà thiết kế, người vận hành thương mại điện tử và người sáng tạo nội dung, giới hạn hiện nay của các mô hình hình ảnh nằm ở việc mỗi lệnh chỉnh sửa được đưa ra có thể được thực hiện chính xác hay không.
Chủ nhật tuần này, Alibaba Qwen Chính thức mở nguồn mô hình tạo hình ảnh Qwen-Image-2.1, giải quyết phần lớn các vấn đề về năng suất với kích thước mô hình nhỏ: mô hình tích hợp liền mạch văn bản thành hình ảnh và chỉnh sửa hình ảnh, hỗ trợ native việc tạo hình ảnh trong suốt, có thể nhận tối đa 10 hình ảnh tham chiếu, đồng thời tăng cường mạnh mẽ khả năng chỉnh sửa cục bộ, độ chân thực của ảnh nhân vật và sản phẩm.

Nó đã trở thành Qwen Hiện tại, mô hình sinh ảnh mã nguồn mở cân bằng và hiệu quả chi phí nhất. Kết quả đánh giá công khai cho thấy Qwen-Image-2.1 dẫn đầu trong các mô hình mã nguồn mở, với điểm số thậm chí còn vượt qua Nano Banana 2.0. Cần lưu ý rằng phần sinh thị giác của mô hình này chỉ có 7B tham số.
Trên các nền tảng như X, những người dùng đã nhận được quyền trải nghiệm trước đã chia sẻ các kết quả tạo ra, nhận được nhiều lời khen ngợi. Có những hình ảnh minh họa chứa nhiều nội dung văn bản:

Tạo hình ảnh có chất lượng như ảnh thật:

Cũng đã thử nhiều bộ lọc và phong cách ánh sáng khác nhau:

Người ta cho rằng Qwen-Image-2.1 ấn tượng trong việc tuân theo lệnh, tỷ lệ thành công khi rút thẻ và hiệu quả thực tế. Dựa trên khả năng của mô hình mới, chúng ta đã có thể kết nối quy trình làm việc gồm tạo, kết hợp và chỉnh sửa tài nguyên, sử dụng AI để giải quyết nhiều vấn đề chỉnh sửa ảnh phức tạp.
Năng lực và hiệu suất
The visual generation component of Qwen-Image-2.1 employs a 20-layer Single-Stream DiT with 7B parameters and natively supports 2K. The model achieves performance beyond its size on evaluation benchmarks: Qwen-Image-2.1 scores a total of 60.28, compared to 59.82 for Nano Banana 2.0 and 59.65 for GPT Image 1.5. It is now capable of competing alongside several proprietary image models.

Biểu đồ đánh giá Qwen-Image-Bench.
Phần sinh hình ảnh chỉ có 7B tham số, khiến khả năng này càng đáng chú ý: nó đồng thời tích hợp các chức năng sinh hình ảnh, sinh tài liệu trong suốt và chỉnh sửa nhiều hình ảnh (quy trình thống nhất cho sinh và chỉnh sửa), mang đến điểm khởi đầu nhẹ nhàng hơn cho các nhà phát triển trong việc triển khai và tùy chỉnh công cụ hình ảnh.
Đồng thời với hiệu suất tốt, Qwen-Image-2.1 còn tối ưu hóa quá trình suy luận của mô hình, với ý tưởng cốt lõi là giảm các phép tính lặp lại không cần thiết.
Trong một thao tác chỉnh sửa hình ảnh, hình ảnh tham chiếu và hướng dẫn chỉnh sửa được nhập vào không thay đổi theo từng bước sinh. Do đó, mô hình mới sử dụng cấu trúc chú ý độ phân giải hỗn hợp: phần văn bản (tiền tố hệ thống, hướng dẫn chỉnh sửa) tuân theo mặt nạ nhân quả cấp Token truyền thống, thực hiện tính toán chuỗi nghiêm ngặt từng từ để đảm bảo tính liên tục trong hiểu ngữ nghĩa; phần sinh hình ảnh sử dụng mặt nạ cấp Chunk và thông qua cơ chế KV Cache, lưu trữ các ngữ cảnh tĩnh này sau bước tính toán đầu tiên để tái sử dụng trong các bước sinh tiếp theo.

Điều này có nghĩa là AI hiện sẽ xử lý trước các tài liệu tham khảo và tái sử dụng các kết quả đã có khi tạo dần từng hình ảnh mục tiêu; sự tối ưu này đặc biệt rõ rệt khi có nhiều đầu vào hình ảnh, giúp nâng cao hiệu suất suy luận và giảm chi phí bộ nhớ GPU.
Vì hiện tại Qwen-Image-2.1 hỗ trợ tối đa 10 hình ảnh tham chiếu, nên việc tối ưu này trở nên cực kỳ quan trọng. Càng nhiều nội dung đầu vào, việc xử lý thông tin tham chiếu và kiểm soát tính toán lặp lại càng đáng được quan tâm. Về việc cụ thể có thể tiết kiệm bao nhiêu thời gian và bộ nhớ GPU, cần kết hợp với phần cứng, độ chính xác, độ phân giải và số lượng đầu vào để đánh giá.
Tạo trực tiếp tài nguyên trong suốt có thể sử dụng
Khả năng tạo hình ảnh trong suốt là tính năng của phiên bản mới Qwen-Image gần nhất với nhu cầu thiết kế.
Các hình ảnh thông thường thường có nền đầy đủ. Để sử dụng đối tượng chính trong các poster, trang chi tiết sản phẩm hoặc một hình ảnh khác, thường cần cắt bỏ nền trước, xử lý viền, khe hở và cạnh. Hình ảnh trong suốt chứa thông tin độ trong suốt bổ sung, cho phép nền hiển thị qua xung quanh hoặc một phần vùng của đối tượng, giúp dễ dàng xếp chồng và kết hợp sau này.
Qwen-Image-2.1 hỗ trợ native tạo hình ảnh trong suốt, có thể tự động xác định liệu sẽ tạo hình ảnh thông thường hay hình ảnh trong suốt dựa trên lời nhắc; người dùng có thể yêu cầu nền trong suốt ngay khi mô tả tài nguyên. Các ví dụ hiện tại bao gồm tranh minh họa lễ hội, tài nguyên nhân vật, yếu tố trang trí và các tổ hợp phức tạp gồm nhiều đối tượng — tất cả đều đáp ứng nhu cầu tài nguyên phổ biến trong thiết kế. Chúng tôi cũng đã thử nghiệm:

Đây là tin tốt cho các nhà sáng tạo, giờ đây chúng ta có thể nhận được các tài nguyên sẵn sàng sử dụng, giúp giảm bớt vài bước trong quy trình làm việc.
Tất nhiên, sau khi tạo các tài nguyên trong suốt này, bạn vẫn có thể tiếp tục chỉnh sửa. Ví dụ: nhân vật trong cùng một bức tranh minh họa có thể điều chỉnh biểu cảm, nội dung văn bản trong hình ảnh có thể được thay đổi. Đối tượng chỉnh sửa có thể là các chi tiết hình ảnh của nhân vật hoặc văn bản trong tài nguyên.
Điều này rất gần với yêu cầu thực tế khi thiết kế: tên sự kiện đã thay đổi, nhưng họa tiết vẫn cần được giữ nguyên; biểu cảm cần nhẹ nhàng hơn, nhưng nhân vật vẫn phải được nhận diện là cùng một nhân vật. Sau khi các yêu cầu tiếp theo được đưa vào cùng một mô hình, chúng đã có một điểm xử lý thống nhất.
Tất nhiên, Qwen-Image-2.1 hỗ trợ xử lý các bức ảnh đã có.


Đối tác chính thức đã đưa ra ví dụ về việc trích xuất nội dung cần thiết từ ảnh thật để tạo ra hình ảnh RGBA trong suốt. Trong đó, A đại diện cho kênh độ trong suốt, dùng để mô tả mức độ trong suốt tại các vùng khác nhau của hình ảnh.
Rõ ràng, khả năng này vừa phục vụ việc tạo ra từ đầu, vừa bao gồm việc tái sử dụng các hình ảnh đã có. Người sáng tạo có thể cung cấp hình ảnh trước, sau đó yêu cầu mô hình trích xuất chủ thể cần thiết từ đó làm nguyên liệu cho các thiết kế tiếp theo.
Trước đây, chuỗi Qwen-Image đã ra mắt Qwen-Image-Layered độc lập để khám phá các khả năng liên quan đến hình ảnh trong suốt. Lần này, Qwen-Image-2.1 đã tích hợp sẵn khả năng tạo và chỉnh sửa hình ảnh trong suốt vào mô hình hình ảnh tổng quát, nâng cao thêm sự tiện lợi.
Đã có mô hình AI mã nguồn mở chính xác cho việc chỉnh sửa nhiều hình ảnh
Khi yêu cầu về một hình ảnh đến từ nhiều đối tượng, nhiệm vụ chỉnh sửa sẽ trở nên phức tạp hơn.
Ví dụ: nếu muốn mặc cùng một bộ quần áo, giày, túi xách và mũ lên cùng một người mẫu, mỗi hình tham chiếu đều có vai trò khác nhau, mô hình cần phân biệt giữa người và sản phẩm, đặt chúng vào vị trí hợp lý và cố gắng giữ nguyên các đặc điểm riêng của từng yếu tố.
Qwen-Image-2.1 hỗ trợ tối đa 10 hình ảnh tham chiếu. Chúng tôi đã thử nghiệm, cho Ultraman và Dario ngồi lại nói chuyện. Sử dụng 7 hình ảnh: ảnh hai người đối mặt (thay đổi biểu cảm), phòng nền, ghế sofa đơn, cốc cà phê (đổ đầy cà phê), đèn sàn, lò sưởi điện treo tường, bàn thấp, cuối cùng tạo ra một hình ảnh hoàn chỉnh.

Hiện nay, bạn cũng có thể nhanh chóng xem hiệu ứng mặc đồ với các trang phục khác nhau, đồng thời có thể ghép nhiều ảnh chụp cá nhân thành một bức ảnh nhóm.
Về mặt kỹ thuật, chúng không chỉ kiểm tra xem mô hình AI có thể nhận bao nhiêu hình ảnh đầu vào, mà còn bao gồm việc các đối tượng tham chiếu có được đặt đúng vị trí trong khung hình cuối cùng, tỷ lệ, vị trí và phong cách tổng thể có hài hòa hay không.
Đã tạo ra tổng thể hình ảnh, tiếp theo thường sẽ có điều chỉnh chi tiết.
Qwen-Image-2.1 cung cấp các phương pháp như khoanh vùng, tô và mặt nạ độc lập để người dùng biểu đạt rõ ràng hơn vị trí cần chỉnh sửa. Ví dụ, bạn có thể sử dụng nhiều màu sắc để đánh dấu các khu vực khác nhau, yêu cầu thực hiện một lần chỉnh sửa để đồng thời loại bỏ trang phục của nhân vật trong ảnh và thay đổi màu tóc.

Sự tương tác này tạo ra mối quan hệ tương ứng giữa vị trí không gian và yêu cầu văn bản. Đối với các chỉnh sửa liên quan đến nhiều khu vực, người dùng có thể chỉ rõ nơi cần xóa, nơi cần thay thế và mong muốn thay đổi thành gì.
Cách tô phù hợp để đánh dấu trực tiếp vị trí của các đối tượng mới, nhưng việc chọn hoặc tô trực tiếp trên hình gốc cũng sẽ che khuất một phần hình ảnh. Vì vậy, mô hình còn hỗ trợ chỉ định khu vực chỉnh sửa thông qua hình ảnh mặt nạ bổ sung, giúp thông tin hình gốc được nhập đầy đủ vào mô hình. Đối với các thiết kế bao gồm người và sản phẩm, khả năng giữ nguyên này đặc biệt quan trọng.

Độ chính xác của văn bản, chất lượng hình ảnh
Dù thay đổi kiểu tóc hoặc bối cảnh, hình ảnh nhân vật vẫn cần giữ nguyên các đặc điểm nhận dạng ban đầu; khi thay đổi môi trường trưng bày sản phẩm, các yếu tố như văn bản bao bì, kết cấu và hình dạng cũng cần được giữ nhất quán càng nhiều càng tốt. Nếu không, dù hình ảnh có đẹp, nó cũng có thể không phù hợp với nhiệm vụ trưng bày ban đầu. Qwen-Image-2.1 nhấn mạnh khả năng giữ nguyên độ chân thực trong các cảnh chỉnh sửa nhân vật và sản phẩm, và hiệu quả trông khá tốt.
Chúng tôi đã thử một chút, ví dụ như để nó chụp màn hình trang này trong sách Công nghệ Thông tin lớp 3, học kỳ 1, DeepSeek Lời chào mừng: Tôi là DeepSeek ,很高兴见到你!」 thành 「Xin chào, tôi có thể giúp gì cho bạn?», sau đó thay nút Deep Thinking (R1) bằng nút Deep Thinking phiên bản mới nhất và bật sáng:

Ngoài việc tạo và chỉnh sửa, Qwen-Image-2.1 còn tiếp tục cải thiện hiệu suất trong việc xử lý văn bản và nhân vật. Dù là trang hình ảnh có mật độ văn bản cao, infographics hay hình minh họa cho bài nghiên cứu, độ chính xác của nội dung và tính thẩm mỹ của bố cục đều được nâng lên một mức đáng kể.

Ở phần chân dung, Qwen-Image-2.1 đã tăng cường đáng kể khả năng biểu hiện ánh sáng và chi tiết. Hiện tại, hình ảnh do AI tạo ra, dù là sợi tóc, kết cấu trang phục, chi tiết khuôn mặt hay ánh sáng môi trường, đều trở nên hài hòa hơn và chất lượng hình ảnh tinh tế hơn.
Ngoài ra, còn có khả năng tạo hình ảnh toàn cảnh, infographics, hình chiếu ba mặt và hình ảnh phân cảnh tốt hơn, mở rộng phạm vi ứng dụng của việc tạo và chỉnh sửa hình ảnh tĩnh, mang lại nhiều khả năng hơn cho các nhiệm vụ như trưng bày nhân vật và lập kế hoạch trực quan. Chúng tôi đã thử sử dụng các nhân vật Qwen do cộng đồng tạo ra để tạo ra một chuỗi minh họa phân cảnh:

Sự kết hợp các khả năng này giúp Qwen-Image-2.1 bao phủ toàn bộ chuỗi xử lý hình ảnh một cách hoàn chỉnh hơn; hiện tại, chúng ta có thể thực hiện nhiều công việc dựa trên một mô hình AI: trước tiên sử dụng nhiều hình ảnh tham chiếu để tổ chức bố cục, sau đó điều chỉnh các khu vực, đồng thời cố gắng giữ nguyên các đặc điểm quan trọng của nhân vật và sản phẩm. Mức độ giảm thiểu công việc sửa đổi mà một mô hình AI mã nguồn mở với chỉ 7B tham số có thể đạt được trong phần tạo hình ảnh sẽ là vấn đề đáng quan tâm trong các bài kiểm tra thực tế tiếp theo.
Ứng dụng có quy mô lớn đến đâu?
Việc ra mắt Qwen-Image-2.1 cho thấy các mô hình hình ảnh đang ngày càng bao phủ nhiều khâu tinh细化 hơn trong quy trình sáng tạo, và xu hướng này đang trở nên ngày càng nhanh hơn.
Việc cải thiện khả năng xuất ra hình ảnh có nền trong suốt, tham khảo nhiều hình ảnh, chỉnh sửa cục bộ và độ trung thực đã tăng khả năng tích hợp mô hình AI vào quy trình làm việc thực tế. Đối với các nhà sáng tạo, điều này có nghĩa là nhiều công việc tạo và điều chỉnh tài nguyên có thể được thực hiện dễ dàng hơn thông qua các mô hình sinh ảnh mã nguồn mở; đối với các nhà phát triển, việc mở nguồn mô hình mới cũng cung cấp nền tảng mới để xây dựng các công cụ thiết kế, ứng dụng và quy trình làm việc tùy chỉnh dựa trên những khả năng này.
Chúng ta có thể dự đoán rằng, với sự mở nguồn của các mô hình hình ảnh như Qwen-Image-2.1, cộng đồng sẽ tiếp tục tích hợp khả năng tạo và chỉnh sửa vào nhiều bối cảnh sản xuất nội dung hơn, giúp nhiều người hơn tiếp cận được các công cụ sáng tạo phù hợp với nhu cầu của họ. Khi những khả năng AI này trở thành các tính năng sẵn sàng sử dụng trong phần mềm hàng ngày, rào cản từ ý tưởng đến tác phẩm trực quan có thể lại một lần nữa được giảm đáng kể.
Hiện tại, trọng số mở của Qwen-Image-2.1 đã được phát hành trên Hugging Face và ModelScope, báo cáo kỹ thuật đã được tải lên kho lưu trữ GitHub.
Blog: https://qwen.ai/blog?id=qwen-image-2.1
GitHub: https://github.com/QwenLM/Qwen-Image-2.1
Phạm vi mô hình: https://www.modelscope.cn/models/Qwen/Qwen-Image-2.1
Hugging Face: https://huggingface.co/Qwen/Qwen-Image-2.1
Bài viết này đến từ tài khoản WeChat “Machine Heart” (ID: almosthuman2014), tác giả: Zé Nán
