Vừa rồi, OpenAI đã phát hành GPT-Images-2.5:
Thời gian tạo trễ giảm xuống còn một nửa, độ chính xác khi chỉnh sửa được cải thiện, thêm tính năng nhập liệu vẽ tay Sketch, lần đầu tiên tách riêng hai mô hình nhanh và chậm tại API.

https://x.com/OpenAI/status/2097394956457623964
Mở rộng cho tất cả người dùng của ChatGPT, ChatGPT Work và Codex, bao gồm phiên bản miễn phí.
Theo con số này, trung bình khoảng 430 triệu hình ảnh mỗi ngày đi qua hệ thống này, mang lại cảm nhận cải thiện tốc độ sinh sản vượt xa so với các bản cập nhật chức năng thông thường.
OpenAI đã công bố tổng số hình ảnh được tạo bởi ChatGPT Images và GPT-Image API: 3 tỷ hình ảnh mỗi tuần.
Demo ấn tượng: Không còn lỗi ký tự Trung Quốc
GPT-Image-2.5 mạnh đến mức nào? Chúng ta cùng xem trực tiếp Demo.
Mã tiếng Trung đã không còn bị lỗi!

Đây là hình ảnh tham khảo:

Đây là hình ảnh cổ điển được xuất ra:

Bạn còn phân biệt được ảnh thật và ảnh do AI tạo ra không?
Chuyển ảnh in cũ thành ảnh điện tử độ phân giải cao, chỉ là chuyện nhỏ.

Muốn thử hiệu ứng hình ảnh của trang phục mới? Hãy để ChatGPT lo giúp bạn:
Nhập:

Output:

Nhập hình ảnh gốc, chăn bông lộn xộn:

Đã xuất hình ảnh chăn được gấp gọn gàng:

Tính nhất quán của cảnh rất cao, không thấy điểm nào bị lộ.
Nhanh hơn một nửa, sửa rồi không lộn xộn nữa
Tăng tốc độ rõ ràng nhất. Con số mà OpenAI đưa ra là độ trễ khi tạo hình ảnh giảm tới 50% so với Images 2.0.
Chất lượng hiển thị ánh sáng và kết cấu được cải thiện đồng thời, độ chính xác trong việc tái hiện nhân vật chính trong ảnh tham chiếu cũng cao hơn.
Chỉnh sửa chính xác nhắm vào một vấn đề cũ của công cụ tạo hình: người dùng yêu cầu thay đổi một phần, nhưng mô hình lại thay đổi cả những phần không được yêu cầu.
Theo OpenAI, Images 2.5 có thể chỉ chỉnh sửa các khu vực được chỉ định, đồng thời giữ nguyên bố cục, ánh sáng và đặc điểm chính của các yếu tố còn lại trong khung hình, với độ ổn định đáng kể cải thiện trong các cảnh có nền phức tạp và nhiều đối tượng.
Người dùng cũng có thể đặt bình luận và đánh dấu trực tiếp trên hình ảnh, khoanh vùng các vị trí cần chỉnh sửa, thao tác tương tự các công cụ thiết kế như Figma.

Sự nhất quán trong nhiều lần chỉnh sửa là cải tiến thứ ba.
Khi chỉnh sửa cùng một hình ảnh nhiều lần trong một cuộc hội thoại dài, các kết quả chỉnh sửa ở các vòng đầu tiên sẽ được giữ nguyên, chất lượng hình ảnh không giảm theo số vòng.

Axultan Alimkulov, Trưởng sản phẩm của Higgsfield AI, đánh giá Flare rằng:
Điều ấn tượng nhất với chúng tôi là sự hiểu biết của nó về những gì không nên thay đổi.
Thực hiện một lần chỉnh sửa có ý nghĩa, không làm mất đi nhân vật, bố cục và phong cách thị giác của hình ảnh gốc.

Sketch và mẫu: Từ gõ chữ đến vẽ tranh
Ở cấp độ sản phẩm, Images 2.5 mang đến bốn tính năng mới.
Để truy cập Sketch, hãy nhập @Sketch trong khung hội thoại của ChatGPT để mở bảng vẽ tay. Người dùng vẽ một bản phác thảo, kèm theo mô tả bằng văn bản về phong cách và chi tiết, ChatGPT sẽ tạo ra hình ảnh hoàn chỉnh dựa trên bản phác thảo làm tham khảo bố cục.
Các ví dụ do OpenAI đưa ra bao gồm bản phác thảo bố trí phòng chuyển thành hình ảnh render thiết kế nội thất, bản phác thảo đường viền nhân vật chuyển thành tranh minh họa. Rào cản không nằm ở kỹ năng vẽ, mà ở việc thể hiện mối quan hệ không gian và tỷ lệ tổng thể, để mô hình hiểu được cấu trúc hình ảnh.
Mẫu bao phủ các định dạng phổ biến như áp phích, hình sản phẩm, tờ rơi, v.v.
Chọn một mẫu, điền thông tin và sở thích phong cách, mô hình sẽ tạo hình theo cấu trúc đã định sẵn, giúp tiết kiệm thời gian thử nghiệm khi viết Prompt từ đầu.
Chia sẻ để người dùng đăng toàn bộ Prompt đã tạo ra hình ảnh, người khác có thể sử dụng ảnh và chi tiết của riêng mình để tạo phiên bản cá nhân trong cùng một khung.
Một prompt “chân dung hoài cổ những năm 80” đã lan truyền trên các nền tảng mạng xã hội, người dùng có thể tải lên ảnh tự sướng để tạo ra ảnh cùng phong cách.

Bốn tính năng đều hướng đến một sự thay đổi: quá trình biến hình ảnh trong đầu thành hình ảnh không còn chỉ dựa vào gõ phím!
Flare và Sunburst: API lần đầu tiên được tách đôi
Đối với các nhà phát triển, OpenAI đồng thời ra mắt hai mô hình hình ảnh trên API: GPT-Image-2.5 Flare và GPT-Image-2.5 Sunburst.
Flare nổi bật với tốc độ và khả năng tạo hàng loạt, OpenAI định vị nó là lựa chọn mặc định cho hầu hết các ứng dụng.
Các tình huống áp dụng bao gồm nội dung mạng xã hội, hình ảnh trải nghiệm sản phẩm, bản mẫu nhanh và tạo hình ảnh tần suất cao.
Dữ liệu do Lucky Liao từ đội ngũ đánh giá Manus cung cấp cụ thể hơn: Flare đạt tốc độ tạo hình trong các bài kiểm tra của họ nhanh gấp 2 đến 4 lần so với GPT-Image-2, và sự cải tiến trong việc tạo nền trong suốt có ích trực tiếp cho việc tạo nội dung thương hiệu tự động, bài thuyết trình và hình ảnh minh họa trang web.

Sunburst định vị dòng công việc sáng tạo cao cấp, đổi thời gian tạo dài hơn để lấy quyền kiểm soát chỉnh sửa tinh vi hơn.
Các tình huống điển hình mà OpenAI đưa ra là tài liệu marketing thương hiệu cấp sản phẩm và hình ảnh sản phẩm đã được chỉnh sửa tinh vi.
Adobe đã xác nhận tích hợp mô hình Images 2.5 vào Firefly.
Matt Chotin, Giám đốc cấp cao sản phẩm của Adobe, cho biết phiên bản 2.5 mang lại tốc độ tạo nhanh hơn và độ nhất quán về độ phân giải, giúp hình ảnh vẫn giữ được độ rõ nét và cảm giác chân thực sau nhiều lần tinh chỉnh.

Việc chia tách hai mô hình tương ứng với hai nhu cầu: giao dịch tần suất cao, độ trễ thấp và tùy chỉnh độ chính xác cao.
Flare cung cấp kịch bản cho các tình huống cần khối lượng giao dịch, Sunburst cung cấp kịch bản cho các tình huống cần độ chính xác cao, các nhà phát triển có thể lựa chọn phù hợp với nhu cầu kinh doanh mà không cần chờ đợi thời gian cho độ chính xác không cần thiết.
Đây là lần đầu tiên OpenAI phân cấp sản phẩm cho API hình ảnh dựa trên tốc độ và chất lượng, tuân theo cùng một logic và phân hạng như API mô hình ngôn ngữ.
Việc đặt tên cho Images 2.5 tiếp tục nhịp điệu của dòng sản phẩm hình ảnh của OpenAI: kiến trúc không thay đổi, tốc độ và độ chính xác đã được nâng cao lần đầu tiên.
GPT-Image-1.5 vào cuối năm 2024 sử dụng cùng một phương pháp.
Hai phiên bản 0.5 cách nhau chưa đầy một năm, tần suất cập nhật mô hình hình ảnh đang tiến gần đến mô hình ngôn ngữ.
Đây là mô hình tạo hình ảnh mạnh nhất thế giới, dẫn đầu vượt trội.
Khả năng đa mô hình ngày càng được cải thiện của OpenAI rất có thể là để đối phó với các mô hình của Anthropic, thông qua việc tăng cường các khả năng bao gồm cả khả năng sử dụng máy tính, từ đó nâng cao năng lực của các mô hình nền tảng như GPT-7.
Tài liệu tham khảo:
https://openai.com/index/introducing-chatgpt-images-2-5/
Bài viết này đến từ tài khoản WeChat “Tân Trí Nguyên” (ID: AI_era), tác giả: ASI Khải Lộ, biên tập: Mã Khắc
