剛剛,OpenAI 發布了 GPT-Images-2.5:
生成延遲最多減半,編輯精度提升,新增 Sketch 手繪輸入功能,API 端首次拆出快慢兩檔模型。

https://x.com/OpenAI/status/2097394956457623964
Open to all users of ChatGPT, ChatGPT Work, and Codex, including the free tier.
According to this figure, approximately 430 million images per day pass through this system, and the perceived improvement in generation speed extends far beyond typical feature updates.
OpenAI 公布了 ChatGPT Images 與 GPT-Image API 的合計生成量:每週 30 億張圖片。
Demo 驚艷:中文亂碼不存在了
GPT-Image-2.5 到底有多強?我們直接看 Demo。
中文亂碼已經消失不見了!

這是參考的圖片:

這是輸出的復古圖片:

你還能分辨出真實照片和 AI 生成圖片了嗎?
將打印的老照片提取並重置為高清電子照片,輕而易舉。

想試試換裝的視覺效果?直接交給 ChatGPT 就行:
輸入:

Output:

輸入原始圖片,被子亂糟糟:

輸出了被子疊好的圖片:

Scene consistency is extremely strong, with no visible continuity errors.
快了一半,改了不亂
The speed improvement is the most direct. OpenAI states that the generation latency is reduced by up to 50% compared to Images 2.0.
The rendering quality of lighting and texture has been improved simultaneously, and the accuracy of reconstructing the subject in reference photos is also higher.
精準編輯針對的是生圖工具的一個老問題:用戶要求修改局部,模型卻連不該動的部分也一併更改了。
According to OpenAI, Images 2.5 can modify only the specified areas while preserving the composition, lighting, and subject characteristics of the rest of the image, with significantly improved stability in complex backgrounds and multi-subject scenes.
用戶還可以在圖片上直接添加評論標註,圈出需要修改的位置,操作邏輯與設計工具 Figma 相似。

Consistency in multi-round editing is the third improvement.
在長對話中反覆修改同一張圖片時,前幾輪的編輯結果能保持不變,畫質不會隨輪次下降。

Higgsfield AI 產品負責人 Axultan Alimkulov 評價 Flare 時表示:
最讓我們印象深刻的是它對「什麼不該改」的理解。
Make a meaningful edit without losing the original image’s characters, composition, and visual style.

Sketch 和模板:從打字到畫圖
在產品層面,Images 2.5 帶來了四個新功能。
在 ChatGPT 對話框中輸入 @Sketch 以進入 Sketch,開啟手繪面板。用戶繪製一張草圖,並附上文字描述風格與細節,ChatGPT 便會以該草圖為構圖參考生成成品圖。
OpenAI 提供的範例包括將房間佈局草圖轉為室內設計渲染圖、人物輪廓草圖轉為插畫。門檻不在於繪畫技巧,而在於呈現空間關係與大致比例,讓模型理解畫面結構。
模板涵蓋海報、商品圖、傳單等高頻格式。
選擇一個模板,填入資訊與風格偏好,模型將依預設結構生成圖像,省去從零撰寫 Prompt 的試錯過程。
Prompt 分享讓用戶發出已生成圖片的完整 Prompt,他人可將自己的照片和細節代入,在同一框架下生成個人版本。
一條「80 年代復古肖像」Prompt 已在社交平台上流傳,用戶上傳自拍即可生成同風格照片。

四個功能指向同一個變化:將腦中的畫面轉變為圖片的過程,不再僅靠打字了!
Flare 與 Sunburst:API 首次一分为二
面向開發者,OpenAI 在 API 端同步推出兩款圖像模型:GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst。
Flare 強調速度與批量生成,OpenAI 將其定位為大多數應用的預設選擇。
適用場景包括社交內容、產品體驗圖、快速原型和高頻出圖。
Manus 評測團隊的 Lucky Liao 提供了更具體的數據:Flare 在他們的測試中,出圖速度達到 GPT-Image-2 的 2 到 4 倍,透明背景生成的改進對程式化生成品牌素材、簡報和網頁配圖直接有用。

Sunburst 定位高端創意工作流,以更長的生成時間換取更精細的編輯控制。
OpenAI 提供的典型場景是品牌行銷的成品級素材和精修產品圖。
Adobe 已確認在 Firefly 中接入 Images 2.5 模型。
Adobe 產品高級總監 Matt Chotin 表示,2.5 版本帶來了更快的生成速度和更高的解析度一致性,圖片在多輪精修後仍能保持清晰與真實感。

兩款模型的拆分對應兩種需求:高頻低延遲 和 高精度定製。
Flare 提供高吞吐量的場景,Sunburst 提供高精度的場景,開發者可根據業務需求選擇,無需為未使用的精度付出等待時間。
這是 OpenAI 圖像 API 首次根據速度和品質進行產品分層,其邏輯與語言模型 API 的分檔一脈相承。
Images 2.5 的命名延續了 OpenAI 圖像產品線的節奏:架構不變,速度和精度先飛升一輪。
GPT-Image-1.5 at the end of 2024 used the same approach.
兩次 0.5 版本的間隔不到一年,圖像模型的迭代頻率正逐漸向語言模型看齊。
這是世界上最強的生圖模型,大幅領先。
OpenAI 不斷增強的多模態能力,很可能是為了應對 Anthropic 的模型,透過增強包括 Computer-Use 能力在內的技術,進而提升 GPT-7 等基座模型的能力。
參考資料:
https://openai.com/index/introducing-chatgpt-images-2-5/
本文來自微信公眾號「新智元」(ID:AI_era),作者:ASI 啟示錄,編輯:馬可
