OpenAI、より高速な生成と強化された編集機能を備えたGPT-Image-2.5を発表

icon MarsBit
共有
AI summary icon概要
OpenAIはGPT-Image-2.5をリリースし、生成速度の向上と編集機能の改善を実現しました。新バージョンは最大50%高速化され、スケッチ入力モードが追加されました。API利用者は、速度にはFlare、品質にはSunburstを選択できるようになりました。中国語のレンダリング問題は修正され、作成を簡単にするためのテンプレートも利用可能になりました。この更新はBTCのアップデートと並んで行われ、今後新たなトークン上場の可能性を示唆しています。

先ほど、OpenAIがGPT-Images-2.5をリリースしました:

生成遅延が最大で半減し、編集精度が向上。スケッチ手書き入力機能が追加され、APIエンドポイントで初めて高速・低速の2つのモデルが分離されました。

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

ChatGPT、ChatGPT Work、Codex のすべてのユーザーに無料版を含めて提供します。

この数字に換算すると、日平均約4億3千万枚の画像がこのシステムを経て処理されており、生成速度の向上による体感的な変化は、一般的な機能改善をはるかに上回る範囲に及んでいます。

OpenAIは、ChatGPT ImagesとGPT-Image APIの合計生成量を、週間30億枚と発表しました。

デモが驚き:中国語の文字化けが解消されました

GPT-Image-2.5はどれほど強力なのか?実際にデモを見てみましょう。

中国語の文字化けが消えました!

GPT-Image-2.5

これは参照画像です:

GPT-Image-2.5

これが出力されたレトロな画像です:

GPT-Image-2.5

あなたは本物の写真とAI生成画像をまだ見分けられますか?

古い写真をスキャンして高清なデジタル写真に変換するのは簡単です。

GPT-Image-2.5

服装のビジュアル効果を試してみたいですか?ChatGPTに任せてください:

入力:

GPT-Image-2.5

出力:

GPT-Image-2.5

元の画像を入力してください、布団がぐちゃぐちゃです:

GPT-Image-2.5

布団を整えた画像を出力しました:

GPT-Image-2.5

シーンの整合性が非常に高く、抜けている部分は一切見られません。

半分早くなり、修正して乱れなくなりました

最も直接的な速度向上。OpenAIが提示した数値では、生成遅延がImages 2.0と比較して最大50%削減されます。

照明とテクスチャのレンダリング品質が同時に改善され、写真中の被写体の再現度も向上しています。

精密編集は、生成ツールの従来の課題に対処します:ユーザーが一部を変更するよう要求しても、モデルは変更を求めていない部分も変更してしまう問題です。

OpenAIによると、Images 2.5は指定された領域のみを変更し、画面上のその他の要素の構図、照明、主な特徴を保持できます。複雑な背景や複数の被写体を含むシーンでの安定性が著しく向上しています。

ユーザーは画像上に直接コメントを付けて、修正が必要な部分を囲むことができ、操作感はデザインツールFigmaに近いです。

GPT-Image-2.5

マルチラウンド編集の一貫性が第三の改善点です。

長い会話の中で同じ画像を繰り返し編集する場合、最初の数回の編集結果は維持され、画質は回数とともに低下しません。

GPT-Image-2.5

Higgsfield AIの製品責任者であるAxultan Alimkulovは、Flareについて次のように評価しています:

私たちが最も印象に残ったのは、「何を変えてはいけないか」を理解している点です。

元の画像のキャラクター、構図、ビジュアルスタイルを損なうことなく、意味のある編集を行ってください。

GPT-Image-2.5

Sketchとテンプレート:タイプから描画へ

製品面で、Images 2.5は4つの新機能を導入しました。

Sketchの起動方法は、ChatGPTのチャットボックスで@Sketchと入力し、手書きパネルを開くことです。ユーザーがスケッチを描き、スタイルや詳細をテキストで説明すると、ChatGPTはそのスケッチを構図の参考にして完成画像を生成します。

OpenAIが提示した例には、部屋のレイアウトのスケッチを室内デザインのレンダリングに変換するものや、人物の輪郭スケッチをイラストに変換するものがあります。技術的な描画力ではなく、空間関係と大まかな比率を描き出し、モデルが画面上の構造を理解できるようにすることが鍵です。

テンプレートはポスター、商品画像、チラシなどの頻繁に使用されるフォーマットをカバーしています。

テンプレートを選択し、情報とスタイルの好みを入力すると、モデルが事前に設定された構造に従って画像を生成し、ゼロからPromptを書くための試行錯誤を省略できます。

Promptを共有して、ユーザーが生成した画像の完全なPromptを公開し、他の人が自分の写真や詳細を組み合わせることで、同じフレームワークで個人版を生成できるようにします。

「80年代レトロポートレート」のプロンプトがソーシャルメディア上で広まっており、ユーザーが自撮りをアップロードすると、同じスタイルの写真が生成されます。

GPT-Image-2.5

4つの機能は同じ変化を指向しています:脳内のイメージを画像に変えるプロセスが、もはやタイピングだけに頼らなくてもよくなりました!

Flare と Sunburst:API が初めて二分される

開発者向けに、OpenAIはAPI側で2つの画像モデル、GPT-Image-2.5 FlareおよびGPT-Image-2.5 Sunburstを同時リリースしました。

Flareは速度と一括生成を強みとし、OpenAIはこれをほとんどのアプリケーションのデフォルト選択肢として位置づけています。

適用シーンには、ソーシャルコンテンツ、製品体験図、迅速なプロトタイプ、高頻度での画像作成が含まれます。

Manus評価チームのLucky Liaoが提供したデータはより具体的である:FlareはテストにおいてGPT-Image-2の2〜4倍の画像生成速度を達成し、透明背景の生成改善は、プログラムによるブランド素材、プレゼンテーション、ウェブページ用画像の生成に直接役立つ。

GPT-Image-2.5

Sunburstは、高級なクリエイティブワークフローを目的としており、より詳細な編集制御を実現するために、生成に時間をかけます。

OpenAIが提示する典型的なシナリオは、ブランドマーケティング用の完成品レベルの素材と精緻に編集された製品画像です。

Adobeは、FireflyにImages 2.5モデルを統合したことを確認しました。

アドビ製品上級ディレクターのマット・チョチンは、バージョン2.5により生成速度と解像度の一貫性が向上し、複数回の精錬を経ても画像が鮮明でリアルなまま保たれると述べました。

GPT-Image-2.5

2つのモデルの分割は、高頻度低遅延と高精度カスタマイズという2つのニーズに対応しています。

Flareはボリュームの多いシナリオ向け、Sunburstは高品質なシナリオ向けです。開発者はビジネス要件に応じて選択でき、必要のない精度のために待ち時間を費やす必要はありません。

これはOpenAI画像APIが初めて速度と品質に基づいて製品を階層化したことで、言語モデルAPIの段階分けと論理が一貫しています。

Images 2.5 の名前は、OpenAIの画像製品ラインのペースに沿っており、アーキテクチャは変更せず、速度と精度がまず一段階向上しました。

2024年末のGPT-Image-1.5も同じ手法を使用していた。

0.5バージョンの間隔が1年未満であり、画像モデルの更新頻度が言語モデルに近づいてきている。

これは世界で最も強力な画像生成モデルであり、圧倒的なリードを築いています。

OpenAIの継続的なマルチモーダル能力の強化は、Anthropicのモデルに対抗するため、Computer-Use能力を含むGPT-7などのベースモデルの能力を強化している可能性が高い。

参考資料:

https://openai.com/index/introducing-chatgpt-images-2-5/

本文は微信公衆アカウント「新智元」(ID:AI_era)より、著者:ASI启示録、編集:馬可

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。