OpenAI запускає GPT-Image-2.5 із швидшим генеруванням та покращеним редагуванням

icon MarsBit
Поділитися
AI summary iconКороткий зміст
OpenAI запустила GPT-Image-2.5, що забезпечує швидше генерування та покращене редагування. Нова версія працює до 50% швидше і додає режим введення ескізу. Користувачі API тепер можуть вибирати між Flare для швидкості та Sunburst для якості. Виправлено проблеми з відображенням китайського тексту, а також доступні шаблони для спрощення створення. Оновлення виходить разом із оновленням BTC і намічає нові лістинги токенів у майбутньому.

Щойно OpenAI випустила GPT-Images-2.5:

Затримка генерації зменшена майже наполовину, точність редагування покращена, додано функцію введення від руки Sketch, API вперше розділено на дві моделі — швидку та повільну.

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

Доступно для всіх користувачів ChatGPT, ChatGPT Work і Codex, включно з безкоштовною версією.

За цим розрахунком, щодня цією системою проходить приблизно 430 мільйонів зображень, і відчутне прискорення генерації охоплює набагато ширший спектр, ніж звичайні оновлення функцій.

OpenAI оприлюднила загальну кількість згенерованих зображень ChatGPT Images та GPT-Image API: 3 мільярди зображень на тиждень.

Демо вражає: китайські символи зіпсовані більше не існують

Наскільки потужний GPT-Image-2.5? Давайте подивимося на демо.

Китайські символи зіпсування більше не з’являються!

GPT-Image-2.5

Це зображення для довідки:

GPT-Image-2.5

Це вихідне ретро-зображення:

GPT-Image-2.5

Чи ще можете відрізнити справжні фотографії від зображень, створених ШІ?

Витягнути та перетворити друковані фотознімки на високоякісні електронні зображення — дрібниця.

GPT-Image-2.5

Хочете спробувати візуальний ефект вдягнення одягу? Просто покладіться на ChatGPT:

Введення:

GPT-Image-2.5

Вивід:

GPT-Image-2.5

Введіть оригінальне зображення, ковдра в хаосі:

GPT-Image-2.5

Надіслано зображення аккуратно складеного ковдра:

GPT-Image-2.5

Дуже висока відповідність сцені, немає помилок.

На половину швидше, виправлено, щоб не було хаосу

Найбільш безпосереднє прискорення швидкості. OpenAI повідомляє, що затримка генерації зменшена до 50% порівняно з Images 2.0.

Якість відтворення світла і текстури покращена, а також вища точність відтворення головного об’єкта на фотографії.

Точне редагування стосується старої проблеми інструментів генерації зображень: користувачі вимагають змінити лише частину зображення, а модель змінює й ті частини, які не мали змінюватися.

За словами OpenAI, Images 2.5 може змінювати лише вказані області, зберігаючи композицію, освітлення та основні характеристики решти зображення, а також значно підвищує стабільність у складних фонових та багатооб’єктних сценах.

Користувачі також можуть накладати коментарі та позначки безпосередньо на зображеннях, виділяючи місця, які потрібно змінити, — логіка дій схожа на інструменти дизайну Figma.

GPT-Image-2.5

Послідовність багатократних редагувань — це третє покращення.

Під час довгих діалогів при багаторазовому редагуванні однієї й тієї ж зображення, результати перших кроків зберігаються, а якість зображення не погіршується з кожною ітерацією.

GPT-Image-2.5

Гігсфілд AI, керівник продукту Аксултан Алімкулов, прокоментував Flare:

Найбільше нас вразило його розуміння того, що не варто змінювати.

Зробіть значуще редагування, не втрачаючи оригінального зображення, персонажів, композиції та візуального стилю.

GPT-Image-2.5

Sketch та шаблони: від набору тексту до малювання

На рівні продукту Images 2.5 принесла чотири нові функції.

Для доступу до Sketch введіть @Sketch у чатовому вікні ChatGPT, щоб відкрити панель малювання. Користувач малює ескіз, додаючи текстовий опис стилю та деталей, а ChatGPT генерує фінальне зображення, використовуючи ескіз як основу для композиції.

Приклади, надані OpenAI, включають перетворення ескізів розташування кімнати на рендеринг інтер’єру, а також ескізів силуетів персонажів на ілюстрації. Поріг не полягає в майстерності малювання, а в здатності передати просторові відношення та загальні пропорції, щоб модель зрозуміла структуру зображення.

Шаблони охоплюють поширені формати: плакати, зображення товарів, листівки тощо.

Виберіть шаблон, введіть інформацію та стилеві переваги — модель створить зображення за передбаченою структурою, економлячи час на спроби й помилки при написанні запиту з нуля.

Підсумуйте, щоб користувачі розміщували повний Prompt зі згенерованою картинкою, щоб інші могли використовувати свої фотографії та деталі, щоб створити власну версію в тій самій структурі.

Промпт «ретро-портрет у стилі 80-х» поширився у соціальних мережах — користувачі можуть завантажити свої фотографії та отримати зображення у тому ж стилі.

GPT-Image-2.5

Чотири функції спрямовані на одну зміну: процес перетворення образів у голові на зображення більше не залежить лише від набору тексту!

Flare та Sunburst: API вперше розділено

Для розробників OpenAI одночасно запускає два імідж-моделі на API: GPT-Image-2.5 Flare та GPT-Image-2.5 Sunburst.

Flare позиціонується OpenAI як стандартний вибір для більшості застосунків, з акцентом на швидкість та пакетну генерацію.

Підходить для соціальних матеріалів, зображень досвіду продукту, швидких прототипів та частого створення зображень.

Лакі Ляо з команди оцінки Manus надав більш конкретні дані: Flare досягає швидкості генерації зображень у 2–4 рази вищої, ніж GPT-Image-2, а покращення генерації прозорого фону безпосередньо корисне для програмної генерації брендових матеріалів, презентацій та ілюстрацій для веб-сайтів.

GPT-Image-2.5

Sunburst орієнтований на висококласні творчі робочі процеси, забезпечуючи більш точний контроль редагування за рахунок довшого часу генерації.

Типові сценарії, надані OpenAI, — це готові матеріали для бренд-маркетингу та відредаговані зображення продуктів.

Adobe підтвердила інтеграцію моделі Images 2.5 у Firefly.

Метт Чотін, високий директор з продуктів Adobe, сказав, що версія 2.5 забезпечує швидшу генерацію та консистентність роздільної здатності, зберігаючи чіткість і реалістичність зображень після кількох циклів покращення.

GPT-Image-2.5

Розбиття двох моделей відповідає двом вимогам: висока частота та низька затримка та висока точність на замовлення.

Flare надає сценарії для обсягів, Sunburst — для якісних сценаріїв; розробники вибирають за потребами бізнесу і не мають чекати на точність, яка їм не потрібна.

Це перший раз, коли OpenAI API для зображень розрізняє продукти за швидкістю та якістю, що узгоджується з логікою та архітектурою розподілу API мовних моделей.

Назва Images 2.5 продовжує темп розвитку лінійки зображень OpenAI: архітектура залишається незмінною, а швидкість і точність спочатку значно покращуються.

GPT-Image-1.5 наприкінці 2024 року використовував ту саму схему.

Два оновлення версії 0.5 відбулися менше ніж через рік — частота ітерацій моделей зображень наближається до частоти мовних моделей.

Це найпотужніша модель генерації зображень у світі, яка значно випереджає всі інші.

Постійне підвищення багатомодальних здібностей OpenAI, ймовірно, є відповіддю на моделі Anthropic шляхом підвищення здібностей базових моделей, таких як GPT-7, включаючи здатність використання комп’ютера.

Джерела:

https://openai.com/index/introducing-chatgpt-images-2-5/

Цей матеріал надійшов із офіційного аккаунту WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис, редактор: Ма Ко

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.