Щойно OpenAI випустила GPT-Images-2.5:
Затримка генерації зменшена майже наполовину, точність редагування покращена, додано функцію введення від руки Sketch, API вперше розділено на дві моделі — швидку та повільну.

https://x.com/OpenAI/status/2097394956457623964
Доступно для всіх користувачів ChatGPT, ChatGPT Work і Codex, включно з безкоштовною версією.
За цим розрахунком, щодня цією системою проходить приблизно 430 мільйонів зображень, і відчутне прискорення генерації охоплює набагато ширший спектр, ніж звичайні оновлення функцій.
OpenAI оприлюднила загальну кількість згенерованих зображень ChatGPT Images та GPT-Image API: 3 мільярди зображень на тиждень.
Демо вражає: китайські символи зіпсовані більше не існують
Наскільки потужний GPT-Image-2.5? Давайте подивимося на демо.
Китайські символи зіпсування більше не з’являються!

Це зображення для довідки:

Це вихідне ретро-зображення:

Чи ще можете відрізнити справжні фотографії від зображень, створених ШІ?
Витягнути та перетворити друковані фотознімки на високоякісні електронні зображення — дрібниця.

Хочете спробувати візуальний ефект вдягнення одягу? Просто покладіться на ChatGPT:
Введення:

Вивід:

Введіть оригінальне зображення, ковдра в хаосі:

Надіслано зображення аккуратно складеного ковдра:

Дуже висока відповідність сцені, немає помилок.
На половину швидше, виправлено, щоб не було хаосу
Найбільш безпосереднє прискорення швидкості. OpenAI повідомляє, що затримка генерації зменшена до 50% порівняно з Images 2.0.
Якість відтворення світла і текстури покращена, а також вища точність відтворення головного об’єкта на фотографії.
Точне редагування стосується старої проблеми інструментів генерації зображень: користувачі вимагають змінити лише частину зображення, а модель змінює й ті частини, які не мали змінюватися.
За словами OpenAI, Images 2.5 може змінювати лише вказані області, зберігаючи композицію, освітлення та основні характеристики решти зображення, а також значно підвищує стабільність у складних фонових та багатооб’єктних сценах.
Користувачі також можуть накладати коментарі та позначки безпосередньо на зображеннях, виділяючи місця, які потрібно змінити, — логіка дій схожа на інструменти дизайну Figma.

Послідовність багатократних редагувань — це третє покращення.
Під час довгих діалогів при багаторазовому редагуванні однієї й тієї ж зображення, результати перших кроків зберігаються, а якість зображення не погіршується з кожною ітерацією.

Гігсфілд AI, керівник продукту Аксултан Алімкулов, прокоментував Flare:
Найбільше нас вразило його розуміння того, що не варто змінювати.
Зробіть значуще редагування, не втрачаючи оригінального зображення, персонажів, композиції та візуального стилю.

Sketch та шаблони: від набору тексту до малювання
На рівні продукту Images 2.5 принесла чотири нові функції.
Для доступу до Sketch введіть @Sketch у чатовому вікні ChatGPT, щоб відкрити панель малювання. Користувач малює ескіз, додаючи текстовий опис стилю та деталей, а ChatGPT генерує фінальне зображення, використовуючи ескіз як основу для композиції.
Приклади, надані OpenAI, включають перетворення ескізів розташування кімнати на рендеринг інтер’єру, а також ескізів силуетів персонажів на ілюстрації. Поріг не полягає в майстерності малювання, а в здатності передати просторові відношення та загальні пропорції, щоб модель зрозуміла структуру зображення.
Шаблони охоплюють поширені формати: плакати, зображення товарів, листівки тощо.
Виберіть шаблон, введіть інформацію та стилеві переваги — модель створить зображення за передбаченою структурою, економлячи час на спроби й помилки при написанні запиту з нуля.
Підсумуйте, щоб користувачі розміщували повний Prompt зі згенерованою картинкою, щоб інші могли використовувати свої фотографії та деталі, щоб створити власну версію в тій самій структурі.
Промпт «ретро-портрет у стилі 80-х» поширився у соціальних мережах — користувачі можуть завантажити свої фотографії та отримати зображення у тому ж стилі.

Чотири функції спрямовані на одну зміну: процес перетворення образів у голові на зображення більше не залежить лише від набору тексту!
Flare та Sunburst: API вперше розділено
Для розробників OpenAI одночасно запускає два імідж-моделі на API: GPT-Image-2.5 Flare та GPT-Image-2.5 Sunburst.
Flare позиціонується OpenAI як стандартний вибір для більшості застосунків, з акцентом на швидкість та пакетну генерацію.
Підходить для соціальних матеріалів, зображень досвіду продукту, швидких прототипів та частого створення зображень.
Лакі Ляо з команди оцінки Manus надав більш конкретні дані: Flare досягає швидкості генерації зображень у 2–4 рази вищої, ніж GPT-Image-2, а покращення генерації прозорого фону безпосередньо корисне для програмної генерації брендових матеріалів, презентацій та ілюстрацій для веб-сайтів.

Sunburst орієнтований на висококласні творчі робочі процеси, забезпечуючи більш точний контроль редагування за рахунок довшого часу генерації.
Типові сценарії, надані OpenAI, — це готові матеріали для бренд-маркетингу та відредаговані зображення продуктів.
Adobe підтвердила інтеграцію моделі Images 2.5 у Firefly.
Метт Чотін, високий директор з продуктів Adobe, сказав, що версія 2.5 забезпечує швидшу генерацію та консистентність роздільної здатності, зберігаючи чіткість і реалістичність зображень після кількох циклів покращення.

Розбиття двох моделей відповідає двом вимогам: висока частота та низька затримка та висока точність на замовлення.
Flare надає сценарії для обсягів, Sunburst — для якісних сценаріїв; розробники вибирають за потребами бізнесу і не мають чекати на точність, яка їм не потрібна.
Це перший раз, коли OpenAI API для зображень розрізняє продукти за швидкістю та якістю, що узгоджується з логікою та архітектурою розподілу API мовних моделей.
Назва Images 2.5 продовжує темп розвитку лінійки зображень OpenAI: архітектура залишається незмінною, а швидкість і точність спочатку значно покращуються.
GPT-Image-1.5 наприкінці 2024 року використовував ту саму схему.
Два оновлення версії 0.5 відбулися менше ніж через рік — частота ітерацій моделей зображень наближається до частоти мовних моделей.
Це найпотужніша модель генерації зображень у світі, яка значно випереджає всі інші.
Постійне підвищення багатомодальних здібностей OpenAI, ймовірно, є відповіддю на моделі Anthropic шляхом підвищення здібностей базових моделей, таких як GPT-7, включаючи здатність використання комп’ютера.
Джерела:
https://openai.com/index/introducing-chatgpt-images-2-5/
Цей матеріал надійшов із офіційного аккаунту WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис, редактор: Ма Ко
