Только что OpenAI выпустила GPT-Images-2.5:
Задержка генерации сокращена наполовину, повышена точность редактирования, добавлена функция ручного ввода с помощью Sketch, API впервые разделен на две модели — быструю и медленную.

https://x.com/OpenAI/status/2097394956457623964
Открыто для всех пользователей ChatGPT, ChatGPT Work и Codex, включая бесплатную версию.
Согласно этим цифрам, в среднем около 430 миллионов изображений проходят через эту систему в день, и ощутимое ускорение генерации охватывает гораздо более широкий спектр, чем обычные обновления функций.
OpenAI объявила, что совокупное количество сгенерированных изображений ChatGPT Images и GPT-Image API составляет 3 миллиарда изображений в неделю.
Демо впечатляет: китайские иероглифы больше не искажены
Насколько мощен GPT-Image-2.5? Давайте посмотрим демо.
Китайские иероглифы больше не отображаются как мусор!

Это изображение для справки:

Это возвращённое ретро-изображение:

Вы всё ещё можете отличить настоящие фотографии от изображений, созданных ИИ?
Извлечь и преобразовать распечатанные старые фотографии в высококачественные цифровые изображения — пустяк.

Хотите примерить визуальный эффект новой одежды? Просто доверьтесь ChatGPT:
Введите:

Вывод:

Введите исходное изображение, одеяло в беспорядке:

Выведено изображение аккуратно сложенного одеяла:

Отличная согласованность сцен, не видно никаких ошибок.
На полтора раза быстрее, исправлено, не путается
Наиболее заметное ускорение скорости. OpenAI сообщает, что задержка генерации снижена до 50% по сравнению с Images 2.0.
Качество рендеринга освещения и текстур одновременно улучшено, а воспроизведение персонажей на фотографиях стало более точным.
Точная редакция решает старую проблему генераторов изображений: пользователи запрашивают изменение только части изображения, но модель изменяет и те части, которые не должны были трогаться.
Согласно OpenAI, Images 2.5 может изменять только указанные области, сохраняя композицию, освещение и основные характеристики остальных элементов изображения, а стабильность значительно улучшена в сценах со сложными фонами и несколькими объектами.
Пользователи также могут непосредственно добавлять комментарии и пометки на изображения, выделяя области, требующие изменений, — логика действия аналогична дизайнерскому инструменту Figma.

Согласованность многократных редактирований — это третье улучшение.
При многократном редактировании одного и того же изображения в длинном диалоге результаты первых нескольких раундов сохраняются, и качество изображения не ухудшается с каждым раундом.

Руководитель продукта Higgsfield AI Аксултан Алимкулов прокомментировал Flare:
Наиболее впечатляет его понимание того, что не следует менять.
Сделайте осмысленное редактирование, сохранив персонажей, композицию и визуальный стиль оригинального изображения.

Sketch и шаблоны: от набора текста к рисованию
На уровне продукта Images 2.5 добавила четыре новые функции.
Для доступа к Sketch введите @Sketch в окне диалога ChatGPT, чтобы открыть панель рисования. Пользователь рисует эскиз, добавляя текстовое описание стиля и деталей, после чего ChatGPT на основе этого эскиза генерирует готовое изображение.
Примеры, предоставленные OpenAI, включают преобразование эскизов планировки комнаты в рендеры интерьерного дизайна и эскизов силуэтов персонажей в иллюстрации. Порог не в художественных навыках, а в умении передать пространственные отношения и примерные пропорции, чтобы модель поняла структуру изображения.
Шаблоны охватывают часто используемые форматы, такие как плакаты, изображения товаров и листовки.
Выберите шаблон, введите информацию и предпочтения по стилю — модель сгенерирует изображение по предустановленной структуре, избавляя вас от экспериментов с написанием запроса с нуля.
Предложите пользователям поделиться полным промптом сгенерированного изображения, чтобы другие могли использовать свою фотографию и детали для создания персонализированной версии в той же структуре.
Пользователи загружают свои селфи, чтобы получить фотографии в стиле «ретро-портрет 80-х» — такой промпт уже распространился в социальных сетях.

Четыре функции направлены на одно и то же изменение: процесс превращения образов в голове в изображения больше не зависит только от набора текста!
Flare и Sunburst: API впервые разделен
Для разработчиков OpenAI одновременно запускает два модельных изображения через API: GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst.
Flare ориентирована на скорость и пакетную генерацию, OpenAI позиционирует её как стандартный выбор для большинства приложений.
Подходит для социального контента, изображений продукта, быстрых прототипов и частого создания графики.
Более конкретные данные предоставил Лаки Ляо из команды оценки Manus: Flare достигает скорости генерации изображений в 2–4 раза выше, чем GPT-Image-2, и улучшения в создании прозрачных фонов напрямую полезны для программной генерации брендовых материалов, презентаций и иллюстраций для веб-сайтов.

Sunburst ориентирован на профессиональные творческие рабочие процессы, предоставляя более точный контроль над редактированием за счет более длительного времени генерации.
Типичные сценарии, предоставленные OpenAI, — это готовые материалы для брендового маркетинга и отредактированные изображения продуктов.
Adobe подтвердила интеграцию модели Images 2.5 в Firefly.
Мэтт Чотин, старший директор по продуктам Adobe, заявил, что версия 2.5 обеспечивает более быструю генерацию и согласованность разрешения, сохраняя четкость и реалистичность изображений после нескольких циклов доработки.

Разделение двух моделей соответствует двум требованиям: высокая частота и низкая задержка, а также высокая точность и настройка.
Flare предоставляет сценарии для высокой пропускной способности, Sunburst — для высококачественных сценариев; разработчики выбирают подходящее решение в зависимости от бизнес-задач и не тратят время на избыточную точность.
Это первый раз, когда OpenAI API для изображений проводит сегментацию продукта по скорости и качеству, что согласуется с подходом к сегментации API логических и языковых моделей.
Имя Images 2.5 продолжает ритм линейки продуктов OpenAI для изображений: архитектура не изменилась, но скорость и точность впервые значительно выросли.
GPT-Image-1.5 в конце 2024 года использовал ту же схему.
Интервал между версиями 0.5 составил менее года — частота обновлений моделей изображений приближается к частоте обновлений языковых моделей.
Это самая мощная модель генерации изображений в мире — с огромным отрывом.
Постоянное усиление многомодальных возможностей OpenAI, вероятно, направлено на то, чтобы улучшить базовые модели, такие как GPT-7, за счет усиления таких возможностей, как использование компьютера, в ответ на модели Anthropic.
Справочные материалы:
https://openai.com/index/introducing-chatgpt-images-2-5/
Эта статья взята из официального аккаунта WeChat «Синьчжиюань» (ID: AI_era), автор: ASI Откровение, редактор: Ма Ко
