Há pouco, a OpenAI lançou o GPT-Images-2.5:
A latência de geração foi reduzida em até metade, a precisão de edição foi aprimorada, foi adicionada a função de entrada manual por Sketch e, pela primeira vez, os modelos rápidos e lentos foram separados na API.

https://x.com/OpenAI/status/2097394956457623964
Disponível para todos os usuários do ChatGPT, ChatGPT Work e Codex, incluindo a versão gratuita.
Traduzindo esse número, cerca de 430 milhões de imagens por dia passam por este sistema, e a melhoria perceptível na velocidade de geração abrange muito mais do que uma atualização funcional comum.
A OpenAI divulgou o volume total de imagens geradas pelo ChatGPT Images e pela GPT-Image API: 3 bilhões de imagens por semana.
Demo impressionante: problemas com caracteres chineses incorretos foram resolvidos
Quão poderoso é o GPT-Image-2.5? Vamos ver diretamente o Demo.
Os caracteres chineses corrompidos desapareceram!

Esta é a imagem de referência:

Esta é a imagem de saída em estilo retrô:

Você ainda consegue distinguir fotos reais de imagens geradas por IA?
Converter fotos impressas antigas em fotos digitais em alta definição é uma tarefa fácil.

Quer experimentar o efeito visual de trocar de roupa? Deixe isso com o ChatGPT:
Entrada:

Output:

Insira a imagem original, com a coberta desarrumada:

Foi exibida a imagem do cobertor dobrado:

Extrema consistência de cena, sem sinais de erros.
Metade mais rápido, corrigido para não bagunçar
O aumento de velocidade é o mais direto. O OpenAI afirma que a latência de geração é reduzida em até 50% em comparação com o Images 2.0.
A qualidade da renderização de luz e textura foi aprimorada simultaneamente, e a fidelidade à pessoa principal na foto de referência também é maior.
A edição precisa visa resolver um problema antigo das ferramentas de geração de imagens: o usuário solicita alterações locais, mas o modelo modifica também as partes que não deveriam ser alteradas.
Segundo a OpenAI, o Images 2.5 pode modificar apenas áreas especificadas, mantendo a composição, iluminação e características principais do restante da imagem, com estabilidade significativamente melhorada em cenas com fundos complexos e múltiplos sujeitos.
Os usuários também podem adicionar comentários e marcações diretamente sobre a imagem, destacando as áreas que precisam de alteração, com uma lógica de operação semelhante à ferramenta de design Figma.

A consistência nas edições múltiplas é a terceira melhoria.
Ao editar repetidamente a mesma imagem em uma conversa longa, os resultados das primeiras rodadas são mantidos e a qualidade da imagem não diminui com as rodadas.

O líder de produto da Higgsfield AI, Axultan Alimkulov, avaliou o Flare dizendo:
O que mais nos impressionou foi sua compreensão do que não deveria ser alterado.
Faça uma edição significativa que não perca o personagem, a composição e o estilo visual da imagem original.

Sketch e modelos: da digitação ao desenho
No nível do produto, o Images 2.5 traz quatro novas funcionalidades.
Para acessar o Sketch, digite @Sketch na caixa de diálogo do ChatGPT e abra o painel de rascunhos. O usuário desenha um esboço, acompanhado de uma descrição textual do estilo e detalhes, e o ChatGPT gera a imagem final com base no esboço como referência de composição.
Os exemplos fornecidos pela OpenAI incluem esboços de layout de cômodos transformados em renderizações de design de interiores e contornos de figuras transformados em ilustrações. A barreira não está na habilidade de desenhar, mas em representar as relações espaciais e proporções aproximadas, permitindo que o modelo compreenda a estrutura da cena.
O modelo cobre formatos frequentes como cartazes, imagens de produtos e folhetos.
Escolha um modelo, insira as informações e preferências de estilo, e o modelo gera a imagem conforme a estrutura pré-definida, economizando o tempo de tentativa e erro ao escrever um Prompt do zero.
Prompt compartilhar permite que os usuários publiquem o Prompt completo gerado, permitindo que outros usem suas próprias fotos e detalhes para gerar versões pessoais dentro do mesmo modelo.
Um prompt de “retrato retrô dos anos 80” já está circulando nas redes sociais; os usuários podem fazer upload de selfies para obter fotos no mesmo estilo.

Quatro funcionalidades apontam para a mesma mudança: o processo de transformar imagens na mente em fotos já não depende mais apenas de digitação!
Flare e Sunburst: API dividida pela primeira vez
Para desenvolvedores, a OpenAI lançou simultaneamente, na API, dois modelos de imagem: GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst.
Flare destaca-se por velocidade e geração em lote, e a OpenAI a posiciona como a opção padrão para a maioria dos aplicativos.
Cenários de aplicação incluem conteúdo social, imagens de experiência do produto, protótipos rápidos e geração frequente de imagens.
Os dados fornecidos por Lucky Liao da equipe de avaliação da Manus são mais específicos: a Flare alcançou uma velocidade de geração de imagens de 2 a 4 vezes superior à do GPT-Image-2 em seus testes, e as melhorias na geração de fundos transparentes são diretamente úteis para a geração programática de materiais de marca, apresentações e imagens para páginas da web.

Sunburst é voltado para fluxos de trabalho criativos de alto nível, trocando tempos de geração mais longos por um controle de edição mais refinado.
O cenário típico fornecido pela OpenAI é material de marketing de marca de nível final e imagens de produtos aprimoradas.
A Adobe confirmou a integração do modelo Images 2.5 no Firefly.
Matt Chotin, Diretor Sênior de Produtos da Adobe, disse que a versão 2.5 traz velocidade de geração mais rápida e consistência de resolução, mantendo as imagens nítidas e realistas mesmo após múltiplas iterações de aprimoramento.

A divisão dos dois modelos corresponde a duas necessidades: alta frequência e baixa latência, e personalização de alta precisão.
Flare oferece cenários para volumes elevados, Sunburst oferece cenários de alta qualidade; os desenvolvedores escolhem conforme sua necessidade de negócio, sem precisar pagar com tempo de espera por precisão que não utilizam.
Esta é a primeira vez que a API de imagens da OpenAI segmenta o produto com base em velocidade e qualidade, mantendo a mesma lógica da segmentação da API de modelos de linguagem.
A nomeação da Imagens 2.5 segue o ritmo da linha de produtos de imagem da OpenAI: arquitetura inalterada, velocidade e precisão dão um salto inicial.
O GPT-Image-1.5 no final de 2024 usou a mesma abordagem.
A intervalo entre duas versões 0.5 é inferior a um ano; a frequência de atualização dos modelos de imagem está se alinhando aos modelos de linguagem.
Este é o modelo de geração de imagens mais poderoso do mundo, com uma liderança esmagadora.
As crescentes capacidades multimodais da OpenAI provavelmente visam fortalecer modelos base, como o GPT-7, em resposta aos modelos da Anthropic, aprimorando habilidades como o uso de computadores.
Referências:
https://openai.com/index/introducing-chatgpt-images-2-5/
Este artigo é do公众号 "Nova Inteligência" (ID: AI_era), autor: Apocalipse da ASI, editor: Marco
