OpenAI lança o GPT-Image-2.5 com geração mais rápida e edição aprimorada

icon MarsBit
Compartilhar
AI summary iconResumo
A OpenAI lançou o GPT-Image-2.5, oferecendo geração mais rápida e edição aprimorada. A nova versão é até 50% mais rápida e adiciona o modo de entrada Sketch. Usuários da API agora podem escolher entre Flare para velocidade e Sunburst para qualidade. Problemas de renderização de texto chinês foram corrigidos, e modelos estão disponíveis para criação mais fácil. A atualização vem junto com uma atualização do BTC e sugere novas listagens de tokens à vista.

Há pouco, a OpenAI lançou o GPT-Images-2.5:

A latência de geração foi reduzida em até metade, a precisão de edição foi aprimorada, foi adicionada a função de entrada manual por Sketch e, pela primeira vez, os modelos rápidos e lentos foram separados na API.

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

Disponível para todos os usuários do ChatGPT, ChatGPT Work e Codex, incluindo a versão gratuita.

Traduzindo esse número, cerca de 430 milhões de imagens por dia passam por este sistema, e a melhoria perceptível na velocidade de geração abrange muito mais do que uma atualização funcional comum.

A OpenAI divulgou o volume total de imagens geradas pelo ChatGPT Images e pela GPT-Image API: 3 bilhões de imagens por semana.

Demo impressionante: problemas com caracteres chineses incorretos foram resolvidos

Quão poderoso é o GPT-Image-2.5? Vamos ver diretamente o Demo.

Os caracteres chineses corrompidos desapareceram!

GPT-Image-2.5

Esta é a imagem de referência:

GPT-Image-2.5

Esta é a imagem de saída em estilo retrô:

GPT-Image-2.5

Você ainda consegue distinguir fotos reais de imagens geradas por IA?

Converter fotos impressas antigas em fotos digitais em alta definição é uma tarefa fácil.

GPT-Image-2.5

Quer experimentar o efeito visual de trocar de roupa? Deixe isso com o ChatGPT:

Entrada:

GPT-Image-2.5

Output:

GPT-Image-2.5

Insira a imagem original, com a coberta desarrumada:

GPT-Image-2.5

Foi exibida a imagem do cobertor dobrado:

GPT-Image-2.5

Extrema consistência de cena, sem sinais de erros.

Metade mais rápido, corrigido para não bagunçar

O aumento de velocidade é o mais direto. O OpenAI afirma que a latência de geração é reduzida em até 50% em comparação com o Images 2.0.

A qualidade da renderização de luz e textura foi aprimorada simultaneamente, e a fidelidade à pessoa principal na foto de referência também é maior.

A edição precisa visa resolver um problema antigo das ferramentas de geração de imagens: o usuário solicita alterações locais, mas o modelo modifica também as partes que não deveriam ser alteradas.

Segundo a OpenAI, o Images 2.5 pode modificar apenas áreas especificadas, mantendo a composição, iluminação e características principais do restante da imagem, com estabilidade significativamente melhorada em cenas com fundos complexos e múltiplos sujeitos.

Os usuários também podem adicionar comentários e marcações diretamente sobre a imagem, destacando as áreas que precisam de alteração, com uma lógica de operação semelhante à ferramenta de design Figma.

GPT-Image-2.5

A consistência nas edições múltiplas é a terceira melhoria.

Ao editar repetidamente a mesma imagem em uma conversa longa, os resultados das primeiras rodadas são mantidos e a qualidade da imagem não diminui com as rodadas.

GPT-Image-2.5

O líder de produto da Higgsfield AI, Axultan Alimkulov, avaliou o Flare dizendo:

O que mais nos impressionou foi sua compreensão do que não deveria ser alterado.

Faça uma edição significativa que não perca o personagem, a composição e o estilo visual da imagem original.

GPT-Image-2.5

Sketch e modelos: da digitação ao desenho

No nível do produto, o Images 2.5 traz quatro novas funcionalidades.

Para acessar o Sketch, digite @Sketch na caixa de diálogo do ChatGPT e abra o painel de rascunhos. O usuário desenha um esboço, acompanhado de uma descrição textual do estilo e detalhes, e o ChatGPT gera a imagem final com base no esboço como referência de composição.

Os exemplos fornecidos pela OpenAI incluem esboços de layout de cômodos transformados em renderizações de design de interiores e contornos de figuras transformados em ilustrações. A barreira não está na habilidade de desenhar, mas em representar as relações espaciais e proporções aproximadas, permitindo que o modelo compreenda a estrutura da cena.

O modelo cobre formatos frequentes como cartazes, imagens de produtos e folhetos.

Escolha um modelo, insira as informações e preferências de estilo, e o modelo gera a imagem conforme a estrutura pré-definida, economizando o tempo de tentativa e erro ao escrever um Prompt do zero.

Prompt compartilhar permite que os usuários publiquem o Prompt completo gerado, permitindo que outros usem suas próprias fotos e detalhes para gerar versões pessoais dentro do mesmo modelo.

Um prompt de “retrato retrô dos anos 80” já está circulando nas redes sociais; os usuários podem fazer upload de selfies para obter fotos no mesmo estilo.

GPT-Image-2.5

Quatro funcionalidades apontam para a mesma mudança: o processo de transformar imagens na mente em fotos já não depende mais apenas de digitação!

Flare e Sunburst: API dividida pela primeira vez

Para desenvolvedores, a OpenAI lançou simultaneamente, na API, dois modelos de imagem: GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst.

Flare destaca-se por velocidade e geração em lote, e a OpenAI a posiciona como a opção padrão para a maioria dos aplicativos.

Cenários de aplicação incluem conteúdo social, imagens de experiência do produto, protótipos rápidos e geração frequente de imagens.

Os dados fornecidos por Lucky Liao da equipe de avaliação da Manus são mais específicos: a Flare alcançou uma velocidade de geração de imagens de 2 a 4 vezes superior à do GPT-Image-2 em seus testes, e as melhorias na geração de fundos transparentes são diretamente úteis para a geração programática de materiais de marca, apresentações e imagens para páginas da web.

GPT-Image-2.5

Sunburst é voltado para fluxos de trabalho criativos de alto nível, trocando tempos de geração mais longos por um controle de edição mais refinado.

O cenário típico fornecido pela OpenAI é material de marketing de marca de nível final e imagens de produtos aprimoradas.

A Adobe confirmou a integração do modelo Images 2.5 no Firefly.

Matt Chotin, Diretor Sênior de Produtos da Adobe, disse que a versão 2.5 traz velocidade de geração mais rápida e consistência de resolução, mantendo as imagens nítidas e realistas mesmo após múltiplas iterações de aprimoramento.

GPT-Image-2.5

A divisão dos dois modelos corresponde a duas necessidades: alta frequência e baixa latência, e personalização de alta precisão.

Flare oferece cenários para volumes elevados, Sunburst oferece cenários de alta qualidade; os desenvolvedores escolhem conforme sua necessidade de negócio, sem precisar pagar com tempo de espera por precisão que não utilizam.

Esta é a primeira vez que a API de imagens da OpenAI segmenta o produto com base em velocidade e qualidade, mantendo a mesma lógica da segmentação da API de modelos de linguagem.

A nomeação da Imagens 2.5 segue o ritmo da linha de produtos de imagem da OpenAI: arquitetura inalterada, velocidade e precisão dão um salto inicial.

O GPT-Image-1.5 no final de 2024 usou a mesma abordagem.

A intervalo entre duas versões 0.5 é inferior a um ano; a frequência de atualização dos modelos de imagem está se alinhando aos modelos de linguagem.

Este é o modelo de geração de imagens mais poderoso do mundo, com uma liderança esmagadora.

As crescentes capacidades multimodais da OpenAI provavelmente visam fortalecer modelos base, como o GPT-7, em resposta aos modelos da Anthropic, aprimorando habilidades como o uso de computadores.

Referências:

https://openai.com/index/introducing-chatgpt-images-2-5/

Este artigo é do公众号 "Nova Inteligência" (ID: AI_era), autor: Apocalipse da ASI, editor: Marco

Aviso legal: as informações nesta página podem ter sido obtidas de terceiros e não refletem necessariamente os pontos de vista ou opiniões da KuCoin. Este conteúdo é fornecido apenas para fins informativos gerais, sem qualquer representação ou garantia de qualquer tipo, nem deve ser interpretado como aconselhamento financeiro ou de investimento. A KuCoin não é responsável por quaisquer erros ou omissões, ou por quaisquer resultados do uso destas informações. Os investimentos em ativos digitais podem ser arriscados. Avalie cuidadosamente os riscos de um produto e a sua tolerância ao risco com base nas suas próprias circunstâncias financeiras. Para mais informações, consulte nossos termos de uso e divulgação de risco.