Justo ahora, OpenAI lanzó GPT-Images-2.5:
La latencia de generación se reduce hasta en un 50%, la precisión de edición mejora y se añade la función de entrada a mano alzada Sketch. Por primera vez, el API separa dos modelos: rápido y lento.

https://x.com/OpenAI/status/2097394956457623964
Disponible para todos los usuarios de ChatGPT, ChatGPT Work y Codex, incluyendo la versión gratuita.
Según este cálculo, aproximadamente 430 millones de imágenes diarias pasan por este sistema, y la mejora percibida en la velocidad de generación abarca un alcance mucho mayor que las iteraciones de funciones habituales.
OpenAI anunció que la cantidad total de imágenes generadas por ChatGPT Images y GPT-Image API es de 3 mil millones de imágenes por semana.
Demo impresionante: ¡Los caracteres chinos corruptos ya no existen!
¿Qué tan poderoso es GPT-Image-2.5? Veamos directamente el Demo.
¡Los caracteres chinos corruptos han desaparecido!

Esta es la imagen de referencia:

Esta es la imagen de salida en estilo retro:

¿Aún puedes distinguir entre fotos reales e imágenes generadas por IA?
Extraer y restaurar fotos impresas antiguas a fotos electrónicas en alta definición es pan comido.

¿Quieres probar el efecto visual de cambiar de ropa? Déjaselo a ChatGPT:
Entrada:

Output:

Ingrese la imagen original, la colcha está desordenada:

Se ha emitido una imagen de la colcha bien doblada:

Extrema coherencia de escena, sin detectarse errores.
La mitad más rápida, corregido para que no sea desordenado
El aumento de velocidad es el más directo. OpenAI indica que la latencia de generación se reduce hasta un 50 % en comparación con Images 2.0.
La calidad de renderizado de la iluminación y la textura mejora simultáneamente, y la fidelidad de la reproducción del sujeto humano en la foto de referencia también es mayor.
La edición precisa aborda un problema antiguo de las herramientas de generación de imágenes: el usuario solicita cambios locales, pero el modelo modifica también las partes que no se le pidió cambiar.
Según OpenAI, Images 2.5 puede modificar solo áreas específicas, manteniendo la composición, la iluminación y las características principales del resto de la imagen, con una estabilidad significativamente mejorada en escenarios con fondos complejos y múltiples sujetos.
Los usuarios también pueden colocar comentarios y anotaciones directamente sobre la imagen, resaltando las áreas que necesitan modificaciones, con una lógica de operación similar a las herramientas de diseño Figma.

La consistencia en la edición múltiple es la tercera mejora.
Al modificar repetidamente la misma imagen en una conversación larga, los resultados de las primeras rondas se mantienen y la calidad de la imagen no disminuye con cada ronda.

Higgsfield AI, el jefe de producto Axultan Alimkulov, evaluó Flare diciendo:
Lo que más nos impresionó fue su comprensión de lo que no debería cambiarse.
Realiza una edición significativa que no pierda el personaje, la composición y el estilo visual de la imagen original.

Sketch y plantillas: de escribir a dibujar
A nivel de producto, Images 2.5 introduce cuatro nuevas funciones.
Para acceder a Sketch, ingresa @Sketch en el cuadro de diálogo de ChatGPT y abre el panel de dibujo a mano alzada. El usuario dibuja un boceto y añade una descripción textual sobre el estilo y los detalles; ChatGPT genera la imagen final tomando el boceto como referencia de composición.
Los ejemplos proporcionados por OpenAI incluyen bocetos de distribución de habitaciones convertidos en renderizados de diseño interior y bocetos de contornos de personas convertidos en ilustraciones. La barrera no está en la habilidad artística, sino en representar las relaciones espaciales y las proporciones generales para que el modelo comprenda la estructura de la imagen.
La plantilla cubre formatos frecuentes como carteles, imágenes de productos y folletos.
Elige una plantilla, ingresa la información y tus preferencias de estilo, y el modelo generará la imagen según la estructura predefinida, ahorrándote el proceso de prueba y error al escribir un prompt desde cero.
Prompt comparte el Prompt completo que generó la imagen para que otros lo usen, inserten sus propias fotos y detalles, y generen sus propias versiones dentro del mismo marco.
Un prompt de "retrato retro de los 80" ya se ha difundido en las redes sociales; los usuarios pueden subir sus selfies para obtener fotos en el mismo estilo.

Cuatro funciones apuntan al mismo cambio: ¡el proceso de convertir la imagen en tu mente en una imagen ya no depende solo de escribir!
Flare y Sunburst: La API se divide por primera vez
Para desarrolladores, OpenAI lanza simultáneamente en la API dos modelos de imagen: GPT-Image-2.5 Flare y GPT-Image-2.5 Sunburst.
Flare se destaca por su velocidad y generación por lotes, y OpenAI lo posiciona como la opción predeterminada para la mayoría de las aplicaciones.
Los escenarios aplicables incluyen contenido social, imágenes de experiencia de producto, prototipos rápidos y generación frecuente de imágenes.
Los datos proporcionados por Lucky Liao del equipo de evaluación de Manus son más específicos: Flare alcanzó una velocidad de generación de imágenes de 2 a 4 veces superior a la de GPT-Image-2 en sus pruebas, y las mejoras en la generación de fondos transparentes son directamente útiles para la creación programática de materiales de marca, presentaciones e imágenes para páginas web.

Sunburst está orientado a flujos de trabajo creativos de gama alta, intercambiando tiempos de generación más largos por un control de edición más preciso.
El escenario típico proporcionado por OpenAI son materiales listos para marketing de marca e imágenes de productos retocadas.
Adobe ha confirmado la integración del modelo Images 2.5 en Firefly.
Matt Chotin, Director Senior de Productos de Adobe, dijo que la versión 2.5 ofrece una generación más rápida y consistencia en la resolución, manteniendo la claridad y el realismo de las imágenes tras múltiples iteraciones de refinamiento.

La separación de los dos modelos responde a dos necesidades: alta frecuencia y baja latencia, y personalización de alta precisión.
Flare ofrece escenarios para volúmenes altos, Sunburst ofrece escenarios de alta calidad; los desarrolladores eligen según su negocio y no necesitan perder tiempo esperando precisión que no necesitan.
Esta es la primera vez que la API de imágenes de OpenAI implementa una estratificación de productos según velocidad y calidad, alineada con la misma lógica de las categorías de la API de modelos de lenguaje.
La nomenclatura de Images 2.5 sigue el ritmo de la línea de productos de imágenes de OpenAI: arquitectura inalterada, con velocidad y precisión que mejoran en esta ronda.
GPT-Image-1.5 a finales de 2024 usó la misma estrategia.
Menos de un año entre las versiones .5, la frecuencia de actualización de los modelos de imagen se está alineando con la de los modelos de lenguaje.
Este es el modelo de generación de imágenes más potente del mundo, con una ventaja abrumadora.
Las capacidades multimodales cada vez más avanzadas de OpenAI probablemente buscan contrarrestar los modelos de Anthropic, mejorando capacidades como el uso de computadoras y, en consecuencia, fortaleciendo modelos base como GPT-7.
Referencias:
https://openai.com/index/introducing-chatgpt-images-2-5/
Este artículo proviene del canal de WeChat "Nuevas Inteligencias" (ID: AI_era), autor: ASI Revelación, editor: Marco
