OpenAI lance GPT-Image-2.5 avec une génération plus rapide et une édition améliorée

icon MarsBit
Partager
AI summary iconRésumé
OpenAI a lancé GPT-Image-2.5, offrant une génération plus rapide et une édition améliorée. La nouvelle version est jusqu'à 50 % plus rapide et intègre un mode saisie Croquis. Les utilisateurs de l'API peuvent désormais choisir entre Flare pour la vitesse et Sunburst pour la qualité. Les problèmes de rendu du texte chinois sont résolus, et des modèles sont disponibles pour faciliter la création. Cette mise à jour intervient en parallèle d'une mise à jour BTC et suggère de nouvelles listings de jetons à venir.

Juste maintenant, OpenAI a lancé GPT-Images-2.5 :

Le délai de génération est réduit de moitié au maximum, la précision de l'édition est améliorée, une nouvelle fonction d'entrée manuscrite Sketch est ajoutée, et les modèles rapides et lents sont séparés pour la première fois côté API.

GPT-Image-2.5

https://x.com/OpenAI/status/2097394956457623964

Ouvert à tous les utilisateurs de ChatGPT, ChatGPT Work et Codex, y compris la version gratuite.

Selon ce chiffre, environ 430 millions d'images par jour passent à travers ce système, et l'amélioration perçue de la vitesse de génération dépasse largement les effets d'une itération fonctionnelle classique.

OpenAI a révélé le volume total de générations de ChatGPT Images et de l'API GPT-Image : 3 milliards d'images par semaine.

Démonstration époustouflante : les caractères chinois illisibles n'existent plus

À quel point GPT-Image-2.5 est-il puissant ? Voyons directement la démo.

Les caractères chinois corrompus ont disparu !

GPT-Image-2.5

Ceci est l'image de référence :

GPT-Image-2.5

Voici l'image rétro générée :

GPT-Image-2.5

Pouvez-vous encore distinguer les photos réelles des images générées par l’IA ?

Extraire et reconvertir des photos imprimées en photos numériques haute définition, c'est une sinécure.

GPT-Image-2.5

Vous voulez essayer l’effet visuel d’un changement de tenue ? Confiez-le directement à ChatGPT :

Input :

GPT-Image-2.5

Output:

GPT-Image-2.5

Téléchargez l'image originale, la couverture est en désordre :

GPT-Image-2.5

Image de la couverture pliée affichée :

GPT-Image-2.5

Très forte cohérence de scène, aucun plan rateé ne se distingue.

Deux fois plus rapide, corrigé pour ne plus être désordonné

L'amélioration de la vitesse est la plus directe. OpenAI indique une réduction maximale de 50 % de la latence de génération par rapport à Images 2.0.

La qualité du rendu de la lumière et des textures est simultanément améliorée, et la fidélité de la restitution du sujet humain sur les photos de référence est plus élevée.

L'édition précise vise à résoudre un problème ancien des outils de génération d'images : lorsque l'utilisateur demande de modifier une partie spécifique, le modèle modifie également des éléments qui ne devraient pas être touchés.

Selon OpenAI, Images 2.5 peut modifier uniquement les zones spécifiées tout en conservant la composition, l'éclairage et les caractéristiques principales des autres éléments de l'image, avec une stabilité nettement améliorée dans les scènes à fond complexe et à plusieurs sujets.

Les utilisateurs peuvent également placer des commentaires et des annotations directement sur l'image, en encerclant les zones à modifier, avec une logique d'opération similaire à l'outil de conception Figma.

GPT-Image-2.5

La cohérence des éditions multiples est la troisième amélioration.

Lors de modifications répétées de la même image dans un long dialogue, les résultats des premières itérations sont conservés et la qualité de l'image ne diminue pas avec le nombre d'itérations.

GPT-Image-2.5

Axultan Alimkulov, responsable produit chez Higgsfield AI, a commenté Flare :

Ce qui nous a le plus impressionnés, c'est sa compréhension de ce qui ne devrait pas être modifié.

Effectuez un éditing significatif sans perdre le personnage, la composition et le style visuel d'origine.

GPT-Image-2.5

Sketch et modèles : de la saisie au dessin

Au niveau du produit, Images 2.5 introduit quatre nouvelles fonctionnalités.

Pour accéder à Sketch, saisissez @Sketch dans la boîte de dialogue ChatGPT pour ouvrir le panneau de dessin à main levée. L'utilisateur dessine un croquis, accompagné d'une description textuelle du style et des détails ; ChatGPT génère alors une image finale en s'inspirant du croquis.

Les exemples fournis par OpenAI incluent la transformation de croquis de disposition de pièce en rendus de design d'intérieur, et de croquis de silhouettes humaines en illustrations. Le seuil ne réside pas dans le talent artistique, mais dans la capacité à représenter les relations spatiales et les proportions générales, afin que le modèle comprenne la structure de l'image.

Le modèle couvre les formats fréquents tels que les affiches, les images de produits et les dépliants.

Choisissez un modèle, entrez vos informations et préférences stylistiques, et le modèle génère l’image selon la structure prédéfinie, évitant ainsi les essais et erreurs lors de l’écriture d’un prompt depuis zéro.

Partagez le prompt pour permettre aux utilisateurs de publier le prompt complet généré, afin que d'autres puissent intégrer leurs propres photos et détails pour générer une version personnalisée dans le même cadre.

Un prompt « portrait rétro des années 80 » circule sur les réseaux sociaux ; les utilisateurs peuvent télécharger une photo d’eux-mêmes pour obtenir une image dans le même style.

GPT-Image-2.5

Quatre fonctionnalités visent le même changement : le processus de transformation d'une image mentale en image ne repose plus uniquement sur la saisie au clavier !

Flare et Sunburst : API divisée pour la première fois

Pour les développeurs, OpenAI lance simultanément deux modèles d’images sur l’API : GPT-Image-2.5 Flare et GPT-Image-2.5 Sunburst.

Flare se distingue par sa vitesse et sa génération par lots, et OpenAI le positionne comme le choix par défaut pour la plupart des applications.

Les scénarios d'utilisation incluent les contenus sociaux, les images d'expérience produit, les prototypes rapides et les sorties d'images fréquentes.

Les données fournies par Lucky Liao de l'équipe d'évaluation de Manus sont plus précises : Flare atteint une vitesse de génération d'images 2 à 4 fois supérieure à celle de GPT-Image-2 dans leurs tests, et les améliorations apportées à la génération de fonds transparents sont directement utiles pour la création programmatique de supports de marque, de présentations et d'images pour sites web.

GPT-Image-2.5

Sunburst cible les flux de travail créatifs haut de gamme, en échangeant un temps de génération plus long pour un contrôle d'édition plus précis.

Le scénario typique fourni par OpenAI concerne des supports de marketing de marque prêts à l'emploi et des images de produits retouchées.

Adobe a confirmé l'intégration du modèle Images 2.5 dans Firefly.

Matt Chotin, directeur général des produits Adobe, a déclaré que la version 2.5 offre une génération plus rapide et une cohérence de résolution, permettant aux images de conserver leur clarté et leur réalisme après plusieurs rounds de raffinement.

GPT-Image-2.5

La séparation des deux modèles correspond à deux besoins : haute fréquence et faible latence, et personnalisation de haute précision.

Flare offre des scénarios adaptés aux volumes élevés, Sunburst propose des scénarios de qualité ; les développeurs choisissent selon leurs besoins métier, sans avoir à payer en temps d'attente pour une précision inutile.

Il s'agit de la première fois que l'API d'images d'OpenAI propose une segmentation produit basée sur la vitesse et la qualité, en cohérence avec la structure des tarifs de l'API de modèles linguistiques.

L'命名 de l'Image 2.5 s'inscrit dans la dynamique de la ligne de produits d'images d'OpenAI : architecture inchangée, vitesse et précision en hausse.

GPT-Image-1.5 à la fin de 2024 utilise la même approche.

Les deux versions .5 sont séparées par moins d'un an ; la fréquence d'itération des modèles d'images tend à s'aligner sur celle des modèles linguistiques.

C'est le meilleur modèle de génération d'images au monde, avec une avance considérable.

Les capacités multimodales croissantes d'OpenAI sont probablement destinées à renforcer les modèles de base tels que GPT-7 face aux modèles d'Anthropic, en améliorant notamment la capacité d'utilisation de l'ordinateur.

Références :

https://openai.com/index/introducing-chatgpt-images-2-5/

Cet article provient du compte WeChat « Nouvelle Intelligence » (ID : AI_era), auteur : ASI Révélation, éditeur : Marco

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.