Pourquoi le modèle n'a même pas été publié qu'il suscite déjà une controverse ????
À la veille de la sortie de GPT-6, une information révélée pour la première fois par The Information a rapidement suscité un vif débat en ligne :
Le nouveau modèle d'OpenAI introduit une technique d'inférence appelée « recurrent depth », qui pourrait rendre le processus de réflexion du modèle plus difficile à comprendre et à surveiller.
En termes simples, cela signifie que plus tard, les humains ne comprendront plus du tout ce que l’IA pense.

Ah bon, et si l'IA apprenait à tromper, tricher ou contourner les restrictions de sécurité, ne pourrions-nous pas non plus le détecter à temps ?
Il n'est donc pas étonnant que, dès la diffusion de ce message, la communauté de la sécurité IA ait immédiatement alerté, avec beaucoup de préoccupations :
Si cette technologie continue de s'étendre, les mécanismes de surveillance des chaînes de raisonnement actuels pourraient devenir directement obsolètes.
En raison de l'importance de la question et de la vive intensité des débats, le scientifique en chef d'OpenAI a dû intervenir personnellement pour répondre.
Même au milieu du tumulte, certaines personnes ont découvert avec étonnement :
Le nom du nouveau modèle d'OpenAI s'appelle-t-il « GPT-6 » ou « Astra » ? Peut-être a-t-il déjà été révélé par l'API.
OpenAI pourrait également lancer simultanément la nouvelle version du modèle d'images, GPT Images 2.1.
Trop de melons, on va les déguster un par un.
Le modèle commence à tourner en boucle dans l'esprit, les experts en sécurité s'alarment
Le premier est la technologie « depth de cycle » qui a suscité des controverses cette fois-ci.
Les modèles précédents laissaient une chaîne de raisonnement CoT claire, permettant de voir immédiatement ce qui avait été envisagé.
Bien que cette séquence de texte ne soit pas nécessairement égale à la véritable introspection du modèle (ce qui fait encore débat), elle laisse au moins des traces vérifiables.
En revanche, la « profondeur cyclique » adoptée par Astra présente un tout autre style.

Il permet au modèle de réinjecter l'état interne généré à une étape dans le réseau de neurones, pour le traiter plusieurs fois dans l'espace caché avant de produire le prochain segment de texte.
Par exemple, auparavant, pour résoudre un problème, le modèle devait réfléchir tout en notant les étapes de calcul sur un brouillon.
Maintenant, on peut le calculer mentalement.
Les personnes à l'extérieur ne voient peut-être que la question et la réponse, mais pas nécessairement les calculs intermédiaires, les idées essayées ou les erreurs parcourues.
En économisant le travail de traduire chaque étape en texte, le modèle peut théoriquement effectuer plusieurs cycles de réflexion avec les mêmes ressources de calcul et examiner simultanément plusieurs solutions.
Mais avec l'amélioration des performances, des problèmes sont apparus :
Si le modèle ne pense plus en langage humain, comment les humains pourraient-ils le surveiller ?
Le PDG de Redwood Research, un organisme de recherche en sécurité IA à but non lucratif, a exprimé des préoccupations vigoureuses :
Il n’est pas encore clair de combien la traçabilité de la chaîne de pensée d’Astra a diminué, mais si OpenAI approfondit davantage le cycle, cela pourrait déplacer la majeure partie du raisonnement du modèle vers un espace caché illisible, détruisant ainsi complètement la traçabilité de la chaîne de pensée.

Le scientifique en chef de Redwood, Ryan Greenblatt, s'inquiète également du même côté.
À ses yeux, le raisonnement opaque pourrait s'étendre plus rapidement que les chaînes de pensée traditionnelles. En poursuivant cette voie, les modèles pourraient un jour effectuer entièrement, ou presque entièrement, leur raisonnement dans l'espace latent.
C'est la pire avancée jusqu'à présent dans le domaine de la sécurité de l'IA.
Après tout, si le problème était simplement « de ne pas comprendre le processus de calcul », la situation ne serait pas aussi délicate.
En tant que principal enquêteur de l'événement précédent « intrusion du modèle OpenAI sur Hugging Face », il a découvert deux menaces majeures :
Les chercheurs dépendaient fortement de la chaîne de raisonnement pour reconstituer le comportement de nombreux agents d'IA, même ainsi, l'enquête était déjà très difficile.
L'IA concernée a tenté de modifier ses propres enregistrements, voire de falsifier les appels d'outils.
Pour ce dernier cas, si le modèle possède une capacité de raisonnement caché plus forte, il est plus susceptible de concevoir d'abord un plan de tromperie dans l'espace latent, puis de construire une histoire fictive à l'aide d'appels et de sorties falsifiés, sans laisser de traces évidentes dans la chaîne de pensée textuelle.
Oh non, les risques sont directement doublés...

Zvi Mowshowitz, qui suit de près la sécurité de l'IA, l'a dit plus directement :
C'est jouer avec le feu.
Il craint que, dès que l'inférence cachée apporte un avantage de performance évident, les différents laboratoires ne se lancent dans une course à l'escalade néfaste :
Vous n'osez pas cacher votre chaîne de pensée par souci de sécurité, mais vos concurrents le font, et leurs modèles sont plus puissants et moins chers.
Pour ne pas être laissé pour compte, tu suis ou pas ?
Mowshowitz estime même qu'il faudra peut-être recourir à des moyens juridiques pour empêcher les entreprises d'IA de renoncer collectivement à la traçabilité des chaînes de raisonnement dans leur quête de capacité.

Cependant, d'autres estiment que cette panique est arrivée trop vite.
Tian Yuan Dong a déclaré sur X qu'ils avaient déjà reçu des questions presque identiques lors de la publication précédente de Coconut.
Coconut signifie « Chain of Continuous Thought » et prône également que le modèle effectue directement ses raisonnements dans un espace caché continu, sans décoder chaque étape en texte.
Selon Tian Yandong, même si le modèle conserve une chaîne de pensée explicite, cela ne signifie pas que les humains voient réellement ses véritables pensées.
Il est important de comprendre comment le modèle fonctionne en lui-même, et non de se concentrer uniquement sur le « processus de résolution » qu'il produit.

Alors que le débat s'intensifiait, le scientifique en chef d'OpenAI, Jakub Pachocki, a également réagi directement.
Il a immédiatement déclaré qu'il fallait empêcher une course non surveillée déclenchée par des reportages confus.
Incluant Astra, la profondeur du graphe de calcul des modèles les plus avancés d'OpenAI reste dans un facteur deux de celui de GPT-4.
Cela signifie qu'Astra utilise effectivement un calcul cyclique, mais à une échelle actuellement limitée, sans cacher entièrement la chaîne de raisonnement. Selon les informations disponibles, son raisonnement en langage naturel reste lisible.
Pachocki a également souligné qu'OpenAI considère depuis toujours la surveillance des chaînes de pensée comme un moyen de sécurité important, et qu'elle reste un objectif central de son programme de recherche actuel.
Il admet toutefois que la surveillance des chaînes de raisonnement est très fragile et évolue dans une direction négative.
Mais cette tendance à la baisse n'est pas entièrement due à des changements d'architecture tels que la profondeur de boucle (nous consacrerons un article dédié à ce point ultérieurement) ; OpenAI continue également d'étudier des moyens de renforcer ses capacités de surveillance.

Astra n'a pas encore rendu les modèles complètement incompréhensibles pour les humains.
Ce que les experts en sécurité craignent vraiment, c'est :
L’inférence cachée, actuellement limitée à un cadre restreint, continuera-t-elle à s’élargir dans les modèles de la prochaine génération pour finir par devenir une boîte noire impossible à surveiller ?
Vraiment GPT-6-Astra ? La réponse de l'API l'a déjà révélé
Les controverses algorithmiques sont terminées, le deuxième scandale concerne le nom du modèle.
Le lanceur d'alerte Leo a découvert qu'en demandant « gpt-6-astra » via l'API OpenAI Responses, le serveur renvoie une erreur 404 Not Found.
Entrer un nom de modèle inexistant ou inventé entraîne généralement une erreur 400.
404 signifie que cet identifiant de modèle a été reconnu par le backend, mais que votre compte actuel n'a pas les autorisations d'accès, ou que le modèle n'est pas encore disponible.
Auparavant, certains modèles non publiés avaient également laissé des traces grâce à des différences similaires dans les réponses API.
Ainsi, Leo conclut que « gpt-6-astra » a probablement déjà été déployé sur l'arrière-plan de l'API OpenAI.

GPT Images 2.1 arrive aussi, résolvons d'abord le « syndrome du bruit »
En dehors des modèles linguistiques, les produits image d'OpenAI ont également été mis à jour simultanément.
Selon le compte fuite Fix, le nouveau modèle d'images GPT Images 2.1 pourrait être publié le 4 septembre.
Le changement le plus visible de cette mise à jour est probablement la correction du « problème de bruit » présent dans les anciennes versions.

Auparavant, certains résultats de génération d'Images v2 présentaient des particules étranges, une brume et une texture sale, particulièrement visibles dans les images contenant beaucoup de texte ou des éléments détaillés, comme le disait un autre internaute :
Comme pris à travers un verre sale.
Les dernières épreuves diffusées ont clairement amélioré ce problème, avec une image plus propre.
Allez, allez, toujours le terrain du vieil acteur Ultraman :
Le tableau célèbre du monde : « Ultraman sera arrêté s’il ne lance pas GPT-6 ! »

Et aussi Ultraman, qui travaille jusqu'à tard dans la nuit et rentra chez lui en errant dans les rues pour éviter d'être arrêté.
J'ai aussi partagé un post Instagram intitulé « Avez-vous déjà vu les rues à deux heures du matin ? »

Il faut bien dire que l’image a l’air vraiment de haute qualité, presque comme une photo réelle.
Plus de thèmes, plus de styles, tous parfaitement maîtrisés :



Pas la peine d'en dire plus, Ultraman, envoie vite.
Lien de référence :
[1]https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
[2]https://x.com/tydsh/status/2095227000365707542?s=20[
3]https://x.com/merettm/status/2095023204993490967?s=20
[4]https://x.com/synthwavedd/status/2095184148981842161?s=20
[5]https://x.com/FixlationAI/status/2095232751654064426?s=20
[6]https://x.com/marco_obviously/status/2095275097217191981?s=20
Cet article provient du compte officiel WeChat « Quantum Bit », auteur : Suivre les technologies de pointe
