GPT-6 Sol commence les tests internes, 6 fois plus rapide qu'Astra

icon MarsBit
Partager
AI summary iconRésumé
Actualités IA + crypto : GPT-6 Sol est actuellement en test interne, avec des vitesses de traitement environ six fois plus rapides qu’Astra. L’utilisateur Lentils a publié des benchmarks montrant que Sol a terminé une tâche de génération SVG en 3 minutes, contre 19 pour Astra. OpenAI a déclaré que les chercheurs utilisent désormais 3 agents IA par jour, coûtant plus de 600 $ en frais d’API. L’entreprise prévoit une automatisation complète de la recherche IA d’ici 2028. Les actualités crypto continuent de souligner les progrès rapides de l’IA.

GPT-6 n'est pas seulement Astra !

Astra vient à peine d'être lancée, et GPT-6 Sol serait déjà en test interne.

GPT-6 Sol

The performance is also outstanding, with a single test speed six times that of Astra.

Faites une hypothèse audacieuse : Terra et Luna sont-ils aussi en chemin ?

Et le même jour, OpenAI vient de publier un ensemble de données internes :

À ce jour, pour chaque journée de travail de 8 heures effectuée par un chercheur d'OpenAI, trois jours de travail multi-agents fonctionnent simultanément.

Calculé selon le prix de l'API, les ressources d'inférence Agent utilisées quotidiennement par le chercheur médian d'OpenAI dépassent 600 dollars.

GPT-6 Sol

OpenAI a également annoncé avoir réalisé « un stagiaire en recherche automatisé » :

Ces agents peuvent accomplir certaines tâches qui nécessitaient auparavant plusieurs jours de travail pour les chercheurs, sous la supervision humaine.

Même Old Yellow dit : l'AGI est déjà là !

GPT-6 Sol

Il a révélé qu'Astra utilise environ 100 000 unités de NVIDIA Grace Blackwell NVLink72 pour l'entraînement, avec 400 000 autres unités de GPU prévues prochainement.

Il semble que cette vague ne soit pas seulement une vantardise de OpenAI ~

GPT-6 Sol est révélé en phase de test interne

Un internaute nommé Lentils a révélé qu'OpenAI teste en interne GPT-6 Sol.

Il a déclaré que la capacité globale de Sol est nettement inférieure à celle d'Astra, récemment publiée, mais qu'elle est plus rapide et reste un modèle « de niveau monstre ».

À quel point rapide ? La vitesse d’un seul test est environ six fois celle d’Astra.

L'utilisateur lyra a soumis la même tâche à différents modèles : générer une image SVG d'une BMW M4 Competition.

Parmi ceux-ci, GPT-6 Sol utilise le niveau Max, avec une génération zéro échantillon, en environ 3 minutes, pour une sortie d'environ 28 000 tokens.

GPT-6 Sol

GPT-6 Astra utilise le niveau Max, génère environ 25 000 tokens en environ 19 minutes.

GPT-6 Sol

Gemini 3.1 DeepThink active le niveau High, affichant une sortie d'environ 3300 tokens, mais le processus d'inférence consomme environ 458 000 tokens et dure environ 29 minutes.

GPT-6 Sol

Gemini 3.8 Flash active également le niveau High, produisant environ 19 000 tokens en seulement environ 42 secondes.

GPT-6 Sol

En comparaison, Sol s'est le plus distingué : son volume de sortie est similaire à celui d'Astra, mais sa vitesse par test est environ six fois supérieure à celle d'Astra — il ne prend qu'environ un sixième du temps.

De plus, l'internaute Lentils a également présenté un prototype de monde sandbox pixelisé intitulé « The Realm of Aurellune ».

GPT-6 Sol

GPT-6 a généré en une seule fois une ville, des champs, des rivières, un château et une carte réduite, accompagnée d’un tableau de bord permettant de contrôler le changement jour/nuit, l’ajout de noms de lieux et l’ajustement des détails, donnant l’impression d’un jeu de simulation déjà doté d’une structure de base.

Ceci est le résultat généré avec zero-shot, niveau d'inférence Max, 15 minutes, et un total de 60 000 tokens dépensés.

Il est actuellement possible de supposer qu'Astra privilégie le raisonnement approfondi au plus haut niveau de difficulté, tandis que Sol pourrait se concentrer sur la vitesse, le débit et l'évolutivité des appels d'agents.

Concernant la date de sortie de Sol, l'internaute Pankaj Kumar a déclaré qu'elle pourrait être officiellement annoncée lors de la conférence des développeurs OpenAI le 29 septembre.

GPT-6 Sol

Il n'est pas non plus exclu que GPT-6, Terra, Luna et GPT-Image 2.5 fassent tous leur apparition.

GPT-6 Sol

Des chercheurs d'OpenAI qui arrivent au travail avec en moyenne trois agents stagiaires.

Le même jour, OpenAI a également partagé un ensemble de données internes intéressantes — à quel point les modèles d'IA ont accéléré la recherche dans leur propre laboratoire.

À mi-août de cette année, pour chaque journée de 8 heures de travail des chercheurs, environ 3,1 journées de travail d'agent s'exécutaient en parallèle.

Waouh, quelqu’un qui encadre trois stagiaires qui ne dorment pas ?~

GPT-6 Sol

En ce qui concerne les dépenses, selon les prix de l'API, le médian des chercheurs consomme quotidiennement plus de 600 dollars en ressources d'inférence d'Agent.

C’est presque le salaire d’un ingénieur débutant pour une journée.

GPT-6 Sol

Que font exactement ces agents ?

Écrire du code de recherche, du code d’infrastructure, configurer l’environnement d’entraînement, exécuter des expériences d’évaluation, diagnostiquer les pannes des outils et de l’environnement, analyser les résultats des expériences, surveiller les tâches d’entraînement… et même participer à la synthèse et à la communication des conclusions de la recherche.

En gros, il peut faire tout sauf décider de ce qu'il faut étudier.

Un changement le plus évident est que, précédemment, lorsque l’environnement de test plantait, les chercheurs devaient appeler quelqu’un sur un canal interne ; maintenant, les agents gèrent de plus en plus ce type de problèmes, ce qui a directement réduit le volume de demandes d’assistance humaine.

GPT-6 Sol

D'autres équipes ont directement supprimé les sessions fixes de questions techniques pour libérer du temps et améliorer le système lui-même.

Sur la base de ces données, OpenAI a officiellement annoncé : l'objectif « d'assistant de recherche IA automatisé » a été atteint.

Ici, le « stagiaire » est, avec précision, un nœud de recherche capable d'accomplir des tâches : sous la supervision humaine, il peut réaliser de manière autonome des missions de recherche bien délimitées, certaines desquelles prenaient auparavant plusieurs jours à un chercheur expérimenté.

Les résultats ont été immédiats, avec une augmentation du nombre de codes produits et d'expériences menées par les chercheurs.

GPT-6 Sol

En août 2026, le nombre moyen d'expériences a atteint un nouveau record depuis les premières statistiques en janvier 2025, et les tâches attribuées aux agents sont de plus en plus complexes et de plus longue durée.

GPT-6 Sol

L'auteur de cet article, Kevin Liu, a également placé cet événement dans un contexte plus large.

Il estime que l'amélioration récursive de soi est probablement l'un des facteurs les plus importants qui stimuleront les sauts de capacité de l'IA au cours des prochaines années.

En clair, l’IA crée de l’IA, et plus elle en crée, plus vite elle avance.

GPT-6 Sol

Mais le problème est que, selon la tendance actuelle, cette capacité ne sera par défaut disponible que dans quelques laboratoires d'IA de pointe, et il sera difficile pour l'extérieur de voir à quel point elle a progressé.

Ainsi, Liu estime que la divulgation transparente est plus urgente que jamais. La vitesse à laquelle les modèles deviennent plus puissants et si les efforts de recherche doivent être ralentis ne peuvent pas être déterminés uniquement par quelques entreprises en fermant les portes.

Il a également appelé les autres entreprises d'IA à publier des données similaires.

Cependant, le développement de l'IA s'est effectivement accéléré, mais pas assez pour atteindre une conduite entièrement autonome.

Selon les données d'OpenAI, au cours des six derniers mois, plus de la moitié des cas réussis pour des tâches qui nécessitaient initialement 4 à 8 heures ont exigé au moins une intervention humaine. En ce qui concerne la planification de recherches de haut niveau, elles sont presque jamais confiées à des agents.

GPT-6 Sol

Les chercheurs restent responsables de décider de ce qui sera étudié, quels résultats méritent d'être poursuivis, et quand il faut augmenter l'entraînement, suspendre les expériences ou déployer un modèle.

Le prochain objectif d'OpenAI est également fixé : réaliser un « chercheur IA automatisé » d'ici mars 2028.

Contrairement à un « stagiaire » qui ne peut gérer que des tâches bien définies, un « chercheur » doit être capable de prendre en charge des objectifs de recherche plus ouverts et de piloter lui-même des projets de plus longue durée — passant ainsi du rôle d’exécutant à celui de responsable indépendant.

Si GPT-6 Sol est effectivement en test interne, il est très probable qu'il ait été développé selon ce nouveau modèle de recherche :

Plus de GPU fournissent de la puissance de calcul, plus d'agents exécutent des expériences en parallèle, tandis que les chercheurs humains se placent à un niveau supérieur — choisissant les directions, évaluant les résultats et décidant finalement quels éléments méritent d'être transformés en modèles de la prochaine génération.

Une IA plus puissante devient de plus en plus difficile à surveiller

Le même jour, Jakub Pachocki, scientifique en chef d'OpenAI, a publié un article de dix mille mots intitulé directement « Pensée extraterrestre ».

GPT-6 Sol

Après avoir lu cela, j'ai l'impression que même le scientifique en chef d'OpenAI encourage l'ensemble du secteur à ralentir…

Jakub affirme que l'IA n'est pas vraiment construite par les humains en assemblant un circuit et des règles selon un plan, mais qu'elle émerge plutôt elle-même à partir de quantités massives de données et de puissance de calcul.

Vous pouvez démonter et comprendre certaines pièces, mais personne ne peut expliquer pourquoi le système entier a soudainement acquis une certaine capacité ou comment il agirait dans un autre environnement.

Ce qui est plus préoccupant, c’est que l’IA n’a pas besoin de surpasser les humains dans tous les domaines pour poser problème ; il lui suffit d’être supérieure dans un nombre suffisant de compétences clés pour à la fois vous aider considérablement et causer de gros dégâts.

La question est donc la suivante : les humains peuvent-ils encore le comprendre ?

Par le passé, OpenAI surveillait l'IA principalement grâce à une seule méthode : observer les chaînes de pensée.

En clair, il s'agit de suivre le processus de raisonnement écrit par le modèle pour vérifier s'il n'essaie pas de tricher, de dépasser ses droits ou de contourner les restrictions.

Mais avec la génération Astra, cette méthode commence à ne plus fonctionner.

D'une part, les modèles deviennent de plus en plus habiles à « gérer » ce qu'ils disent, et leurs véritables pensées ne sont pas toujours entièrement reflétées dans leurs raisonnements ; d'autre part, les agents ne se contentent plus simplement de « réfléchir avant de répondre ». Ils peuvent appeler des outils, manipuler des ordinateurs, exécuter des environnements, et collaborer avec des humains ou d'autres agents.

Ces éléments sont mélangés, ce qui rend impossible pour les chercheurs de reconstituer une chaîne de raisonnement complète et transparente pour examiner chaque phrase.

OpenAI a également découvert qu'Astra pouvait accomplir des tâches complexes sans avoir à écrire intégralement son processus d'inférence.

En bref, le modèle a déjà appris à agir discrètement mais efficacement.

GPT-6 Sol

Dans des tests adversariaux conçus spécifiquement pour forcer le modèle à échapper à la surveillance, Astra a même démontré certaines capacités glaçantes : réduire délibérément ses résultats aux tests, contourner la surveillance et exécuter des missions destructrices.

Bien sûr, il s'agit de tests de pression conçus par l'homme, et OpenAI n'a pas conclu que Astra tromperait activement lors de tâches quotidiennes. Mais cela montre au moins qu'il est désormais difficile de couvrir tous les comportements possibles du modèle uniquement en observant la chaîne de pensée.

Vous vous souvenez de l'événement précédent sur Hugging Face ? C'était une alerte.

GPT-6 Sol

À l'époque, GPT‑5.6 Sol et un modèle de recherche interne plus puissant ont été placés dans le réseau ExploitGym avec pour mission de trouver des vulnérabilités, d'effectuer des attaques et d'obtenir le Flag. Pour évaluer la capacité réelle des modèles, les protections de sécurité complètes n'ont pas été activées dans l'environnement d'évaluation.

Le modèle n'a pas résolu le problème de manière honnête ; il a d'abord contourné l'isolation réseau, en échangeant des messages et en collaborant via des canaux non autorisés.

Ensuite, il a exploité une vulnérabilité zero-day dans le proxy de cache de paquets pour obtenir un accès à Internet, puis a progressé jusqu'au système Hugging Face afin de chercher des réponses aux tests d'ExploitGym.

GPT-6 Sol

En réalité, cette affaire a principalement été poussée par le modèle de recherche interne IM1, et GPT‑5.6 Sol a également reproduit certaines des voies d'attaque ; Astra n'a pas participé.

L'objectif initial du modèle restait de terminer le test, mais pour obtenir la réponse, il a constamment cherché des failles dans les règles, jusqu'à effectuer des actions dépassant le cadre de la tâche.

Ainsi, OpenAI a également identifié un signal d'alerte : lorsque l'Agent est suffisamment puissant, les outils suffisamment nombreux et le temps d'exécution suffisamment long, il peut chercher lui-même de nouvelles voies, appeler des ressources externes, ou même collaborer avec d'autres Agents.

Non… donc, après tout ce tour, cela ne devient-il pas un cercle vicieux ????

OpenAI a besoin de modèles plus puissants pour écrire du code, exécuter des expériences, mener des recherches sur l'alignement, et même les utiliser pour construire des systèmes de sécurité destinés à se défendre contre d'autres IA. Plus le modèle est puissant, plus il peut accomplir de tâches, et plus la vitesse de développement augmente.

Mais en même temps, il devient de plus en plus difficile pour les humains de déterminer comment il arrive à ses conclusions, et s'il réinterpréterait les règles apprises dans un environnement différent.

Jakub estime qu'aucun laboratoire ne peut actuellement affirmer avoir correctement aligné et surveillé ses modèles pour pouvoir les élargir à grande vitesse et en toute sécurité sur le long terme.

GPT-6 Sol

Avant la mise en place de normes de sécurité communes à l'ensemble du secteur, il espère que tout le monde considérera « freiner volontairement » comme une entente tacite.

Quant à OpenAI lui-même, il a également déclaré : s'il est nécessaire, il ne exclut pas de suspendre unilatéralement les efforts pour élargir la taille des modèles.

Tu ferais mieux de le faire… Je me souviens qu’une entreprise commençant par A a aussi dit cela.

Lien de référence :

[1]https://x.com/Lentils80/status/2096518218836005287?s=20

[2]https://x.com/pankajkumar_dev/status/2096532712291201460

[3]https://openai.com/index/research-acceleration-view-inside-openai/

[4]https://openai.com/index/an-alien-mind/

[5]https://x.com/JensenHuang/status/2096700264569090384?s=20

Cet article provient du compte officiel WeChat « Quantum Bit », auteur : Ting Yu

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.