OpenAI a déclaré le 1er septembre que Astra, encore non publiée, a atteint le seuil de sécurité informatique de niveau « critique » dans son cadre de préparation. Il s'agit de la première fois qu'OpenAI classe un modèle à ce niveau, ce qui implique qu'il sera soumis à des restrictions de sécurité plus strictes avant son développement et sa publication.
Première entrée au niveau critique
Selon la définition d'OpenAI, un modèle est classé comme « critique » s'il peut découvrir de manière autonome des vulnérabilités inconnues dans divers systèmes réels renforcés et construire des chaînes d'attaque exploitables, ou accomplir une attaque réseau complète contre des cibles de haute difficulté uniquement à partir d'objectifs de haut niveau. Les modèles précédents, y compris GPT-5.6 Sol, atteignaient au maximum le niveau « risque élevé ».
Deux vulnérabilités zero-day ont été découvertes lors des tests
Dans le test d'exploitation ExploitBench, Astra a obtenu un taux de réussite de 100 %. Ce test évalue principalement la capacité du modèle à convertir des vulnérabilités logicielles connues en code d'exploitation exécutable.
Afin d'éliminer l'influence des bases de questions mémorisées, OpenAI a sélectionné 20 vulnérabilités critiques du moteur JavaScript Google V8 divulguées entre juin et août de cette année pour des tests internes. OpenAI affirme qu'Astra a obtenu un taux de réussite supérieur à GPT-5.6 Sol pour l'exécution arbitraire de code, tout en utilisant moins de tokens de sortie. Pendant les tests, Astra a également découvert et relié deux vulnérabilités zero-day auparavant inconnues ; la divulgation de ces problèmes aux parties concernées est en cours.
Ouvert d'abord à un petit groupe de testeurs
Dans un test plus proche de la réalité, Astra a construit une chaîne d'intrusion complète en ciblant un navigateur renforcé et un système d'exploitation renforcé. OpenAI a déclaré que le modèle a réussi à s'échapper du sandbox du navigateur et à exécuter des commandes sur l'hôte en incitant simplement la cible à ouvrir un fichier HTML malveillant. Dans un autre test, il a également enchaîné plusieurs vulnérabilités système pour créer une voie d'élévation de privilèges, permettant à un compte utilisateur normal d'obtenir finalement les privilèges root.
OpenAI indique qu'Astra a atteint un taux de refus de 91,5 % pour les prompts de jailbreak de cybersécurité lors des tests internes, dépassant les 59 % de GPT-5.6 Sol. Ses capacités les plus robustes en matière de cybersécurité seront d'abord offertes à un petit nombre de testeurs alpha, puis progressivement élargies via le projet Daybreak Blue, principalement destiné aux travaux de sécurité défensive.
Informations complémentaires : À l'occasion de cette divulgation, Anthropic a également lancé Fable 5.1 et Mythos 5.1, ce dernier restant exclusivement accessible aux institutions de cybersécurité et de sciences de la vie ayant été approuvées. OpenAI n'a pas encore annoncé la date de mise en ligne officielle d'Astra.
