GPT-5.6-Sol surpasse Mythos en matière de capacités de cybersécurité, les modèles open-source réduisent l'écart

icon MarsBit
Partager
AI summary iconRésumé
Les actualités sur l’IA et la crypto ont émergé lorsque l’Institut britannique pour la sécurité de l’IA (AISI) a publié un rapport le 17 juillet 2026, montrant que GPT-5.6-Sol a surpassé Claude Mythos 5 en cybersécurité. L’écart de performance est désormais de 4 à 7 mois, contre 6 à 10 mois en 2025. Les modèles open source comme GLM-5.2 et DeepSeek V4-Pro rattrapent plus rapidement cet écart. Une simulation Cyber Range et 70 tâches ont été utilisées pour l’évaluation. Les modèles open source offrent également des coûts plus faibles pour des tâches similaires. La tendance à la mise à niveau du réseau est claire.

Les capacités d'attaque et de défense de GPT-5.6-Sol dépassent celles de Claude Mythos 5 !

L'Institut britannique de sécurité de l'IA (AISI) a publié le 17 juillet un rapport d'évaluation qui, pour la première fois, quantifie publiquement l'écart de capacité d'attaque réseau entre les modèles d'IA open source et les modèles avancés propriétaires : 4 à 7 mois.

Modèle open source

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

Lors des tests internes similaires l'année dernière, cet écart était de 6 à 10 mois.

La fenêtre de défense se rétrécit, tandis que le front d'attaque accélère.

En avril de cette année, Mythos Preview et GPT-5.5 ont provoqué la plus grande progression des capacités d'attaque réseau depuis le début des tests en 2023, selon l'évaluation de l'AISI, ce qui a conduit plusieurs gouvernements à émettre des avertissements.

Les modèles open source n'ont pas encore reproduit ce saut, mais leur rythme de rattrapage est plus rapide qu'en année dernière.

4 à 7 mois : comment cela a-t-il été mesuré, où sont les différences

AISI évalue les capacités d'attaque réseau à l'aide de deux systèmes de modélisation.

Le premier ensemble comprend 70 tâches étroites couvrant quatre domaines : recherche de vulnérabilités, ingénierie inverse, pénétration Web et cryptographie, classées en quatre niveaux de difficulté, du « non-professionnel avec une formation technique » à l'« expert avec plus de dix ans d'expérience ».

Modèle open source

Le deuxième ensemble est Cyber Range, qui évalue la capacité des modèles à exécuter automatiquement des chaînes d'attaques à plusieurs étapes dans un réseau d'entreprise simulé. L'un des scénarios de test, appelé « The Last Ones », comprend 32 étapes d'attaque, 4 sous-réseaux et environ 20 hôtes ; AISI estime qu'un expert humain mettrait environ 20 heures pour accomplir toutes les étapes.

Modèle open source

Les deux systèmes ont donné une conclusion cohérente :

GLM-5.2 (publié en juin 2026) affiche des performances équivalentes à celles d'Opus 4.6 (publié en février), avec un écart de 4 mois ;

Rattrapage d'Opus 4.5 (publié en novembre dernier) sur Cyber Range, avec un écart de 7 mois.

DeepSeek V4-Pro se compare à Opus 4.5 sur les tâches étroites, avec un écart de 5 mois.

Les deux écarts sont plus étroits que les 6 à 10 mois mesurés dans l'évaluation interne de 2025.

L'écart de coût est plus grand que l'écart de compétence.

Le même test Cyber Range (montant de 100 millions de tokens) coûte environ 85 $ avec Opus 4.5 ou 4.6, environ 46 $ avec GLM-5.2, et seulement 1,19 $ avec DeepSeek V4-Pro.

Sur des tâches étroites que les deux modèles peuvent accomplir à 100 %, Opus 4.6 coûte 15,17 $ par tâche, contre 6,12 $ pour GLM-5.2 ;

Opus 4.5 coûte 12,50 $, DeepSeek V4-Pro coûte 0,28 $ .

Même capacité d'attaque, open source est d'un à deux ordres de grandeur moins cher.

Les barrières de sécurité des modèles propriétaires n'ont pas non plus créé d'écart.

Lors du test AISI, DeepSeek V4-Pro refuse parfois les tâches de rétro-ingénierie, mais il est possible de les contourner avec quelques tentatives supplémentaires.

Fable 5 d'Anthropic est un cas encore plus extrême : publié le 9 juin, il a été contourné trois jours plus tard par le chercheur en sécurité Pliny the Liberator à l'aide d'une stratégie d'évasion en plusieurs étapes ; des captures d'écran associées montrent que le modèle a généré du code d'exploitation qui aurait dû être bloqué.

Les chercheurs d'Amazon ont ensuite rapporté indépendamment une autre méthode de contournement.

Cela a directement déclenché la première ordonnance de contrôle des exportations du Département américain du Commerce ciblant un modèle d'IA. Fable 5 a été hors ligne pendant 19 jours, jusqu'à ce qu'Anthropic déploie un nouveau classificateur pour rétablir le service.

Closed source does not automatically equal security.

La fenêtre de défense se rétrécit, et les outils de défense s'accélèrent également

AISI a clarifié dans son rapport le signal politique : le temps de préparation pour la défense est plus court qu'en l'année dernière.

Le Centre national de cybersécurité du Royaume-Uni a appelé les institutions à renforcer leur base de cybersécurité et à utiliser l'IA pour améliorer leurs défenses.

Les outils IA de la même génération accélèrent également les travaux du côté défensif.

Glenn Fiedler, un développeur chevronné en programmation réseau pour les jeux, auteur pendant vingt ans d'articles de référence dans ce domaine, a récemment effectué une audit de sécurité systématique sur quatre bibliothèques open source qu'il maintient (yojimbo, netcode, reliable, serialize, totalisant environ 6000 étoiles sur GitHub et considérées comme des bibliothèques open source établies et influentes dans le domaine des jeux) : déploiement de cibles libFuzzer, activation de CI avec AddressSanitizer et MemorySanitizer, exécution de tests de pression sur des millions d'itérations, et revue ligne par ligne du code.

Modèle open source

Glenn Fiedler

43 vulnérabilités de sécurité ont été corrigées en deux semaines, dont 27 accessibles à distance via le réseau.

Modèle open source

Le plus grave est un débordement de tas à distance dans yojimbo, existant depuis 2019, que des clients malveillants peuvent déclencher en envoyant des paquets spécialement conçus.

Modèle open source

Le coût total de l'audit en tokens est d'environ 2500 dollars.

Modèle open source

Les deux côtés, attaque et défense, sont accélérés par l'IA, mais de manière asymétrique.

La diffusion des capacités d'attaque est irréversible : une fois les poids des modèles open source publiés, ils ne peuvent plus être retirés, les garanties de sécurité peuvent être supprimées, et des copies peuvent être exécutées sur des serveurs privés sans surveillance.

La mise en œuvre des outils de défense nécessite que chaque équipe investisse activement du temps et des ressources.

Un passage du rapport AISI souligne cette structure : « Une fois le code source publié, ces options sont perdues définitivement. »

L'impact de ces données sur le paysage de l'AGI est plus profond que les chiffres eux-mêmes.

L'écart de capacité entre le code ouvert et le code fermé se réduit à moins de six mois ; la stratégie par défaut consistant à utiliser la période d'exclusivité du code fermé comme tampon de sécurité est sur le point de devenir obsolète.

Les garde-fous des modèles propriétaires se sont révélés tout aussi vulnérables lors de l'événement Fable 5.

À la prochaine étape, la question centrale du jeu politique pour les décideurs mondiaux s'est aiguisée : à partir de quel niveau de capacité les modèles ne devraient pas avoir leurs poids ouverts.

AISI a annoncé qu'elle continuerait d'évaluer Kimi K3 attend le prochain modèle open source — l'endroit où tracer cette ligne dépendra très probablement des résultats des tests des prochains mois.

Références :

https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

https://github.com/mas-bandwidth/patreon/blob/main/BUGS.md

https://www.patreon.com/MasBandwidth/posts/important-news-164199395

Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI ; éditeur : Marco

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.