Google lance Gemini 3.8 Flash, réduit l'écart de performance avec les modèles phares

iconMetaEra
Partager
AI summary iconRésumé
Google a dévoilé Gemini 3.8 Flash et sa variante cybersécurité, Gemini 3.8 Flash Cyber, le 2 septembre 2026, dans le cadre des dernières actualités sur chaîne. Le modèle standard prend en charge 1 million de jetons et obtient un score de 73,7 % sur DeepSWE v1.1, presque à la hauteur de Claude Opus 5. La version Cyber détecte et corrige automatiquement les vulnérabilités, avec plus de 70 % de réussite dans 20 langues. Les deux modèles sont désormais disponibles via l'API Gemini et Google AI Studio, avec un potentiel pour de nouvelles listings de jetons.
Google a publié le 2 septembre 2026 Gemini 3.8 Flash et Gemini 3.8 Flash Cyber destiné aux organismes de défense cybernétique fiables. La version standard offre un contexte de 1 million de tokens, axée sur la programmation, les agents et les tâches de connaissance spécialisée ; selon les tests publiés par Google, elle obtient un score de 73,7 % en ingénierie logicielle à long terme, proche des 74,0 % de Claude Opus 5, et dépasse les modèles testés en matière d'agents financiers, juridiques et de raisonnement intégré. La version Cyber peut identifier automatiquement des vulnérabilités et générer des correctifs : dans les tests internes de Google sur 20 langages de programmation, le taux de réussite dépasse 70 %, et l'équipe Chrome a reçu 2,6 fois plus de correctifs corrects que les grands modèles commerciaux. Le prix actuel de l'API est de 0,75 $ pour un million de tokens d'entrée et 3,75 $ pour un million de tokens de sortie, mais le modèle échange davantage d'étapes d'inférence et d'appels d'outils contre des performances ; des évaluations indépendantes montrent que son coût unitaire par tâche est environ 40 % plus élevé que celui de 3.7 Flash. Le signal clé de ce lancement est que les capacités d'agents, autrefois réservées aux modèles phares coûteux, entrent désormais dans la catégorie des « modèles de travail » abordables et évolutifs, mais les données de performance restent principalement basées sur des tests menés par Google et ses partenaires, et la version Cyber n'est pas accessible aux utilisateurs ordinaires.

Auteur de l'article, source : DeepMind

Mise à jour trois fois en six semaines, Google a fait de Flash son modèle principal

Gemini 3.8 Flash est sorti seulement trois semaines après la version 3.7 Flash et constitue le troisième modèle Flash lancé par Google en six semaines.

Auparavant, « Flash » signifiait généralement vitesse et faible coût, mais avec des capacités nettement inférieures à celles des modèles phares. La position de Gemini 3.8 évolue : Google le décrit toujours comme un « modèle de travail » adapté au déploiement à grande échelle, mais met désormais l'accent sur la programmation à long terme, l'appel continu d'outils et l'analyse professionnelle, plutôt que de le limiter à des tâches légères comme la discussion ou la synthèse.

Le nouveau modèle prend en charge les entrées texte, image, audio, vidéo et PDF, avec un contexte de 1 million de tokens et une sortie maximale de 64 000 tokens. Il peut appeler des outils de recherche, de fonctions et d'opérations sur ordinateur. Il est désormais officiellement disponible, et non en version de test ou d'aperçu, et peut être utilisé via Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, l'application Gemini, le mode IA de recherche et Google Sheets.

L'agent hébergé par Google, Antigravity, adopte également par défaut la version 3.8 Flash. Cela indique que ce modèle cible véritablement les agents nécessitant une planification répétée, l'appel d'outils, la vérification des résultats et une correction continue, et non une simple réponse unique.

Les performances de programmation approchent désormais celles des modèles phares coûteux

Dans le test de génie logiciel à long terme DeepSWE v1.1 publié par Google, Gemini 3.8 Flash a obtenu un score de 73,7 %, supérieur aux 65,3 % de 3.7 Flash et aux 72,7 % de GPT‑5.6 Sol, et à seulement 0,3 point de pourcentage de Claude Opus 5, qui a obtenu 74,0 %.

Ce type de test exige que le modèle accède à une base de code réelle, comprenne les relations entre plusieurs fichiers, localise les problèmes et effectue des modifications permettant de passer les tests. Il est plus proche du travail réel d’un agent de programmation que la génération indépendante d’une fonction.

Dans Vals Finance Agent v2, 3.8 Flash obtient 61,4 %, tandis que les versions testées 3.7 Flash, Claude Opus 5 et GPT‑5.6 Sol obtiennent respectivement 59,0 %, 58,6 % et 53,8 %.

Lors du test du Agent juridique Harvey, Flash 3.8 a obtenu 10,0 %, contre 8,8 % pour Flash 3.7, 6,7 % pour Claude Opus 5 et 2,5 % pour GPT‑5.6 Sol. Toutefois, les scores absolus de tous les modèles dans cette évaluation sont très faibles ; être classé premier ne signifie pas qu'ils sont capables de gérer de manière fiable des tâches juridiques complexes.

Dans le test de raisonnement interdisciplinaire HLE-Verified, 3.8 Flash obtient 54,9 %, GPT‑5.6 Sol et Claude Opus 5 obtiennent respectivement 54,5 % et 54,4 % ; les écarts entre les trois sont minimes et ne permettent pas de démontrer qu'un modèle possède un avantage global stable.

Ces résultats sont principalement publiés par Google selon ses propres configurations. Le modèle, le cadre Agent, la puissance d'inférence, les autorisations des outils et le budget de test influencent tous les résultats finaux ; par conséquent, une conclusion plus raisonnable est que les modèles de niveau Flash approchent certains modèles phares coûteux, et non que Gemini domine globalement toutes les tâches.

Travailler plus durement signifie travailler plus intelligemment, et peut aussi signifier plus cher

Google attribue l'amélioration des capacités de Flash 3.8 à un choix de conception simple : rendre le modèle « plus effort ».

Lorsqu'il est confronté à des tâches complexes, il utilise davantage d'étapes intermédiaires de raisonnement, appelle répétitivement des outils et vérifie activement le travail déjà accompli. Les développeurs peuvent choisir entre trois niveaux de réflexion : bas, moyen et élevé ; le niveau moyen est paramétré par défaut. Le niveau élevé est adapté aux tâches de programmation difficiles et aux raisonnements à plusieurs étapes, tandis que le niveau bas convient aux discussions en temps réel, à la génération de brouillons et aux tâches sensibles aux délais.

Cela réduit la probabilité que l'agent s'arrête prématurément, omette des étapes ou s'éloigne complètement de son objectif après un échec d'appel d'outil, mais consomme également plus de tokens.

Dans les tests indépendants d'Artificial Analysis, 3.8 Flash obtient un indice d'intelligence de 59 points à haut niveau de réflexion, soit une amélioration de 3 points par rapport à 3.7 Flash, et se situe à un niveau similaire à la configuration de raisonnement non maximale de GPT‑5.6 Sol. Sa vitesse moyenne de sortie est d'environ 300 tokens par seconde, avec un temps moyen de 2,5 minutes pour accomplir un test unique.

Mais la sortie moyenne de tokens de 3.8 Flash a augmenté d'environ 30 %, et le nombre de cycles d'exécution dans les évaluations d'agents est également plus élevé. Bien que le prix par token n'ait pas augmenté, le coût moyen par tâche est d'environ 0,58 $, soit environ 40 % de plus que les 0,40 $ de 3.7 Flash.

Ainsi, « prix unitaire bas » ne signifie pas « chaque tâche sera nécessairement moins chère ». Si la tâche elle-même ne nécessite pas de raisonnement complexe, faire fonctionner 3.8 Flash à haute intensité ne fera qu'augmenter le temps et les coûts. Google recommande également des flux de travail privilégiant l'efficacité, en réduisant le niveau de réflexion ou en continuant à utiliser la version 3.7 Flash toujours prise en charge.

Prix actuel bas uniquement pendant une période limitée

Au 31 décembre 2026, le prix promotionnel de Gemini 3.8 Flash est de 0,75 $ par million de tokens d'entrée et de 3,75 $ par million de tokens de sortie, identique au prix actuel de 3.7 Flash.

À compter du 1er janvier 2027, les prix standard passeront à 1,50 $ par million de tokens d'entrée et 7,50 $ par million de tokens de sortie, soit exactement le double. Les développeurs ne doivent pas considérer les prix de la période de lancement comme des prix permanents lors de l'évaluation des coûts à long terme.

Même en calculant selon les prix futurs standards, il reste inférieur à certains modèles phares ; cependant, pour un Agent nécessitant la génération de dizaines de milliers de tokens et l'exécution de dizaines d'appels d'outils, il faut comparer le coût total de la tâche, et non uniquement le chiffre par million de tokens indiqué sur la liste des prix.

L'objectif de la version Cyber n'est pas d'expliquer les vulnérabilités, mais de délivrer directement les correctifs.

Google a également publié Gemini 3.8 Flash Cyber. Il partage les capacités de base de la version standard, mais a été formé sur une cybersécurité plus ciblée et utilise des restrictions de cybersécurité plus souples, lui permettant d'effectuer des analyses de vulnérabilités que les modèles standards pourraient refuser.

Dans le benchmark de découverte de vulnérabilités CyberGym, Google affirme avoir atteint un niveau de pointe. Étant donné que CyberGym se concentre principalement sur les projets C et C++, l'entreprise a conçu un ensemble de tests internes couvrant 20 langages de programmation et incluant des bibliothèques de code réelles et complexes, avec un taux de réussite supérieur à 70 % pour la détection de vulnérabilités par Flash Cyber.

La découverte de la vulnérabilité n'est qu'une première étape. Google insiste particulièrement sur le fait que la formation de Cyber se concentre sur la correction des problèmes, et non sur la génération de programmes d'exploitation.

Dans le test de correctifs CWE-Bench exécuté par Collinear, le taux de réussite de la première soumission de Flash Cyber est de 47,2 %, contre 47,8 % pour le modèle phare leader comparé. Les deux performances sont proches, mais Google indique que le coût d'exécution de Flash Cyber est inférieur.

Cela signifie que l'objectif de l'agent de cybersécurité évolue de « signaler aux ingénieurs qu'il y a peut-être un problème » à la compréhension des vulnérabilités, à l'écriture de correctifs, à l'exécution de tests et à la validation des modifications. Si les résultats sont suffisamment fiables, cela pourrait réduire le délai entre la détection d'une vulnérabilité et le déploiement du correctif par l'équipe de sécurité.

Chrome receives a 2.6x correct patch, but still under testing by the vendor and partners

Google utilise Flash Cyber pour des travaux de sécurité interne.

L'équipe de sécurité de Chrome affirme que le nombre de correctifs de vulnérabilités correctement générés est 2,6 fois supérieur à celui des grands modèles commerciaux. La société de cybersécurité Wiz indique que, dans ses benchmarks de tests d'intrusion, le taux de rappel des vulnérabilités de Flash Cyber est supérieur de 7,5 à 9,7 points de pourcentage à celui des autres modèles de pointe, avec un coût 2,3 à 5,2 fois plus faible.

L'équipe de recherche sur les vulnérabilités de Google Cloud a également déclaré que le modèle a détecté une vulnérabilité critique de base en moins de deux heures, alors que des études similaires peuvent généralement durer plusieurs mois.

Ces résultats ont une valeur de référence pratique, mais ne peuvent pas être considérés comme une évaluation publique indépendante et reproductible. Google n'a pas rendu publics les détails précis de cette vulnérabilité critique, la liste des modèles comparés ni le tracé complet de l'exécution ; les données Chrome proviennent de Google en interne, et Wiz fait partie des partenaires Fairwind. Par conséquent, ils démontrent que les modèles sont désormais capables de participer à des tâches de sécurité réelles, mais ne prouvent pas qu'ils atteignent de manière stable des performances équivalentes sur tous les dépôts de code et types de vulnérabilités.

Les capacités de sécurité réseau les plus puissantes sont uniquement accessibles aux institutions de confiance

Flash Cyber est proposé via le nouveau programme Fairwind de Google, qui compte actuellement plus de 650 participants, principalement des agences gouvernementales de cybersécurité, des exploitants d'infrastructures critiques, des mainteneurs de logiciels et de grandes entreprises de sécurité.

Les institutions doivent limiter l'accès aux personnes internes et mettre en œuvre des mesures de sécurité telles que l'authentification multifactorielle. Une fois intégré au CodeMender Agent, le modèle peut rechercher, vérifier et corriger les vulnérabilités dans l'environnement cloud de l'institution.

Les clients ordinaires de Google Cloud peuvent toujours utiliser CodeMender avec le modèle Gemini public, mais ne peuvent pas accéder directement à toutes les fonctionnalités de Flash Cyber.

Cette approche de publication, basée sur « un modèle de base, deux niveaux d'autorisations », est très similaire à la stratégie précédente d'Anthropic, qui avait séparé Claude en Fable et Mythos : les capacités générales de programmation et d'analyse sont mises à disposition du marché, tandis que les fonctionnalités de cybersécurité plus facilement exploitables à des fins d'attaque sont protégées par une vérification d'identité, un contrôle d'accès et une surveillance continue.

La sécurité n'a pas été clairement améliorée, mais certaines performances non anglaises ont régressé.

La version standard 3.8 Flash inclut des restrictions de sécurité pour les contenus liés à la chimie, la biologie, la radioactivité, le nucléaire et les cyberattaques ; la version Cyber, qui nécessite d'accomplir des missions de défense spécialisées, dispose de restrictions de sécurité réseau plus souples et n'est donc accessible qu'aux institutions approuvées.

La fiche modèle de Google indique que, par rapport à 3.7 Flash, 3.8 Flash n'apporte pas de nouvelles capacités significatives dans les domaines à haut risque ciblés par le cadre de sécurité avancé de l'entreprise, et ne déclenche donc pas un niveau de risque supérieur. Sa protection lors des tests d'injection de prompts indirects Gray Swan s'est également améliorée.

Cependant, la fiche du modèle indique également que 3.8 Flash a reculé de 5,4 points de pourcentage par rapport à 3.7 Flash lors des tests automatisés de sécurité multilingue. Après vérification manuelle par Google, la plupart des différences ont été jugées comme des faux positifs ou des contenus non graves, mais l'échantillon complet et les données par langue n'ont pas été publiées.

Le modèle conserve également les problèmes courants des grands modèles linguistiques, notamment les hallucinations, des réponses occasionnellement lentes ou des dépasses de délai, ainsi qu'une utilisation excessive de tokens pour améliorer les performances. La date de fin de connaissance est indiquée comme mars 2026, mais Google précise que les connaissances fiables dans certains domaines peuvent encore être mises à jour uniquement jusqu'à environ janvier 2025 ; il est nécessaire de vérifier en ligne les informations les plus récentes.

La véritable concurrence passe de « qui est le plus intelligent » à « qui peut être utilisé à grande échelle »

Ce qui mérite le plus d'attention dans Gemini 3.8 Flash, ce n'est pas qu'une seule métrique dépasse les autres de quelques centièmes, mais que Google intègre des capacités de programmation à long terme, d'analyse professionnelle et d'appel autonome d'outils dans la tranche de prix de Flash.

Les modèles phares sont adaptés aux tâches complexes, à haute valeur et à faible fréquence ; les agents réellement déployés dans les services clients d'entreprise, les chaînes de programmation, l'analyse financière et les analyses de sécurité peuvent traiter des millions d'appels par jour. Dans ces scénarios, la vitesse, le coût unitaire et le taux de réussite par tâche sont souvent plus importants que la première place au classement.

3.8 Flash montre également cette contradiction : plus le modèle est habile à revoir ses actions et à travailler en continu, plus il est susceptible de générer davantage de tokens, augmentant ainsi le coût unitaire des modèles « bon marché » pour une tâche unique. Le cœur de la compétition future entre agents ne sera donc plus seulement qui répond le mieux, mais aussi qui sait quand continuer à réfléchir, quand faire appel à un outil et quand s'arrêter.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.