Juste maintenant, Google est de retour !
Ce soir, Google a officiellement lancé Gemini 3.8 Flash et Gemini 3.8 Flash Cyber, dédié à la cybersécurité.
C'est la troisième version de Flash publiée par Google en seulement six semaines.
Les deux mises à jour précédentes semblaient être des échauffements, car cette fois-ci, Google place directement le rapport qualité-prix au premier plan —
Coût unitaire de 0,58 $ ! Saisie à seulement 0,75 $/million de tokens !
Ce petit modèle, à un prix aussi bas qu'une chouette, a réussi à atteindre le niveau des meilleurs modèles mondiaux : Opus 5, GPT-5.6 Sol et Grok 4.6, lors de plusieurs tests de référence essentiels.
Le spécialiste de Google DeepMind, Yao Shunyu, a commenté : Pour le modèle, il s'agit simplement d'un petit pas ; mais pour RSI, c'est un énorme saut en avant.

Sur X, les développeurs sont en furie.
Après une test réel, quelqu’un a posé la question fondamentale : « Mon Dieu, Google n’a-t-il pas envoyé le mauvais produit ? Ce n’est pas exactement le Gemini 3.5 Pro qui n’a jamais été publié ? Avec le prix de Flash, il fait le travail de Pro ! »


Dans l'équipe DeepMind, quelqu'un n'a probablement pas fermé l'œil depuis juillet.
Tout le monde est encore en train de digérer Fable 5.1 lorsque Google retourne une nouvelle fois la table.
Le roi du coût-efficacité de Google est de retour : le roi de la performance prix
Google, long silent, announces to the world with an intensely competitive approach: the big demon has returned.

Pour comprendre l'impact de Gemini 3.8 Flash, nous devons d'abord examiner le paysage actuel de l'IA.
Dans le cadre du test Artificial Analysis, une barrière extrêmement stricte s'est déjà établie. Pour posséder une intelligence de haut niveau (Indice d'intelligence autour de 60), vous devez supporter un coût Token élevé.
En conséquence, Gemini 3.8 Flash agit comme un assassin, sans aucune éthique.
En mode raisonnement élevé d'Artificial Analysis, l'indice d'intelligence de Gemini 3.8 Flash a grimpé à 59 !

Quel concept ! Cela ne fait qu'un pas de distance par rapport aux meilleurs GPT-5.6 Sol et Grok 4.6, et dépasse même certaines dimensions de Claude Opus 5 !
Et le coût pour accomplir tout cela ? Il s'élève à seulement 0,58 $ par tâche.
Plus précisément, le coût d'entrée est maintenu à 0,75 $/million de tokens, et la sortie à 3,75 $/million de tokens.
Google a créé un graphique : sur la frontière de Pareto entre intelligence et coût, le point bleu représentant Gemini 3.8 Flash se trouve en haut à droite du benchmark logiciel DeepSWE, devançant largement le deuxième.

Gemini 3.8 Flash est non seulement intelligent, mais aussi incroyablement rapide. Sa vitesse de génération atteint un impressionnant 305 tokens/s, tandis que le modèle suivant peine à atteindre 154 tokens/s.
Un modèle à la fois rapide, intelligent et si bon marché qu'il semble gratuit — voilà le modèle que les humains peuvent vraiment utiliser au quotidien.

En particulier sur le benchmark de génie logiciel à long terme DeepSWE v1.1, 3.8 Flash a obtenu un résultat impressionnant de 73,7 %.
Lors de ce test exigeant la résolution autonome par l'IA de problèmes d'ingénierie complexes et l'écriture end-to-end de code, il a non seulement dépassé la plupart des grands modèles avancés coûteux, mais a également coûté seulement une fraction de leur prix.
Keep in mind that this is only the "Flash" version, not the "Pro" version, let alone the "Ultra" version.
Cette fois-ci, Google permet encore une fois aux petits modèles de prendre la place des modèles phares.
Quelqu'un a testé personnellement Gemini 3.8 Flash et Opus 5 sur la même tâche.

Cette progression significative dans les compétences en programmation n'est pas due au hasard.

Cette progression significative dans les compétences en programmation n'est pas due au hasard.
Selon des rapports, lors des tests de l'outil de code interne de Google, Jetski, les ingénieurs de Google ont même préféré utiliser 3.8 Flash plutôt que le modèle Opus d'Anthropic.

Derrière cela, Google a intensivement investi dans l'apprentissage par renforcement depuis le début de l'année — soit la phase finale de formation des modèles, permettant aux modèles d'apprendre réellement à accomplir des tâches par essais et erreurs.
Google DeepMind a formé une équipe d'urgence dédiée à l'amélioration des capacités des modèles de programmation, dirigée par le CTO de DeepMind et supervisée directement par le cofondateur Sergey Brin.
Leur objectif est d'inciter une auto-évolution récursive, transformant brutalement le modèle de programmation en un chercheur IA entièrement automatisé, et établissant ainsi une boucle de R&D complètement intégrée.

Dans la note interne, Google a directement déclaré :
Pour gagner l'élan final, nous devons immédiatement combler les écarts dans l'exécution des agents et transformer nos modèles en développeurs principaux.

De plus, Google a recruté Barret Zoph, cofondateur de Thinking Machines Lab et ancien responsable du post-entraînement chez OpenAI, qui occupe désormais le poste de vice-président de la recherche, en charge du renforcement et du post-entraînement. Cette manœuvre montre clairement leur détermination à aller jusqu’au bout.
Le mois dernier, le cofondateur et prix Nobel Demis Hassabis a démissionné de son poste de PDG, et son successeur, Koray Kavukcuoglu, a immédiatement déclaré : accélérer, accélérer, encore plus vite.
Base « gonflée » ou véritable force ?
Cependant, dans les acclamations, Google est généralement accusé d'avoir ouvert le champagne trop tôt.

Le plus frustrant est Meta——
Meta's Muse Spark 1.3 et Gemini 3.8 Flash s'affrontent, le premier obtenant 62 points sur l'indice d'intelligence d'Artificial Analysis, en parité avec Claude Fable 5, et se classant parmi les meilleurs.
Le coût d'entrée de Muse est 8 fois inférieur à celui de Fable 5, et son coût de sortie est près de 12 fois inférieur, offrant un rapport qualité-prix optimal.
Le chef de l'IA de Meta, Alexandr Wang, lance directement une critique acerbe : sur l'indice intelligent Artificial Analysis, Gemini ne vaut rien et ne peut que respirer les échappements des modèles des autres.


Muse Spark 1.3 obtient un score supérieur à GPT-5.6 Sol, Grok 4.6 et Gemini 3.8 Flash, mais est actuellement en prévisualisation limitée.
Quelqu'un a souligné que, bien que le graphique de benchmark de la version 3.8 Flash soit attrayant, cela ne se traduit pas nécessairement bien en pratique.
En effet, Gemini 3.8 Flash a surpassé GPT-5.6 Sol et Opus 5 dans les tests Terminal-Bench 2.1, HLE, mais l'écart important entre les scores de TBench 2.1 et TBench 4 révèle une possible composante de « tricherie aux classements ».
Autrement dit, face à des défis Zero-shot du monde réel, nouveaux et non inclus dans l'ensemble d'entraînement, 3.8 Flash est probablement encore inférieur à des monstres de paramètres comme Opus 5.
Mais la solution de Google est extrêmement intelligente — la diligence compense le manque de talent.
Comme mentionné dans le blog officiel de Google : « Ces améliorations de performance proviennent de choix de conception fondamentaux : 3.8 Flash travaille plus dur. »
Face à des tâches complexes, 3.8 Flash est conçu pour effectuer des étapes de raisonnement supplémentaires et appeler répétitivement des outils. Lorsqu'il rencontre une question qu'il ne comprend pas, il ne se contente pas de renoncer, mais consacre davantage de tokens pour effectuer une vérification et une réflexion internes rapides.
Même s'il consomme plus de tokens en raison de multiples cycles de réflexion, son prix unitaire de base étant extrêmement bas (0,75 $/million de tokens), au total, il reste bien moins cher que d'appeler directement GPT-5.6 !
Cette stratégie brise directement la compétition unidimensionnelle passée selon laquelle « de grands paramètres = de grandes capacités ».
Cela démontre que, dans un cycle d'agent parfait, la vitesse et un coût d'inférence extrêmement faible sont eux-mêmes une forme puissante d'intelligence.
Pourquoi envoyer un Flash ? La version Pro « annulée »
Cette fois-ci, Google a-t-il vraiment envoyé le bon produit ?
Gemini 3.5 Pro n’a même pas encore fait son apparition. Gemini 4, la prochaine carte maîtresse, a des données de pré-entraînement très prometteuses, mais la phase de post-entraînement n’est pas encore terminée.

En réalité, le fait que Google n'ait pas encore lancé la version Pro cache une histoire douloureuse.
Pai Chai avait vanté en mai de cette année qu'une série Pro plus puissante serait lancée « le mois prochain », mais il n'a cessé de remettre cela à plus tard.
En réalité, Google avait initialement plusieurs modèles candidats pour 3.5 Pro, mais ils ont tous été inlassablement abandonnés — car ils ne surpassaient pas suffisamment Flash !
En parallèle, le prochain modèle phare Gemini 4, très attendu, bien qu'il ait bien performé lors des évaluations de pré-entraînement, est actuellement bloqué à la phase cruciale de post-entraînement.
En résumé, tout s'est combiné de manière imprévue pour conduire à une itération folle de la série Flash.
Une vulnérabilité découverte en 2 heures qui aurait pris des mois à trouver : le classement de la cybersécurité est battu
Google cette fois-ci, ne fait-il que faire chuter les prix sur les tâches courantes avec 3.8 Flash ?
Bien plus que cela.
L'arme véritable de ce lancement est son jumeau jumeau — Gemini 3.8 Flash Cyber.
Même les développeurs s'exclament : « Quelle sorte de tâche de sécurité justifie que Google crée spécifiquement une variante Cyber pour Flash ? »
La réponse de Google est : pour lutter contre les futurs pirates AI.
Sur la plateforme de benchmark CyberGym où la vulnérabilité a été découverte, 3.8 Flash Cyber a obtenu un score de 86,2 %, dominant directement le classement et largement dépassant les modèles précédents.
Moreover, real-world code is not limited to C/C++.
Dans un test complet mené au sein de Google sur une base de code complexe couvrant 20 langages de programmation, ce modèle a réussi à détecter des vulnérabilités répandues avec un taux de réussite dépassant 70 %.
Plus impressionnant encore, ce sont ses résultats réels sur le terrain.
L'équipe de sécurité de Chrome l'a testé et a constaté qu'il génère 2,6 fois plus de correctifs précis que les meilleurs modèles commerciaux précédents, qui étaient bien plus volumineux.
L'entreprise de sécurité Wiz a découvert que son taux de rappel a augmenté de 7,5 à 9,7 % lors des tests d'intrusion, tandis que les coûts ont été réduits de 2,3 à 5,2 fois.
Ce qui est le plus surprenant, c’est que l’équipe de recherche sur les vulnérabilités de Google Cloud l’a utilisée pour découvrir, en seulement 2 heures, une vulnérabilité critique et fondamentale — alors qu’auparavant, il fallait généralement plusieurs mois aux meilleurs experts humains pour trouver une telle vulnérabilité !
Sur CWE-Bench (test de capacité à appliquer des correctifs), le taux de réussite au premier essai de 3.8 Flash Cyber atteint 47,2 %, presque au niveau des meilleurs modèles de pointe (47,8 %), mais à un prix négligeable.

C'est précisément en raison de la puissance impressionnante des attaques et défenses réseau de 3.8 Flash Cyber que Google n'a pas choisi de le rendre entièrement open source, mais a plutôt lancé le nouveau programme Fairwind, ouvert uniquement aux institutions de confiance.
OpenAI, Anthropic et Google : le triomphe des grands modèles entre en phase décisive
Avec le lancement de Gemini 3.8 Flash, on voit que les trois géants de l'IA ont emprunté trois voies d'évolution totalement différentes.
Anthropic (série Claude) se concentre sur la fiabilité et la stabilité des connaissances.
Dans les tests axés sur la couverture des connaissances et la précision factuelle (comme AA-Omniscience), Claude reste une domination écrasante.
Les sept premiers sont tous de la famille Claude ; ils renforcent actuellement clairement leur capacité à éviter les erreurs dans les tâches professionnelles, en visant une sortie stable.
OpenAI (série GPT) mise sur le « raisonnement approfondi et l'illumination ».
Dans le test CritPt axé sur la physique et les dérivations mathématiques, GPT-5.6 Sol domine de manière spectaculaire.
OpenAI semble poursuivre une émergence pure de l'intelligence, exigeant que le modèle puisse, sans qu'on lui donne la réponse, « réfléchir » comme un scientifique.
Google (série Gemini) crée un « travailleur hyper-rapide en boucle infinie ».
Google a cette fois-offert une troisième réponse : peut-être que je ne résous pas immédiatement les problèmes de physique les plus difficiles, mais je réagis extrêmement vite et à un coût extrêmement faible.
À l'ère de l'agent, je peux réfléchir 100 fois par seconde, écrire du code, l'exécuter, détecter une erreur, le modifier, et forcer l'obtention du bon résultat grâce à une itération violente à coût extrêmement faible.
Agen rencontre des difficultés dans la réalité, nécessitant des essais et erreurs répétés, l'appel d'outils et des ajustements dynamiques.
Gemini 3.8 Flash est tout simplement conçu pour ce type de « flux de travail à long terme ».
Vous pouvez générer un jeu complet avec énigmes, textures d’environnement et niveaux 3D en utilisant uniquement un seul mot-clé et une instruction de boucle dans Google Antigravity pour faire fonctionner 3.8 Flash.
Vous pouvez l'utiliser pour générer automatiquement une version DOS de Google Maps avec des vues street et la navigation.
Il est évident que l’utilisabilité et le coût de Gemini 3.8 Flash ont franchi un point critique.
L'arrivée de Gemini 3.8 Flash semble annoncer de la part de Google à l'ensemble du secteur : les grands modèles quittent le statut de « réservés aux géants » pour s'engager vers une révolution de l'accès aux ressources de calcul.
Les tâches d’agents qui nécessitaient autrefois des dizaines de milliers de dollars et plusieurs jours et nuits de travail peuvent désormais être accomplies en quelques minutes pour le prix de quelques cafés.
L'ère des individus extraordinaires pour les personnes ordinaires est vraiment arrivée.
C'est le moment de l'éveil des petits modèles.
Références :
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Édité par : Aeneas David
Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI
