Claude 5.1 vient de faire son apparition, tandis qu'OpenAI Astra arrive immédiatement.
Maintenant, même Google a de nouveaux développements. Selon les dernières informations, Gemini 3.8 Flash sera lancé demain.


Il semble que le monde de l’IA soit sur le point de « célébrer les fêtes ».
Gemini 3.5 Pro est supprimé, la prochaine grande version est la 4.0
Plutôt que la sortie de Gemini 3.8 Flash, beaucoup sont plus curieux : quand arrivera donc Gemini 3.5 Pro ?!
Désolé, n'attendez plus, Google a abandonné...

Depuis l'annonce de la conférence I/O en mai de cette année, près de quatre mois se sont écoulés, et l'évolution de Gemini 3.5 Pro ne dépasse même pas celle de Flash.
Google est également contraint de « sacrifier » directement.
Heureusement, Gemini 4.0 a obtenu d'excellents résultats lors de l'évaluation en pré-entraînement, et l'entraînement postérieur se déroule toujours correctement.


Cette exclusivité du WSJ annonce également avec force les compétences de programmation impressionnantes de Gemini 3.8 Flash (code nommé « Skimaki »).
Selon des tests comparatifs internes à Google sur l'outil de codage Jetski, 3.8 Flash a directement surpassé le modèle Opus.
De plus, ce modèle a été développé pendant plusieurs mois, bien avant le « séisme » au sein du leadership de Google.
Hassabis cède son poste, le scientifique en chef Jeff Dean quitte l'entreprise, ce qui laisse beaucoup de gens inquiets quant à l'avenir de Gemini.

Cependant, il semble que tout se déroule en interne de manière ordonnée.
Actuellement, Google prévoit de lancer d'abord Gemini 3.8 Flash, car ce modèle a un nombre réduit de paramètres, nécessite moins de calculs et permet d'obtenir des résultats plus facilement.
Selon des sources internes, Google a affecté davantage de ressources humaines et de puissance de calcul depuis le début de l'année pour améliorer les capacités de Gemini à écrire du code.
En particulier, les investissements dans l'« apprentissage par renforcement » ont été augmentés pour permettre à l'IA d'apprendre véritablement de nouvelles compétences par essais et erreurs.
Et Google DeepMind ainsi que d'autres laboratoires avancent simultanément plusieurs projets, de sorte que même si l'un échoue, un autre peut le remplacer.
Gemini 3.5 Pro n'a pas répondu aux attentes, mais Gemini 4.0 n'est pas encore sorti.
Aujourd'hui, les deux géants de la Silicon Valley, OpenAI et Anthropic, se distinguent largement dans les modèles de pointe et les agents de programmation.
Information indique qu'Astra, la prochaine génération d'OpenAI, utilise également une nouvelle méthode d'inférence appelée « profondeur récurrente », réduisant le nombre de tokens de réflexion tout en améliorant considérablement les performances.
This王牌 will be revealed this week.

Mais en ce moment même, Google doit bien présenter quelque chose.
Après avoir fait la promesse de劈柴, pendant plusieurs mois, il n’a publié qu’un seul modèle, le 3.7 Flash, sans rien d’autre pour enthousiasmer la communauté IA.
Peut-être ce soir, Gemini 3.8 Flash fera son apparition.

Gemini pour la première fois, sait regarder des vidéos
Avant cette publication, Google a effectué une pré-annonce aujourd'hui en ajoutant une nouvelle fonctionnalité à Gemini —
Compréhension vidéo agentive
Cette fonctionnalité, c'est vraiment un énorme plus.
Téléchargez une vidéo de la conférence I/O : avec le même modèle, Gemini 3.7 Flash, la consommation de tokens chute directement de 88 %.

Google indique sur son blog officiel que les modèles Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite disposent tous de la capacité d'analyse vidéo agente, accessible via Google AI Studio et Gemini Enterprise Agent Platform.
Activez ce commutateur sur les jeux de données de référence standard pour l'analyse vidéo : la consommation de jetons peut diminuer jusqu'à 88 %, les coûts d'analyse jusqu'à 66 %, tandis que la précision augmente jusqu'à 7 %.

Et aucun frais supplémentaire n'est appliqué ; le prix des tokens suit toujours la tarification standard de l'API. Économiser de l'argent et obtenir une précision optimale s'affrontent généralement. Ici, ils ne se sont pas affrontés.

Parce que Gemini a appris à « déplacer la barre de progression ».
La méthode précédente s'appelait le traitement « statique » : le modèle recevait passivement un flux d'images à un débit d'images fixe, déterminé par les paramètres de l'API, sans aucune possibilité de décision.
Maintenant, le modèle décide lui-même quelle partie examiner, à quelle vitesse l'examiner, s'il faut regarder les images, écouter l'audio ou lire directement la transcription.

Ce n'est pas la première fois que Google fait cela.
La vision agente précédente combinait l'exécution de code et la compréhension d'images native de Gemini, permettant au modèle d'écrire automatiquement du code pour agrandir, recadrer et comparer une image.
C’est au tour de la vidéo : même approche, mais en remplaçant l’outil par un outil vidéo natif.
Quatre tâches qui étaient autrefois très difficiles
Le blog officiel répertorie également plusieurs scénarios d'utilisation à haut niveau de difficulté.
Recherche de fragments en moins d'une seconde. Les modèles précédents « voyaient » les vidéos en capturant une image par seconde. Le problème est que beaucoup d'éléments disparaissent en moins d'une seconde.
Nous pouvons désormais localiser ces instants avec une précision inférieure à une seconde.
Cela signifie que l'« édition automatique » est pour la première fois véritablement réalisable : auparavant, les monteurs devaient examiner manuellement la ligne de temps, cadre par cadre, pour déterminer où effectuer les coupes ; maintenant, le modèle peut d'abord analyser l'ensemble et marquer les points de coupe candidats, permettant à l'humain de faire le choix final.

Chercher une aiguille dans une botte de foin. Poser une question complexe dans des heures de contenu sans avoir à brûler des millions de tokens.
Détection d'anomalies. Une fois le modèle ciblé sur une fenêtre temporelle spécifique, il peut augmenter le taux d'images pour rééchantillonner cette période, permettant de visualiser les mouvements rapides et les défauts subtils de l'image. La qualité de la ligne de production et la surveillance de sécurité en bénéficient particulièrement, car les anomalies ne se produisent généralement que pendant quelques secondes.
Comptez. Les modèles ont toujours mal répondu à ce type de questions — combien de fois un geste est répété, combien d'objets différents sont présents dans l'image — car les quelques images manquantes contenaient justement des éléments importants.

L'agent enfin regardé la vidéo
La vidéo a toujours été la modalité la plus coûteuse.
Le texte est bon marché, les images vont bien, mais les vidéos sont lourdes et longues : une minute peut consommer autant de tokens qu'un livre entier.
Ces deux dernières années, tout le monde parlait des agents, mais surtout de leur capacité à lire, écrire et utiliser des outils.
Le problème est qu’un Agent qui repose principalement sur la compréhension du texte voit en réalité seulement un monde « retranscrit » par quelqu’un d’autre.
Il ne connaît rien de ce qui est filmé par des caméras, enregistré lors de réunions ou passé sur les lignes de production, c’est-à-dire tout ce que personne ne veut prendre le temps de transcrire en texte.
Maintenant, cette courbe de coût est réduite de moitié.
Un agent capable de traduire automatiquement plusieurs heures de surveillance, des dizaines d'heures de cours et des centaines de supports sans épuiser le budget change ainsi sa façon d'interagir avec le monde.
Il n'a plus besoin d'attendre que quelqu'un décrive l'image en texte pour le lui fournir, ni de choisir entre « voir » et « voir avec précision ».
Google a été le premier à briser cette impasse.
La bataille de l'IA, prochain round
Ces derniers jours, les calendriers de publication des quatre entreprises se sont presque superposés.
Claude 5.1 vient d'arriver, OpenAI Astra est déjà à la porte, et Google, qui a attendu plusieurs mois, sort enfin Gemini 3.8 Flash pour répondre.
Après cette mise à jour, Claude se concentre désormais sur deux domaines principaux : la programmation et la recherche.
La prochaine génération d'Astra deviendra un « agent continu » ; selon les mots d'Ultraman, ses capacités informatiques ont atteint le niveau humain.

Gemini 3.8 Flash connaîtra également une grande avancée en matière de programmation.
Actuellement, OpenAI, Anthropic, Google et SpaceXAI fonctionnent tous à plein régime.

Musk annonce la sortie de Grok 4.7 dans dix jours
Cette bataille vient tout juste d'entrer dans sa phase la plus féroce.
Références :
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI
