Google lancera Gemini 3.8 Flash demain, axé sur le codage et la compréhension vidéo

icon MarsBit
Partager
AI summary iconRésumé
Google prévoit de lancer Gemini 3.8 Flash demain, un événement majeur d'annonce de jeton dans le domaine de l'IA. Le modèle, codé « Skimaki », améliore la programmation et la compréhension vidéo tout en réduisant l'utilisation de jetons jusqu'à 88 %. Gemini 3.5 Pro a été annulé, le développement étant désormais concentré sur Gemini 4.0. Les nouvelles sur chaîne indiquent que Google introduit également une compréhension vidéo agente pour l'analyse dynamique du contenu.

Claude 5.1 vient de faire son apparition, tandis qu'OpenAI Astra arrive immédiatement.

Maintenant, même Google a de nouveaux développements. Selon les dernières informations, Gemini 3.8 Flash sera lancé demain.

Google

Google

Il semble que le monde de l’IA soit sur le point de « célébrer les fêtes ».

Gemini 3.5 Pro est supprimé, la prochaine grande version est la 4.0

Plutôt que la sortie de Gemini 3.8 Flash, beaucoup sont plus curieux : quand arrivera donc Gemini 3.5 Pro ?!

Désolé, n'attendez plus, Google a abandonné...

Google

Depuis l'annonce de la conférence I/O en mai de cette année, près de quatre mois se sont écoulés, et l'évolution de Gemini 3.5 Pro ne dépasse même pas celle de Flash.

Google est également contraint de « sacrifier » directement.

Heureusement, Gemini 4.0 a obtenu d'excellents résultats lors de l'évaluation en pré-entraînement, et l'entraînement postérieur se déroule toujours correctement.

Google

Google

Cette exclusivité du WSJ annonce également avec force les compétences de programmation impressionnantes de Gemini 3.8 Flash (code nommé « Skimaki »).

Selon des tests comparatifs internes à Google sur l'outil de codage Jetski, 3.8 Flash a directement surpassé le modèle Opus.

De plus, ce modèle a été développé pendant plusieurs mois, bien avant le « séisme » au sein du leadership de Google.

Hassabis cède son poste, le scientifique en chef Jeff Dean quitte l'entreprise, ce qui laisse beaucoup de gens inquiets quant à l'avenir de Gemini.

Google

Cependant, il semble que tout se déroule en interne de manière ordonnée.

Actuellement, Google prévoit de lancer d'abord Gemini 3.8 Flash, car ce modèle a un nombre réduit de paramètres, nécessite moins de calculs et permet d'obtenir des résultats plus facilement.

Selon des sources internes, Google a affecté davantage de ressources humaines et de puissance de calcul depuis le début de l'année pour améliorer les capacités de Gemini à écrire du code.

En particulier, les investissements dans l'« apprentissage par renforcement » ont été augmentés pour permettre à l'IA d'apprendre véritablement de nouvelles compétences par essais et erreurs.

Et Google DeepMind ainsi que d'autres laboratoires avancent simultanément plusieurs projets, de sorte que même si l'un échoue, un autre peut le remplacer.

Gemini 3.5 Pro n'a pas répondu aux attentes, mais Gemini 4.0 n'est pas encore sorti.

Aujourd'hui, les deux géants de la Silicon Valley, OpenAI et Anthropic, se distinguent largement dans les modèles de pointe et les agents de programmation.

Information indique qu'Astra, la prochaine génération d'OpenAI, utilise également une nouvelle méthode d'inférence appelée « profondeur récurrente », réduisant le nombre de tokens de réflexion tout en améliorant considérablement les performances.

This王牌 will be revealed this week.

Google

Mais en ce moment même, Google doit bien présenter quelque chose.

Après avoir fait la promesse de劈柴, pendant plusieurs mois, il n’a publié qu’un seul modèle, le 3.7 Flash, sans rien d’autre pour enthousiasmer la communauté IA.

Peut-être ce soir, Gemini 3.8 Flash fera son apparition.

Google

Gemini pour la première fois, sait regarder des vidéos

Avant cette publication, Google a effectué une pré-annonce aujourd'hui en ajoutant une nouvelle fonctionnalité à Gemini —

Compréhension vidéo agentive

Cette fonctionnalité, c'est vraiment un énorme plus.

Téléchargez une vidéo de la conférence I/O : avec le même modèle, Gemini 3.7 Flash, la consommation de tokens chute directement de 88 %.

Google

Google indique sur son blog officiel que les modèles Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite disposent tous de la capacité d'analyse vidéo agente, accessible via Google AI Studio et Gemini Enterprise Agent Platform.

Activez ce commutateur sur les jeux de données de référence standard pour l'analyse vidéo : la consommation de jetons peut diminuer jusqu'à 88 %, les coûts d'analyse jusqu'à 66 %, tandis que la précision augmente jusqu'à 7 %.

Google

Et aucun frais supplémentaire n'est appliqué ; le prix des tokens suit toujours la tarification standard de l'API. Économiser de l'argent et obtenir une précision optimale s'affrontent généralement. Ici, ils ne se sont pas affrontés.

Google

Parce que Gemini a appris à « déplacer la barre de progression ».

La méthode précédente s'appelait le traitement « statique » : le modèle recevait passivement un flux d'images à un débit d'images fixe, déterminé par les paramètres de l'API, sans aucune possibilité de décision.

Maintenant, le modèle décide lui-même quelle partie examiner, à quelle vitesse l'examiner, s'il faut regarder les images, écouter l'audio ou lire directement la transcription.

Google

Ce n'est pas la première fois que Google fait cela.

La vision agente précédente combinait l'exécution de code et la compréhension d'images native de Gemini, permettant au modèle d'écrire automatiquement du code pour agrandir, recadrer et comparer une image.

C’est au tour de la vidéo : même approche, mais en remplaçant l’outil par un outil vidéo natif.

Quatre tâches qui étaient autrefois très difficiles

Le blog officiel répertorie également plusieurs scénarios d'utilisation à haut niveau de difficulté.

Recherche de fragments en moins d'une seconde. Les modèles précédents « voyaient » les vidéos en capturant une image par seconde. Le problème est que beaucoup d'éléments disparaissent en moins d'une seconde.

Nous pouvons désormais localiser ces instants avec une précision inférieure à une seconde.

Cela signifie que l'« édition automatique » est pour la première fois véritablement réalisable : auparavant, les monteurs devaient examiner manuellement la ligne de temps, cadre par cadre, pour déterminer où effectuer les coupes ; maintenant, le modèle peut d'abord analyser l'ensemble et marquer les points de coupe candidats, permettant à l'humain de faire le choix final.

Google

Chercher une aiguille dans une botte de foin. Poser une question complexe dans des heures de contenu sans avoir à brûler des millions de tokens.

Détection d'anomalies. Une fois le modèle ciblé sur une fenêtre temporelle spécifique, il peut augmenter le taux d'images pour rééchantillonner cette période, permettant de visualiser les mouvements rapides et les défauts subtils de l'image. La qualité de la ligne de production et la surveillance de sécurité en bénéficient particulièrement, car les anomalies ne se produisent généralement que pendant quelques secondes.

Comptez. Les modèles ont toujours mal répondu à ce type de questions — combien de fois un geste est répété, combien d'objets différents sont présents dans l'image — car les quelques images manquantes contenaient justement des éléments importants.

Google

L'agent enfin regardé la vidéo

La vidéo a toujours été la modalité la plus coûteuse.

Le texte est bon marché, les images vont bien, mais les vidéos sont lourdes et longues : une minute peut consommer autant de tokens qu'un livre entier.

Ces deux dernières années, tout le monde parlait des agents, mais surtout de leur capacité à lire, écrire et utiliser des outils.

Le problème est qu’un Agent qui repose principalement sur la compréhension du texte voit en réalité seulement un monde « retranscrit » par quelqu’un d’autre.

Il ne connaît rien de ce qui est filmé par des caméras, enregistré lors de réunions ou passé sur les lignes de production, c’est-à-dire tout ce que personne ne veut prendre le temps de transcrire en texte.

Maintenant, cette courbe de coût est réduite de moitié.

Un agent capable de traduire automatiquement plusieurs heures de surveillance, des dizaines d'heures de cours et des centaines de supports sans épuiser le budget change ainsi sa façon d'interagir avec le monde.

Il n'a plus besoin d'attendre que quelqu'un décrive l'image en texte pour le lui fournir, ni de choisir entre « voir » et « voir avec précision ».

Google a été le premier à briser cette impasse.

La bataille de l'IA, prochain round

Ces derniers jours, les calendriers de publication des quatre entreprises se sont presque superposés.

Claude 5.1 vient d'arriver, OpenAI Astra est déjà à la porte, et Google, qui a attendu plusieurs mois, sort enfin Gemini 3.8 Flash pour répondre.

Après cette mise à jour, Claude se concentre désormais sur deux domaines principaux : la programmation et la recherche.

La prochaine génération d'Astra deviendra un « agent continu » ; selon les mots d'Ultraman, ses capacités informatiques ont atteint le niveau humain.

Google

Gemini 3.8 Flash connaîtra également une grande avancée en matière de programmation.

Actuellement, OpenAI, Anthropic, Google et SpaceXAI fonctionnent tous à plein régime.

Google

Musk annonce la sortie de Grok 4.7 dans dix jours

Cette bataille vient tout juste d'entrer dans sa phase la plus féroce.

Références :

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Cet article provient du compte WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.