Nvidia released Alpamayo 2 Super à usage commercial mardi, offrant aux constructeurs automobiles et aux développeurs de véhicules autonomes l'accès à son plus grand modèle d'raisonnement ouvert pour les robotaxis et les systèmes de conduite autonome.
Le modèle est disponible via Hugging Face sous la licence OpenMDW 1.1 de la Linux Foundation, qui autorise le fine-tuning, les modèles dérivés et la redistribution commerciale. Nvidia a indiqué qu'elle applique également cette licence aux modèles précédents de la famille Alpamayo, initialement publiés à des fins de recherche et de développement.
Alpamayo 2 Super est un modèle vision-langage-action de 34 milliards de paramètres, composé d'une base Cosmos 3 Super Reasoner de 32 milliards de paramètres et d'un composant d'action basé sur la diffusion d'environ 2,3 milliards de paramètres.
Le modèle a été post-entraîné à l'aide de l'apprentissage par renforcement et est environ trois fois plus volumineux que les modèles Alpamayo 1 et Alpamayo 1.5 de Nvidia, qui comptent 10 milliards de paramètres.
Le modèle traite les vidéos provenant des caméras positionnées autour d'un véhicule, ainsi que les instructions de navigation et son historique de mouvements récents. Nvidia a déclaré que la configuration complète en environnement 360° permet au système d'accéder aux vues avant, latérales et arrière lors de l'évaluation de situations telles que les changements de voie, les intégrations, les intersections et les virages sans protection.
Pour chaque scénario de conduite, Alpamayo 2 Super peut générer une trajectoire prévue et une chaîne de traces causales expliquant les facteurs à l'origine de sa décision. Il peut également produire des actions de niveau supérieur, telles que céder le passage, changer de voie ou s'arrêter.
Les fonctions supplémentaires incluent la réponse à des questions visuelles, le lien des réponses à des régions au sein d'images de caméra et la génération automatique d'étiquettes de raisonnement pour les données d'entraînement et de validation. Nvidia a déclaré que le modèle peut être appliqué à des séquences de flotte propriétaires pour convertir des clips de conduite bruts en matériel d'entraînement étiqueté.
La fiche du modèle Hugging Face indique qu'Alpamayo 2 Super a été formé à l'aide d'environ 115 000 heures de vidéos de conduite multicanal et d'environ 3,7 millions de traces de raisonnement chaîné de causalité. Ses sorties incluent du texte et des trajectoires de véhicule prévues couvrant jusqu'à 6,4 secondes.
Nvidia a déclaré qu'Alpamayo 2 Super occupait la première place parmi près de 40 modèles testés sur LingoQA, un benchmark axé sur le raisonnement concernant des scénarios de conduite autonome.
Selon la métrique Lingo Judge, Nvidia a déclaré que le modèle a obtenu 17 points de plus que Qwen2.5 VL 72B, 15,1 point de plus que Gemini 2.5 Pro et 23,2 points de plus que GPT-4o. Les résultats ont été publiés à partir des tests effectués par Nvidia.
La fiche modèle indique un score Lingo Judge de 79,2, ainsi que les résultats de l'évaluation en boucle fermée AlpaSim de Nvidia et une évaluation de trajectoire en boucle ouverte basée sur des échantillons de conduite complexes.
Nvidia a déclaré que les développeurs peuvent utiliser Alpamayo 2 Super comme modèle enseignant basé sur le cloud pour générer des données et des résultats de raisonnement pour des modèles plus petits. Ces modèles peuvent ensuite être optimisés pour un traitement en temps réel à l'intérieur des véhicules de production.
La plateforme plus large Alpamayo inclut également AlpaSim pour la simulation en boucle fermée, AlpaGym pour l'apprentissage par renforcement, des jeux de données de conduite par IA physique et des outils d'entraînement ouverts. Nvidia a déclaré que les modèles Alpamayo ont collectivement dépassé 500 000 téléchargements sur Hugging Face.
