Nvidia distribue des modèles d'IA comme des échantillons gratuits chez Costco. La logique est la même : une fois que vous avez essayé le produit, vous reviendrez acheter le matériel qui le fait fonctionner au mieux.
La dernière version de l'entreprise, Nemotron 3.5 Lightning, est un modèle de 30 milliards de paramètres lancé le 11 août 2026. Il utilise une architecture Mixture of Experts (MoE) avec environ 3 milliards de paramètres actifs, ce qui permet de l'exécuter sur une seule GPU tout en prenant en charge des fenêtres de contexte allant jusqu'à 1 million de jetons. C'est une capacité considérable pour un modèle que vous pouvez télécharger gratuitement sur Hugging Face.
Le modèle de la lame et du rasoir, suralimenté
Nvidia propose désormais une inférence hébergée gratuite pour plus de 100 modèles d'IA via ses API build.nvidia.com. Les développeurs peuvent accéder à ces modèles sans saisir de carte de crédit, les tester avec leurs propres charges de travail et construire des applications dessus.
Plus tôt en 2026, Nvidia a lancé le Nemotron 3 Ultra, un modèle de 550 milliards de paramètres, ainsi que Dynamo 1.0, un logiciel qui améliorerait selon les rapports les performances GPU jusqu'à 7 fois.
Pourquoi les modèles ouverts sont importants pour le secteur des GPU
L'industrie de l'IA s'est largement divisée en deux camps. D'un côté, vous avez des entreprises comme OpenAI et Anthropic qui développent des modèles fermés et propriétaires derrière des barrières payantes d'API. De l'autre, vous avez Meta avec sa série Llama et désormais Nvidia qui promeuvent des alternatives à poids ouvert que n'importe qui peut télécharger, modifier et déployer.
Les modèles sont publiés sous des licences permissives, couvrant des familles entières telles que Nemotron et Cosmos. Ils sont optimisés pour les formats matériels spécifiques Nvidia, comme NVFP4, un format de quantisation conçu pour les puces Nvidia.
En août 2026, Nvidia a également introduit NeMo Switchyard, un outil qui achemine intelligemment les tâches entre différents modèles pour réduire les coûts d'inférence.
