Nvidia souhaite que vos ordinateurs domestiques travaillent en équipe. Le nouveau routeur personnel AI de l'entreprise, appelé PAIR, est un logiciel gratuit et open source qui détecte les machines compatibles sur un réseau local, les relie entre elles et les prépare à répartir les tâches d'inférence AI sur plusieurs GPU sans envoyer une seule requête vers le cloud.
Pensez-y comme à un équilibreur de charge pour votre salon. Au lieu d’un seul PC qui peine à faire fonctionner un modèle de langage volumineux seul, PAIR répartit la charge sur tous les appareils capables du réseau, en acheminant les demandes vers la machine ayant de la capacité disponible.
Ce que fait réellement la paire
PAIR n'est pas un routeur physique. Aucun matériel supplémentaire n'est requis, aucune boîte à brancher sur le mur.
C'est un logiciel qui gère la découverte de réseau, la coordination des appareils et la répartition des tâches pour l'inférence locale d'IA. Les outils compatibles incluent Ollama et LM Studio, deux des applications les plus populaires pour exécuter des modèles de langage de grande taille sur du matériel grand public.
La prise en charge des appareils privilégie fortement l’écosystème de Nvidia, couvrant les cartes GeForce RTX 20-series et tout modèle plus récent, les GPU RTX Pro, ainsi que les systèmes DGX Spark. Les puces Apple M4 ou plus récentes sont également compatibles.
DGX Spark de Nvidia est la perle de la gamme d'inférence locale. Lorsque les machines exécutant DGX Spark sont regroupées et que les modèles sont quantisés, le système peut gérer des modèles allant jusqu'à 200 milliards de paramètres.
Les cartes grand public haut de gamme comme la RTX 5090 sont livrées avec entre 24 et 32 Go de VRAM. Le rôle de PAIR est de rendre ce matériel utile sur l'ensemble du réseau domestique, et non uniquement sur un seul ordinateur de bureau.
Le tableau d'ensemble : l'initiative de Nvidia pour localiser l'IA
PAIR s'inscrit parfaitement dans un changement stratégique plus vaste que Nvidia met en œuvre en parallèle. L'entreprise développe ce qu'elle appelle l'AI Grid, une initiative conçue pour réduire la latence et le coût associés à l'IA basée sur le cloud en gardant le calcul aussi proche que possible de l'utilisateur.
Nvidia a également annoncé un partenariat avec Perplexity le 25 août 2026, produisant ce que les entreprises appellent le Portable Computer, un appareil conçu pour exécuter localement des modèles Qwen de milieu de gamme sur du matériel Nvidia. La VRAM minimale commence à 24 Go, en cohérence avec la gamme RTX 5090.
Les agents IA modernes n'envoient pas une seule requête puis s'arrêtent ; ils enchaînent des dizaines d'appels de modèle, d'utilisations d'outils et d'étapes de raisonnement en séquence. La latence cloud s'accumule rapidement sur de longues chaînes. Un réseau local de GPU coordonné par PAIR maintient les temps d'aller-retour au minimum et évite les coûts par token qui rendent les applications agentes coûteuses à exécuter à grande échelle sur des API hébergées.
Ce que cela signifie pour le paysage concurrentiel
Nvidia effectue un mouvement calculé en publiant PAIR en logiciel libre et open-source. L'outil en lui-même ne génère pas de revenus directs, mais renforce la dépendance des utilisateurs au matériel Nvidia. Si votre réseau domestique d'IA est construit autour de PAIR et des cartes graphiques RTX, le chemin de moindre résistance pour votre prochaine mise à niveau reste au sein de l'écosystème Nvidia.
AMD et Intel proposent toutes deux des lignes de GPU concurrentielles capables d'inférence locale, et la nature open-source d'outils comme Ollama signifie que ni l'un ni l'autre n'est exclu du flux de travail. Mais l'écosystème CUDA de Nvidia et son intégration étroite avec les frameworks d'inférence dominants confèrent à PAIR une profondeur de compatibilité que les concurrents auront du mal à reproduire rapidement.
Pour les fournisseurs de cloud, la tendance représentée par PAIR mérite d’être suivie attentivement. Amazon Web Services, Google Cloud et Microsoft Azure génèrent tous des revenus significatifs provenant du trafic des API d’inférence IA. Les outils qui déplacent cette charge de travail vers du matériel grand public affaiblissent les hypothèses de croissance que ces entreprises ont intégrées dans leurs prévisions futures.
