AMD acquiert Taalas pour intégrer les poids de modèles IA dans les puces

iconBitPush
Partager
AI summary iconRésumé
AMD a acquis l'entreprise canadienne de puces Taalas, basée à Toronto, qui intègre directement les poids des modèles d'IA dans le silicium. La puce HC1 de Taalas, construite sur la technologie TSMC 6nm, exécute le modèle Llama 3.1 8B de Meta à 17 000 jetons par seconde, surpassant les performances et l'efficacité énergétique des puces Nvidia H200 et H100. La puce utilise un format à 3 bits et se met à jour toutes les 8 semaines grâce à des changements de masque métallique. AMD prévoit d'intégrer les puces d'inférence de Taalas à sa gamme de GPU pour les charges de travail IA. Cette actualité IA + crypto intervient au moment où les données sur l'inflation évoluent et que la demande en informatique efficace augmente.

Auteur : Xiao Bing

AMD acquiert Taalas : les puces d'inférence commencent à graver les poids des modèles dans la silicium


Le 6 août, AMD a annoncé l'acquisition de l'entreprise de puces de Toronto, Taalas, dont le montant de la transaction n'a pas été divulgué. Cette start-up fondée en 2023 et ayant levé au total 219 millions de dollars américains a accompli une chose qui semble un peu folle : brûler directement les poids des modèles AI dans les couches métalliques des puces pour créer des puces dédiées ne pouvant exécuter qu'un seul modèle.

Les GPU fonctionnent en stockant les paramètres du modèle dans une mémoire vidéo à haut débit (HBM) et en déplaçant répétitivement les données vers et depuis les unités de calcul lors de l'inférence. Ce processus de « déplacement » consomme une grande quantité d'énergie et de temps, et est connu dans l'industrie comme le « mur de mémoire ». La méthode de Taalas consiste à éliminer complètement ce déplacement en intégrant les poids directement dans les transistors du circuit, fusionnant ainsi le stockage et le calcul en un seul système.

Le coût est que ce puce ne peut exécuter qu'un seul modèle, mais le gain est une amélioration d'un ordre de grandeur en vitesse et en efficacité énergétique.

What does 17000 tokens/second mean?

La puce de vérification technique Taalas, HC1, est basée sur le procédé TSMC 6 nm, avec une surface de puce de 815 mm² et 53 milliards de transistors ; le modèle intégré est le Llama 3.1 8B de Meta.

Données de performance de HC1 : environ 17 000 tokens/seconde par utilisateur. À titre de comparaison, Nvidia H200 atteint environ 230 tokens/seconde et H100 environ 150 tokens/seconde sur le même modèle. Un écart de vitesse de 73 fois, avec une consommation d'énergie seulement dix fois inférieure.

Comptabilité économique plus intuitive : le coût d'inférence déclaré par Taalas est d'environ 0,75 centime par million de tokens (Llama 8B), tandis que les solutions GPU se situent entre 20 et 49 cents. Chaque carte HC1 consomme 250 W ; un rack standard en refroidissement par air, contenant 10 cartes, nécessite seulement 12 à 15 kW, sans refroidissement liquide, alors qu'un rack GPU peut consommer de 120 à 600 kW.

L'analyste de Forbes Karl Freund a évalué en février : « 10 fois plus rapide que la plateforme d'inférence la plus rapide (Cerebras Wafer-Scale Engine), et deux ordres de grandeur plus rapide qu'une GPU. »

Mais il y a plusieurs conditions limitatives importantes. HC1 utilise un format de données 3-bit développé en interne par Taalas, associé à des paramètres 6-bit, ce qui implique une quantisation très agressive et une perte de qualité inévitable sur des tâches d'inférence complexes. Les données de 17 000 tokens/seconde proviennent d'un test de référence fourni par le fabricant avec 1K d'entrée et 1K de sortie, et ne reflètent pas les performances réelles en environnement de production. De plus, Llama 3.1 8B est un modèle publié au milieu de l'année 2024, et une version quantifiée avec 8 milliards de paramètres peut même fonctionner sur un Raspberry Pi 5. HC1 démontre le potentiel de l'architecture, et non la compétitivité d'un produit mature.

Que faire en cas de remplacement du modèle ?

Graver le modèle sur la puce, la question la plus intuitive est : que se passe-t-il si le modèle est mis à jour ? La puce devient-elle inutilisable ?

La réponse de Taalas est : non, il ne sera pas obsolète. Le cycle de conception traditionnel des ASIC prend plus de deux ans. Taalas a développé un processus de conception automatisé qui permet de compiler un nouveau modèle sur un nouveau circuit en modifiant uniquement quelques masques métalliques en haut niveau du chip, avec un cycle d'environ 8 semaines. L'entreprise a intégré dans son modèle de coûts les frais de trois mises à jour de circuit sur une période de quatre ans.

Cette réponse peut soulager une partie de l'anxiété, mais ne la supprime pas complètement.

La flexibilité des GPU réside dans le fait qu'une même carte peut exécuter aujourd'hui Llama, demain Claude, et après-demain un nouveau modèle encore non publié. Les puces de Taalas ne permettent pas cela. Si un client a besoin de plusieurs modèles simultanément (ce qui est extrêmement courant en production), il faut disposer d'une puce différente pour chaque modèle, ce qui augmente la complexité de la gestion des stocks et de l'exploitation.

HC2 est en cours de développement, avec pour objectif un modèle d'environ 20 milliards de paramètres, utilisant une précision améliorée en 4-bit flottant. Taalas prévoyait initialement de prendre en charge des modèles de pointe d'ici la fin de l'année 2026.

L'acquisition d'AMD apporte une synergie entre la gamme de produits Instinct GPU et le système de rack Helios, permettant aux clients d'utiliser les GPU pour des charges de travail flexibles et variées, et les puces Taalas pour l'inférence à haut débit et stable d'un seul modèle.

La course aux armements des puces d'inférence

AMD acquiert Taalas, ce qui constitue la dernière acquisition dans la vague d'acquisitions de puces d'inférence des huit derniers mois, dans un contexte industriel.

En décembre 2025, Nvidia a acquis Groq pour 20 milliards de dollars américains, en obtenant l'architecture d'inférence à faible latence basée sur SRAM.

En mai 2026, Cerebras a effectué son IPO avec une capitalisation boursière d'environ 560 milliards de dollars, devenant la plus grande IPO technologique depuis Snowflake en 2020.

En juin, Etched a mis fin à plus de deux ans d'obscurité en annonçant que son premier processeur dédié aux Transformers avait été fabriqué sur le procédé N4P de TSMC, avec plus de 1 milliard de dollars de contrats clients en poche. Intel aurait signé une lettre d'intention d'acquisition avec SambaNova, et Qualcomm serait en négociations avec Tenstorrent.

Ces transactions pointent vers le même constat : le raisonnement devient le principal champ de bataille des dépenses en puissance de calcul pour l'IA.

Les prévisions du secteur indiquent que d'ici 2026, l'inférence représentera les deux tiers des dépenses en calcul IA, et d'ici 2030, les ASIC dédiés à l'inférence pourraient capturer 45 % du marché de l'inférence. Les GPU de Nvidia dominent toujours le segment de l'entraînement, mais leur architecture générale fait face à des défis croissants de la part de puces dédiées sur le segment de l'inférence.

Taalas se trouve à l'extrémité la plus extrême de ce spectre : il renonce même à la généralité d'un "modèle de première catégorie" pour créer un processeur dédié à un "seul modèle".

Groq utilise du SRAM pour contourner le mur de la mémoire, Cerebras utilise une surface de wafer pour briser les limites par la force, Etched est optimisé uniquement pour l'architecture Transformer, tandis que Taalas fait un pari plus audacieux : il mise sur le fait que les modèles d'IA vont progressivement se stabiliser, comme les protocoles de communication qui finissent par converger vers quelques standards. Lorsque les modèles ne seront plus remplacés chaque mois, fabriquer un chip dédié pour chacun des quelques modèles les plus populaires deviendra économiquement rentable.

Le modèle de pari va « se figer »

Vamsi Boppana, vice-président senior d'AMD, a déclaré dans l'annonce que l'objectif de l'acquisition est de fournir aux clients « la meilleure solution de calcul pour chaque charge de travail IA ». Cette phrase se traduit en stratégie concurrentielle par : les GPU pour la flexibilité, les puces Taalas pour l'efficacité maximale, les clients les combinent selon leurs besoins.

La validité de cette logique de combinaison dépend d'une hypothèse fondamentale : la fréquence de mise à jour des modèles d'IA ralentira-t-elle ?

Si les grands modèles continuent de subir des mises à jour architecturales tous les quelques mois, alors intégrer les poids directement dans la silicium revient à verser du béton sur du sable mouvant : le processeur n’aura même pas encore été amorti que le modèle sera déjà obsolète. Mais si les capacités des modèles tendent vers une convergence et que les modèles de tête offrent un service stable pendant un à deux ans, devenant la norme, alors les puces dédiées au style Taalas deviendront, comme les puces de baseband dans l’industrie des télécommunications, une évidence et non plus une expérience folle.

En regardant les 12 derniers mois, le rythme des mises à jour des modèles a effectivement subi des changements subtils. Les intervalles entre les versions de la série Llama, de 3.1 à 3.2 puis à 4, s'allongent, tandis que les changements d'architecture de GPT, de 4 à 4o puis à 5, deviennent de plus en plus limités. De plus en plus de nouveaux modèles sont développés en effectuant de la distillation, de la quantification et du fine-tuning sur des architectures existantes, et l'itération des modèles de base ralentit.

Si cette tendance se poursuit, Taalas a raison.


Twitter : https://twitter.com/BitpushNewsCN

Groupe de discussion BitPush sur Telegram : https://t.me/BitPushCommunity

Abonnez-vous à BitPush sur Telegram : https://t.me/bitpush

Remarque : Tous les articles de Beepush reflètent uniquement les opinions des auteurs et ne constituent pas des conseils en matière d'investissement.
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.