AMD acquiert Taalas pour intégrer les poids de modèles IA dans la silicium pour l'inférence

iconTechFlow
Partager
AI summary iconRésumé
AMD a annoncé l'acquisition de Taalas, une startup de puces basée à Toronto, une initiative qui met les actualités IA + crypto sous le Spotlight. Taalas intègre directement les poids des modèles IA dans les couches métalliques de ses puces, éliminant ainsi le déplacement de données entre la mémoire et les unités de calcul. La puce HC1, conçue sur le processus TSMC 6nm, a atteint 17 000 tokens par seconde avec Llama 3.1 8B, surpassant la Nvidia H200 de 73 fois avec un dixième de la consommation d'énergie. La puce est spécifique au modèle et utilise une quantisation agressive, ce qui peut affecter la précision. Taalas prévoit de mettre à jour ses puces toutes les 8 semaines, avec la HC2 ciblant des modèles de 200 milliards de paramètres. AMD intégrera les puces de Taalas à sa gamme de GPU Instinct pour des charges de travail IA efficaces, ce qui en fait un développement clé sur la chaîne.

Écrit par Xiao Bing

Le 6 août, AMD a annoncé l'acquisition de la société de puces torontoise Taalas, le montant de la transaction n'ayant pas été divulgué. Cette start-up fondée en 2023 et ayant levé au total 219 millions de dollars américains a accompli une chose qui semble un peu folle : brûler directement les poids des modèles d'IA dans les couches métalliques des puces pour créer des puces dédiées ne pouvant exécuter qu'un seul modèle.

Les GPU fonctionnent en stockant les paramètres du modèle dans une mémoire vidéo à haut débit (HBM) et en déplaçant répétitivement les données vers et depuis les unités de calcul lors de l'inférence. Ce processus de « déplacement » consomme une grande quantité d'énergie et de temps, et est connu dans l'industrie sous le nom de « mur de mémoire ». La méthode de Taalas consiste à éliminer complètement ce déplacement en intégrant les poids directement dans les transistors du circuit, fusionnant ainsi le stockage et le calcul en un seul système.

Le coût est que ce puce ne peut exécuter qu'un seul modèle, mais le gain est une amélioration d'un ordre de grandeur en vitesse et en efficacité énergétique.

What does 17000 tokens/second mean?

La puce de vérification technique HC1 de Taalas est basée sur le procédé 6 nm de TSMC, avec une surface de puce de 815 mm² et 53 milliards de transistors. Le modèle intégré est Llama 3.1 8B de Meta.

Les performances de HC1 : environ 17 000 tokens/seconde par utilisateur. À titre de comparaison, le Nvidia H200 atteint environ 230 tokens/seconde sur le même modèle, et le H100 environ 150 tokens/seconde. Un écart de vitesse de 73 fois, avec une consommation d'énergie seulement dix fois inférieure.

Comptabilité économique plus intuitive : le coût d'inférence déclaré par Taalas est d'environ 0,75 centime par million de tokens (Llama 8B), tandis que les solutions GPU se situent entre 20 et 49 cents. Chaque carte HC1 consomme 250 W ; un rack standard à refroidissement par air contenant 10 cartes nécessite seulement 12 à 15 kW, sans refroidissement liquide, alors qu'un rack GPU peut consommer entre 120 et 600 kW.

L'analyste de Forbes Karl Freund a évalué en février : « 10 fois plus rapide que la plateforme d'inférence la plus rapide (Cerebras Wafer-Scale Engine), et deux ordres de grandeur plus rapide qu'une GPU. »

Cependant, plusieurs conditions limitatives sont importantes. HC1 utilise un format de données 3-bit développé en interne par Taalas, associé à des paramètres 6-bit, ce qui implique une quantisation très agressive et une perte de qualité inévitable sur des tâches d'inférence complexes. Les données de 17 000 tokens/seconde proviennent d'un test de référence fournisseur avec 1K d'entrée et 1K de sortie, et ne reflètent pas les performances réelles en environnement de production. De plus, Llama 3.1 8B est un modèle publié au milieu de l'année 2024, et une version quantifiée avec 8 milliards de paramètres peut même fonctionner sur un Raspberry Pi 5. HC1 démontre le potentiel de l'architecture, et non la compétitivité d'un produit mature.

Que faire en cas de remplacement du modèle ?

Graver le modèle dans la puce, la question la plus intuitive est : que se passe-t-il si le modèle est mis à jour ? La puce devient-elle inutilisable ?

La réponse de Taalas est : pas d'obsolescence. Le cycle de conception traditionnel des ASIC prend plus de deux ans. Taalas a développé un processus de conception automatisé qui permet de compiler un nouveau modèle sur un nouveau silicium en modifiant uniquement quelques masques métalliques en haut niveau du circuit, avec un cycle d'environ 8 semaines. L'entreprise a intégré dans son modèle économique le coût de trois mises à jour de silicium sur une période de quatre ans.

Cette réponse peut soulager une partie de l'anxiété, mais ne la supprime pas complètement.

La flexibilité des GPU réside dans le fait qu'une même carte peut exécuter aujourd'hui Llama, demain Claude, et après-demain un nouveau modèle encore non publié. Les puces de Taalas ne permettent pas cela. Si un client a besoin de plusieurs modèles simultanément (ce qui est extrêmement courant en production), il doit disposer d'une puce différente pour chaque modèle, ce qui augmente la complexité de la gestion des stocks et de l'exploitation.

HC2 est en cours de développement, avec pour objectif un modèle de l'ordre de 20 milliards de paramètres, utilisant une précision améliorée en 4-bit flottant. Taalas prévoyait initialement de prendre en charge des modèles de pointe d'ici la fin de l'année 2026.

L'acquisition d'AMD apporte une synergie entre la gamme de produits Instinct GPU et le système de rack Helios, permettant aux clients d'utiliser les GPU pour des charges de travail flexibles et variées, et les puces Taalas pour l'inférence à haut débit et stable d'un seul modèle.

La course aux armements des puces d'inférence

AMD acquiert Taalas, ce qui constitue la dernière acquisition dans la vague d'acquisitions de puces d'inférence des huit derniers mois, dans un contexte industriel.

En décembre 2025, Nvidia a acquis Groq pour 20 milliards de dollars, en obtenant l'architecture d'inférence à faible latence basée sur SRAM.

En mai 2026, Cerebras a effectué son IPO avec une capitalisation boursière d'environ 560 milliards de dollars, devenant la plus grande IPO technologique depuis Snowflake en 2020.

En juin, Etched a mis fin à plus de deux ans d'obscurité en annonçant que son premier processeur dédié aux Transformers avait été fabriqué sur le procédé N4P de TSMC, avec plus de 1 milliard de dollars de contrats clients en poche. Intel aurait signé une lettre d'intention d'acquisition avec SambaNova, tandis que Qualcomm est en négociation avec Tenstorrent.

Ces transactions pointent vers le même constat : le raisonnement devient le principal champ de bataille des dépenses en puissance de calcul pour l'IA.

Les prévisions industrielles prévoient que d'ici 2026, l'inférence représentera les deux tiers des dépenses en calcul AI, et d'ici 2030, les ASIC dédiés à l'inférence pourraient capturer 45 % du marché de l'inférence. Les GPU de Nvidia dominent toujours le segment de l'entraînement, mais leur architecture généraliste fait face à des défis croissants de la part de puces dédiées sur le segment de l'inférence.

Taalas se situe à l'extrémité la plus extrême de ce spectre : il renonce même à la généralité des « modèles de première catégorie » pour concevoir un processeur dédié à un seul modèle.

Groq utilise du SRAM pour contourner le mur de la mémoire, Cerebras utilise une surface de wafer pour forcer la voie, Etched est optimisé uniquement pour l'architecture Transformer, tandis que Taalas fait un pari plus audacieux : il mise sur le fait que les modèles d'IA vont progressivement se stabiliser, tout comme les protocoles de communication finissent par converger vers quelques standards. Lorsque les modèles ne seront plus remplacés chaque mois, fabriquer une puce dédiée pour chacun des quelques modèles les plus populaires deviendra économiquement rentable.

Le modèle va se « figer »

Vamsi Boppana, vice-président senior d'AMD, a déclaré dans un communiqué que l'objectif de l'acquisition est de fournir aux clients « la meilleure solution de calcul pour chaque charge de travail IA ». Cette phrase traduit une stratégie concurrentielle : les GPU assurent la flexibilité, les puces Taalas offrent une efficacité maximale, et les clients les combinent selon leurs besoins.

La validité de cette logique de combinaison dépend d'une hypothèse fondamentale : la fréquence de mise à jour des modèles d'IA ralentira-t-elle ?

Si les grands modèles continuent de recevoir des mises à jour architecturales tous les quelques mois, alors intégrer les poids directement dans la silicium revient à verser du béton sur du sable mouvant : la puce n’aura même pas encore été amortie que le modèle sera déjà obsolète. Mais si les capacités des modèles tendent vers une convergence et que les modèles de pointe servent de manière stable pendant un à deux ans, devenant la norme, alors les puces dédiées au style Taalas deviendront, comme les puces de baseband dans l’industrie des télécommunications, une option non plus expérimentale mais tout à fait naturelle.

En revenant sur les 12 derniers mois, le rythme des mises à jour des modèles a effectivement subi des changements subtils. Les intervalles entre les versions Llama 3.1, 3.2 et 4 s'allongent, tandis que les changements d'architecture entre GPT-4, GPT-4o et GPT-5 se réduisent. De plus en plus de nouveaux modèles sont développés en appliquant distillation, quantification et fine-tuning sur des architectures existantes ; l'itération des modèles de base ralentit.

Si cette tendance se poursuit, Taalas a raison.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.