SysadminNews

AMD rachete Taalas, qui grave les poids dans le silicium

Sur cette page
  1. Ce que Taalas a construit, et ce qu'elle a abandonne
  2. Pourquoi AMD en veut
  3. Ce que cela change pour un achat cette annee
  4. Sources et pour aller plus loin

AMD a annonce le 6 aout l'acquisition de Taalas, une jeune pousse de Toronto qui fabrique ce qu'elle appelle des circuits integres specifiques a un modele. L'idee est brutale : cesser de faire transiter les poids depuis la memoire a haute bande passante a chaque jeton, et les graver dans la puce. Taalas a mesure sa premiere puce de test, la HC1 gravee en 6 nanometres chez TSMC, servant Llama 3.1 8B a 16 960 jetons par seconde en fevrier dernier. Le cout evident, c'est la souplesse : une puce qui contient un modele est une puce qui ne fait tourner que ce modele. Nous avons regarde ce qu'AMD achete vraiment.

The short answer

AMD a annonce le 6 aout l'acquisition de Taalas, une jeune pousse de Toronto fondee en 2023. Taalas fabrique des circuits integres specifiques a un modele : les poids sont graves dans la puce plutot que conserves en memoire a haute bande passante, ce qui supprime le trafic memoire qui plafonne habituellement la generation de jetons. Sa puce de test HC1, gravee en 6 nanometres chez TSMC, a atteint 16 960 jetons par seconde sur Llama 3.1 8B. Le revers, c'est que la puce est liee a un seul modele et que tout changement depassant un adaptateur LoRA impose une nouvelle serie. AMD compte l'associer aux GPU Instinct et a la plateforme Helios. Termes non divulgues.

16 960jetons par seconde servis par la puce de test HC1 sur Llama 3.1 8B
219 M$montant approximatif leve par Taalas avant le rachat
T4 2026cloture attendue de l'operation, sous reserve d'approbation
Carte reponse : AMD a annonce le 6 aout 2026 l'acquisition de Taalas, une jeune pousse de Toronto fondee en 2023 dont les circuits integres specifiques a un modele gravent les poids directement dans le silicium au lieu de les stocker en memoire a haute bande passante, sa puce de test HC1 gravee en 6 nanometres chez TSMC servant Llama 3.1 8B a 16 960 jetons par seconde.
L'operation en une carte. Source : l'annonce AMD et les mesures HC1 publiees par Taalas, aout 2026. PNG

Il y a un fait genant qui ne disparait jamais quand on fait tourner un modele de langage : produire un jeton oblige a lire tous les poids du modele. Pas une partie, tous. C'est pour cela qu'une machine d'inference est surtout de la bande passante memoire deguisee en calcul, que l'approvisionnement en HBM gouverne le prix des accelerateurs, et que le debit de decodage suit la largeur du tuyau plutot que le nombre d'unites arithmetiques derriere. Toute la proposition de Taalas consiste a contourner le probleme en refusant de stocker les poids quelque part ou il faut aller les lire.

Ce que Taalas a construit, et ce qu'elle a abandonne

Taalas fabrique ce qu'elle appelle des circuits integres specifiques a un modele. Au lieu de charger les parametres en memoire a haute bande passante et de les transferer vers les unites de calcul, les poids sont deposes dans la puce pendant la fabrication. Le circuit est le modele. Il n'y a pas de lecture de poids a optimiser puisqu'il n'y a pas de lecture de poids.

Les chiffres qui ont retenu l'attention viennent de la HC1, une puce de test gravee en 6 nanometres chez TSMC. Sur Llama 3.1 8B, elle a atteint 16 960 jetons par seconde, ce que Taalas situait a environ 48 fois les GPU NVIDIA compares et 8,5 fois les accelerateurs Cerebras lors de sa publication en fevrier 2026. Les comparaisons de constructeur meritent la mefiance habituelle quant a ce qui a ete compare et sous quelles hypotheses de traitement par lots, mais le mecanisme derriere l'ecart n'est pas conteste. Supprimez le mur memoire et le decodage accelere massivement.

Le prix, c'est la souplesse, et il est preleve integralement. La puce fait tourner le modele pour lequel elle a ete construite. Taalas a dit clairement que tout changement plus important qu'un adaptateur LoRA impose une nouvelle serie de silicium. L'attenuation tient au fait que passer a un nouveau modele ne touche que deux couches metalliques au lieu d'exiger un redessin complet, ce qui transforme un lancement en fonderie en revision de masque. C'est une economie reelle en cout et en delai. Ce n'est pas la meme chose que reprogrammer des poids, et personne ne devrait le lire ainsi.

Carte checklist qui oppose les caracteristiques de l'approche Taalas : les poids graves dans la puce suppriment le goulot de bande passante memoire, la HC1 a atteint 16 960 jetons par seconde sur Llama 3.1 8B, environ 50 puces HC2 serviraient un modele a mille milliards de parametres par parallelisme de pipeline, mais la puce est figee sur un seul modele et tout changement depassant un adaptateur LoRA impose une nouvelle serie de silicium.
Trois gains, et le cout permanent qui les accompagne. PNG

Pourquoi AMD en veut

La bonne facon de lire l'operation passe par les deux phases de l'inference. Le prefill, ou le modele ingere une invite, est limite par le calcul et parfaitement parallelisable, ce qui correspond exactement a un GPU. Le decode, ou les jetons sortent un a un, est limite par la memoire, et un GPU y passe l'essentiel de son temps a attendre. Acheter une puce excellente en decodage et inutile pour le reste n'a de sens que si vous possedez deja ce qui traite le reste.

C'est le cas d'AMD. Le plan annonce consiste a integrer la technologie Taalas a la feuille de route d'accelerateurs aux cotes des GPU Instinct, des processeurs EPYC, de la plateforme Helios et de ROCm, avec un traitement de l'invite sur GPU alimentant une generation de jetons sur Taalas comme appariement naturel. Reste a savoir si cette division du travail survit a l'ingenierie, mais l'argument d'architecture se tient : placer le silicium rigide sur la phase ou la souplesse vaut le moins.

Le cadrage concurrentiel est difficile a ignorer. NVIDIA a rachete Groq pour 20 milliards de dollars environ sept mois plus tot. Deux des trois grands fournisseurs d'accelerateurs ont donc decide que le prochain palier de performance en inference vient de l'abandon de la programmabilite, ce qui constitue un renversement frappant pour une industrie qui a passe quinze ans a soutenir l'inverse.

Ce que cela change pour un achat cette annee

Rien, dans l'immediat, et autant le dire franchement. AMD a annonce l'accord a la cloture des marches le 6 aout et l'attend conclu au quatrieme trimestre, sous reserve d'approbation reglementaire. La deuxieme generation HC2 de Taalas, qui prend en charge les modeles jusqu'a 20 milliards de parametres et se combine par parallelisme de pipeline, environ 50 puces pour un modele a mille milliards de parametres, etait attendue cet ete en tant que produit Taalas. Une piece AMD construite la-dessus n'a aucune date annoncee.

La question a emporter ne concerne pas AMD. Elle consiste a savoir si un modele reste immobile assez longtemps pour meriter une puce. Le silicium grave est un pari sur le fait que certains modeles deviennent une infrastructure, tournent a des volumes qui se comptent en milliers de milliards de jetons et cessent de changer, comme les codecs video ont fini par se figer et migrer vers des blocs a fonction fixe. Cela s'est deja produit dans cette industrie, plus d'une fois. Cela a aussi echoue a se produire, de facon repetee, selon des calendriers dont tout le monde etait certain. Si vous exploitez de la capacite d'inference, la chose a suivre n'est pas le chiffre de jetons par seconde. C'est de savoir si votre propre charge a cesse de bouger.

Sources et pour aller plus loin

Questions fréquentes

Que signifie concretement graver les poids dans le silicium ?

Cela signifie que les parametres cessent d'etre une donnee que la puce va chercher pour devenir une partie du circuit dont la puce est faite. Un accelerateur classique conserve les poids en memoire a haute bande passante et les transfere vers les unites de calcul pour chaque jeton produit, ce qui explique pourquoi la capacite et la bande passante HBM dominent a la fois le cout et le plafond de performance du materiel d'inference. Taalas fabrique ce qu'elle appelle des circuits integres specifiques a un modele, ou les poids sont deposes dans la puce elle-meme, si bien que le trafic memoire qui fixe habituellement la limite disparait en grande partie. C'est de la que viennent les chiffres annonces : la puce de test HC1, gravee en 6 nanometres chez TSMC, a servi Llama 3.1 8B a 16 960 jetons par seconde, un resultat que Taalas situait a environ 48 fois les GPU NVIDIA compares et 8,5 fois les accelerateurs Cerebras lors de sa publication en fevrier 2026. Le compromis n'a rien de subtil : un circuit construit autour d'un jeu de poids fait tourner un jeu de poids.

La puce est donc figee sur un seul modele pour toujours ?

En pratique oui pour l'exemplaire installe dans votre baie, meme si l'histoire cote fabrication est moins brutale qu'il n'y parait. Taalas a indique que tout changement plus important qu'un adaptateur LoRA impose une nouvelle serie de puces, donc vous ne pouvez pas y glisser un reglage fin, encore moins passer d'une famille de modeles a une autre. Ce qui adoucit le tableau, c'est que passer a un nouveau modele ne modifie que deux couches metalliques au lieu de redessiner la puce entiere, ce qui separe une revision de masque d'un nouveau lancement en fonderie, en cout comme en delai. Reste un probleme de planification qu'aucun acheteur de GPU ne connait : vous engagez du capital sur un modele precis pour toute la duree de vie du materiel, dans un domaine ou le modele que vous choisiriez aujourd'hui n'est presque jamais celui que vous choisiriez dans neuf mois. Cela se defend pour des charges stabilisees et tournant a volume enorme, et beaucoup moins pour tout ce qui bouge encore.

Comment cela cohabite-t-il avec les GPU Instinct plutot que de les remplacer ?

AMD a ete assez precis, et la repartition qu'elle decrit suit la forme reelle de la charge. L'inference comporte deux phases qui sollicitent le materiel differemment : le prefill, ou le modele lit l'invite, tres parallele et gourmand en calcul, et le decode, ou il produit les jetons un a un, ou le goulot est la bande passante memoire plutot que l'arithmetique. Les GPU excellent sur la premiere et gaspillent structurellement sur la seconde, puisqu'une etape de decode lit l'integralite des poids pour produire un seul jeton. Le plan annonce par AMD consiste a integrer la technologie Taalas a sa feuille de route d'accelerateurs aux cotes des GPU Instinct, des processeurs EPYC, de la plateforme Helios a l'echelle de la baie et de ROCm, avec l'appariement qui s'impose : traitement de l'invite sur GPU alimentant une generation de jetons sur Taalas. Si cela fonctionne, la partie figee prend en charge la phase ou la souplesse compte le moins et la bande passante le plus, ce qui est la meilleure version de l'argument.

Qu'est-ce que cela dit du marche des puces IA ?

Cela confirme que l'industrie traite desormais l'inference comme un probleme materiel distinct plutot que comme un entrainement en plus petit. La sequence rend la chose lisible : NVIDIA a rachete Groq pour 20 milliards de dollars environ sept mois avant cette operation, et AMD vient d'acheter une entreprise dont toute la these est que la programmabilite generale est precisement ce qu'il faut abandonner. Taalas a ete fondee en 2023 et avait leve environ 219 millions de dollars, il s'agit donc d'un achat de technologie et non de parts de marche, et AMD parle d'une acquisition complete et non d'un recrutement deguise. Les termes financiers n'ont pas ete divulgues. Ce qu'il faut surveiller n'est pas qui rachete qui, mais si du silicium d'inference a fonction figee survit au rythme de sortie des modeles, qui n'a jamais ralenti. Le pari ne paie que si certains modeles deviennent une infrastructure, assez stable pour justifier du materiel construit autour d'eux.

Quand tout cela arrive-t-il reellement ?

Pas assez tot pour peser sur un achat que vous faites cette annee. AMD a annonce l'accord a la cloture des marches le 6 aout 2026, et l'operation doit se conclure au quatrieme trimestre sous reserve d'approbation reglementaire, ce qui veut dire qu'AMD ne possede pas encore la technologie. La deuxieme generation de Taalas, la HC2, etait attendue cet ete avec une prise en charge des modeles jusqu'a 20 milliards de parametres, et l'entreprise decrit l'execution de modeles plus grands en combinant des accelerateurs par parallelisme de pipeline, de l'ordre de 50 puces HC2 pour servir un modele a mille milliards de parametres. Un produit AMD qui integrerait tout cela a la gamme Instinct ou Helios reste un element de feuille de route sans date annoncee. Le conseil pratique pour qui dimensionne une grappe d'inference en 2026 est de planifier avec les GPU qui existent.