SysadminNews

AMD et Cerebras separent l'inference sur deux puces

Sur cette page
  1. Ce que l'inference desagregee signifie vraiment
  2. Lisez la note de bas de page sur le cinq fois
  3. Quand vous pourrez l'utiliser
  4. Pourquoi cela depasse ce seul accord
  5. Sources et pour aller plus loin

AMD et Cerebras ont annonce un partenariat le jeudi vingt trois juillet pour faire tourner l'inference des grands modeles sur deux types de puces a la fois, une conception que l'industrie appelle inference desagregee. Les racks AMD Helios, batis sur des GPU Instinct et des CPU EPYC, assurent le travail lourd de debit, tandis que Cerebras et son Wafer-Scale Engine assurent la generation rapide de jetons que l'utilisateur ressent comme de la latence. Les deux societes affirment que l'association peut atteindre jusqu'a cinq fois les jetons par seconde et par watt d'une configuration comparable. Ce chiffre merite une lecture attentive, car il est modelise et non mesure, et la reference compte. Voici ce qu'est l'inference desagregee et a quel point l'affirmation est honnete.

The short answer

Le jeudi vingt trois juillet, AMD et Cerebras ont annonce un partenariat d'inference desagregee. Les racks AMD Helios gerent la phase de fort debit du service d'un modele, tandis que le Wafer-Scale Engine de Cerebras gere la generation rapide de jetons, la partie que l'utilisateur ressent comme de la latence. Les societes revendiquent jusqu'a cinq fois les jetons par seconde et par watt d'une configuration comparable, mais ce chiffre est modelise, pas mesure, et la reference est un systeme Wafer-Scale Engine seul. La solution conjointe arrive d'abord sur Cerebras Cloud au second semestre 2026. Le concept, separer l'inference sur des puces specialisees, compte plus que le chiffre du lancement.

2 pucesHelios pour le debit, Wafer-Scale Engine pour la vitesse
jusqu'a 5xjetons par seconde et par watt, chiffre modelise
S2 2026disponible d'abord via Cerebras Cloud
Carte reponse : le vingt trois juillet, AMD et Cerebras ont annonce un partenariat d'inference desagregee, associant les racks AMD Helios pour le debit au Wafer-Scale Engine de Cerebras pour la generation rapide de jetons, avec jusqu'a cinq fois les jetons par seconde et par watt, un chiffre modelise, disponible d'abord sur Cerebras Cloud au second semestre 2026.
Deux puces differentes, une seule chaine d'inference. Source : annonce conjointe AMD et Cerebras, vingt trois juillet. PNG

La plupart de l'inference d'IA tourne aujourd'hui sur un seul type de puce qui fait tout le travail, et cela commence a paraitre du gaspillage. Le jeudi vingt trois juillet, AMD et Cerebras ont annonce un partenariat bati sur l'idee inverse, separer le travail de service d'un modele sur deux puces, chacune choisie pour la partie qu'elle fait le mieux. AMD apporte Helios, son systeme a l'echelle du rack fait de GPU Instinct et de CPU EPYC, pour le debit brut. Cerebras apporte le Wafer-Scale Engine, une puce unique de la taille d'une assiette, pour la generation rapide de jetons. L'affirmation phare est jusqu'a cinq fois les jetons par seconde et par watt d'une configuration comparable. C'est une vraie idee a comprendre, et un chiffre a lire de pres.

Ce que l'inference desagregee signifie vraiment

Servir un grand modele de langage n'est pas une tache, c'en est deux. Quand vous envoyez une requete, le modele la lit d'abord et construit son etat interne, une phase lourde en calcul appelee prefill. Ensuite il ecrit la reponse un jeton a la fois, et cette phase s'appuie bien plus sur la vitesse memoire et la latence que sur le calcul brut. Une seule puce doit faire un compromis entre ces deux taches tres differentes.

L'inference desagregee cesse de faire ce compromis. Elle aiguille le prefill vers un materiel bon en debit et la generation de jetons vers un materiel bon en faible latence, puis les relie en une seule chaine. Dans ce partenariat, AMD Helios gere le cote lourd en debit, et le Wafer-Scale Engine de Cerebras, qui garde un modele entier resident en memoire rapide sur puce, gere la generation jeton par jeton que l'utilisateur percoit comme de la reactivite. Aucune phase n'a besoin de ralentir pour l'autre.

Lisez la note de bas de page sur le cinq fois

Le chiffre de cinq fois les jetons par watt est le genre de nombre qui merite un second regard, et les societes sont assez transparentes a son sujet. Il provient d'une modelisation d'AMD Performance Labs et de Cerebras en juillet 2026, pas d'un test independant. Elles ont mesure les jetons par seconde et par kilowatt a un point d'interactivite comparable sur le modele Kimi 2.6 a mille milliards de parametres.

La reference est le detail qui change la lecture. La comparaison oppose un systeme Helios plus Wafer-Scale Engine a un systeme Wafer-Scale Engine seul. Autrement dit, l'essentiel du gain vient de l'ajout du debit AMD au cote Cerebras, ce qui est exactement ce que vend le partenariat. Cela ne rend pas l'affirmation malhonnete, cela en fait une projection sous hypotheses annoncees. La bonne facon de la retenir est jusqu'a cinq fois, modelise, sur un modele, contre une reference. Quand le service sortira, les chiffres a croire seront ceux mesures sous trafic reel.

Carte reponse : les deux phases de l'inference, le prefill lit la requete et est lourd en calcul donc il va vers le debit d'AMD Helios, le decode ecrit les jetons un a un et est limite par la latence donc il va vers le Wafer-Scale Engine de Cerebras, relies en une seule chaine desagregee.
Le prefill est lourd en calcul, la generation de jetons est limitee par la latence. La desagregation envoie chaque phase a la puce qui lui convient. PNG

Quand vous pourrez l'utiliser

Ce n'est pas du materiel que vous acheterez et installerez en premier. Cerebras prevoit de deployer AMD Helios dans ses propres centres de donnees, et la solution combinee arrivera d'abord via Cerebras Cloud au second semestre 2026. Commencer par un service heberge est en fait pratique pour qui l'evalue, car vous pouvez louer la chaine combinee et la mesurer sur votre propre charge plutot que d'integrer vous meme deux systemes tres differents.

Pourquoi cela depasse ce seul accord

Meme si vous ne touchez jamais cette association precise, le schema est l'essentiel. L'inference haut de gamme s'eloigne d'une seule puce qui fait tout pour aller vers des chaines qui aiguillent chaque phase vers du silicium specialise, car c'est ainsi que l'on reduit le cout par jeton et que l'on maitrise la latence a grande echelle. L'accord renforce aussi AMD comme seconde pile serieuse en calcul d'IA, et chaque alternative credible a la couche plateforme tend a faire baisser les prix de service avec le temps. Gardez un oeil sur les tests independants quand Cerebras Cloud activera cela, et traitez le chiffre du lancement comme une affirmation a verifier plutot qu'un resultat a citer.

Sources et pour aller plus loin

Questions fréquentes

Qu'ont annonce AMD et Cerebras ?

Le jeudi vingt trois juillet, AMD et Cerebras ont annonce un partenariat technique pour livrer une solution d'inference desagregee. Elle combine les systemes AMD Helios a l'echelle du rack, batis sur des GPU Instinct et des CPU EPYC, avec le Wafer-Scale Engine de Cerebras. Les deux fonctionnent comme un seul flux, le cote AMD fournissant un fort debit et le cote Cerebras une generation de jetons tres rapide. Les societes affirment que le systeme combine peut atteindre jusqu'a cinq fois les jetons par seconde et par watt d'une configuration comparable. La solution conjointe sera disponible d'abord via Cerebras Cloud au second semestre 2026.

Qu'est ce que l'inference desagregee ?

Servir un grand modele de langage comporte deux phases tres differentes. D'abord le modele lit votre requete et construit son etat interne, une etape lourde en calcul souvent appelee prefill. Ensuite il ecrit la reponse un jeton a la fois, une etape limitee davantage par la vitesse memoire et la latence que par le calcul brut. L'inference desagregee separe ces deux phases sur du materiel distinct, chacun choisi pour la phase qu'il fait le mieux, au lieu de forcer une seule puce a tout faire. AMD Helios gere le travail lourd de debit, et le Wafer-Scale Engine de Cerebras gere la generation rapide de jetons, sans que l'une freine l'autre.

L'affirmation de cinq fois les jetons par watt est elle fiable ?

Traitez la comme une projection de fournisseur, pas comme un resultat mesure. AMD et Cerebras indiquent que le chiffre vient d'une modelisation de leurs propres equipes de performance en juillet 2026, mesurant les jetons par seconde et par kilowatt a un point d'interactivite comparable sur le modele Kimi 2.6 a mille milliards de parametres. La reference est le detail important. La comparaison oppose une configuration Helios plus Wafer-Scale Engine a une configuration Wafer-Scale Engine seul, donc le gain reflete surtout l'ajout du debit AMD au cote Cerebras. C'est une affirmation d'ingenierie raisonnable, mais elle est modelisee, et la lecture honnete est jusqu'a cinq fois sous des hypotheses precises, pas un chiffre garanti en conditions reelles.

Quand et ou sera ce disponible ?

Cerebras prevoit de deployer AMD Helios dans ses propres centres de donnees, et la solution desagregee conjointe sera disponible d'abord via Cerebras Cloud au second semestre 2026. La premiere maniere de l'utiliser sera donc un service heberge plutot que du materiel a installer soi meme. Pour les equipes qui evaluent leurs options d'inference, cela abaisse la barriere a l'essai, puisque vous pouvez louer la chaine combinee plutot qu'acheter et integrer deux systemes tres differents sur votre propre plancher.

Pourquoi cela compte t il pour les equipes infrastructure ?

Cela signale la direction de l'inference haut de gamme, en s'eloignant d'une seule puce qui fait tout vers des chaines qui aiguillent chaque phase vers du materiel specialise. Meme si vous ne deployez jamais cette association precise, le schema merite d'etre compris, car la desagregation devient une facon standard de reduire le cout par jeton et d'ameliorer la latence a grande echelle. Cela renforce aussi la position d'AMD comme seconde pile credible en calcul d'IA, et plus de concurrence entre plateformes d'inference tend a faire baisser les prix de service avec le temps. Suivez les vrais tests quand le service sortira, pas seulement le chiffre modelise du lancement.

Advertisement