SysadminNews

Nvidia lance en production Groq 3 LPX, sa puce d'inférence

Sur cette page
  1. Deux phases, une puce, et le décalage entre les deux
  2. Ce que Nvidia a publié
  3. Le par mégawatt est le chiffre qui compte désormais
  4. La moitié réseau de l'annonce
  5. Que faire de tout cela
  6. Sources et pour aller plus loin

Nvidia a annoncé le lundi 24 août 2026 que Groq 3 LPX entrait en production complète, premier produit livré issu de son rachat des actifs de Groq pour vingt milliards de dollars en décembre dernier. Présenté à Hot Chips 2026, LPX est un accélérateur de décodage dédié plutôt qu'un GPU généraliste, conçu conjointement avec la baie Vera Rubin NVL72 et vendu à côté d'elle plutôt qu'à sa place. Nvidia annonce 3 400 jetons de sortie par seconde sur un contexte de cent mille jetons, quatre fois la plateforme alternative la plus proche, et jusqu'à trente cinq fois le débit d'inférence par mégawatt de Blackwell NVL72 sur des modèles à mille milliards de paramètres.

The short answer

Nvidia a annoncé le 24 août 2026 à Hot Chips que Groq 3 LPX entrait en production complète. C'est un accélérateur de décodage dédié, conçu conjointement avec la baie Vera Rubin NVL72, et le premier produit livré issu du rachat des actifs de Groq par Nvidia pour environ vingt milliards de dollars en décembre 2025. Nvidia annonce 3 400 jetons de sortie par seconde sur un contexte de cent mille jetons, quatre fois la plateforme alternative la plus proche, et jusqu'à 35 fois le débit d'inférence par mégawatt de Blackwell NVL72 sur des modèles à mille milliards de paramètres. Nebius est le premier adoptant cité.

3 400 jetons/sen sortie sur un contexte de 100 000 jetons
256 par baieaccélérateurs, liens directs de puce à puce
20 Md$le rachat de Groq dont sort ce produit
Carte réponse résumant l'annonce Nvidia Groq 3 LPX du 24 août 2026 : accélérateur de décodage dédié à l'inférence en production complète, 256 accélérateurs par baie reliés en direct de puce à puce, 3 400 jetons de sortie par seconde sur un contexte de 100 000 jetons, et jusqu'à 35 fois le débit d'inférence par mégawatt de Blackwell NVL72.
Ce qu'est Groq 3 LPX, et les chiffres publiés par Nvidia. PNG

Nvidia a dépensé vingt milliards de dollars sur Groq en décembre, et la question évidente depuis lors était de savoir ce qu'elle avait acheté au juste. Cette semaine, nous avons la réponse : un étage de décodage, livré en volume, installé à côté des GPU plutôt qu'à leur place.

Deux phases, une puce, et le décalage entre les deux

Servir un grand modèle de langage n'est pas une charge unique. C'en est deux, et elles attendent des choses opposées du matériel.

Le préremplissage est la phase qui lit votre invite. Elle est fortement parallèle et limitée par le calcul, exactement la forme pour laquelle un GPU a été bâti. Le décodage est la phase qui produit la réponse, un jeton à la fois, chaque jeton dépendant du précédent. Elle est sérielle par nature et passe l'essentiel de son temps à déplacer des poids et de l'état d'attention en cache à travers la mémoire plutôt qu'à calculer. Sur un GPU, le décodage laisse une énorme quantité de calcul inutilisée pendant que le système mémoire fait tout le travail.

Ce décalage constitue l'intégralité du dossier commercial d'une pièce de décodage séparée, et explique que l'industrie désagrège régulièrement l'inférence au lieu d'acheter davantage de la même chose. Nous avons vu la même logique à l'œuvre chez AMD et Cerebras séparant préremplissage et décodage sur des silicium différents, et chez Cerebras plaçant trois galettes dans une seule baie.

L'architecture d'origine de Groq attaquait le décodage en gardant les poids en SRAM sur la puce au lieu de les faire transiter depuis une mémoire externe, échangeant de la capacité contre de la bande passante et de la prévisibilité. C'est cette propriété que Nvidia a acquise, et Groq 3 LPX en est la version produit, enveloppée dans l'ingénierie à l'échelle de la baie de Nvidia.

Ce que Nvidia a publié

Le chiffre de débit mis en avant est de 3 400 jetons de sortie par seconde sur un contexte de cent mille jetons, mesuré sur Gemma 4 31B, ce que Nvidia présente comme quatre fois la plateforme alternative la plus proche. La partie contexte long compte davantage que le débit brut. Les invites courtes n'ont jamais été le problème ; le coût et la latence du service d'agents portant de grands contextes de travail, si.

Physiquement, une baie LPX contient 256 accélérateurs reliés par des liens directs de puce à puce plutôt que par un tissu commuté. Elle est conçue conjointement avec Vera Rubin NVL72 et vendue à côté. Le cadrage est hétérogène et non substitutif de bout en bout : les GPU gardent le préremplissage et l'entraînement, LPX prend le décodage.

La revendication d'efficacité est celle qui sera la plus citée et qui mérite le plus de prudence. Nvidia annonce jusqu'à 35 fois le débit d'inférence par mégawatt de Blackwell NVL72 sur des modèles à mille milliards de paramètres. C'est un spécialiste qui bat un généraliste sur la tâche que ce dernier aime le moins, soit à peu près ce qu'on attend d'un spécialiste. Ce n'est pas la promesse que tout tournera trente cinq fois mieux.

Carte de comparaison montrant en quoi le préremplissage et le décodage diffèrent comme charges de travail : le préremplissage est parallèle, limité par le calcul et convient à un GPU, tandis que le décodage est sériel, limité par la bande passante mémoire et convient à un accélérateur dédié, avec les chiffres de Groq 3 LPX, 3 400 jetons de sortie par seconde en contexte de 100 000 jetons et 256 accélérateurs par baie, face à Vera Rubin NVL72 qui prend le préremplissage et l'entraînement.
Pourquoi un étage de décodage séparé existe. PNG

Le par mégawatt est le chiffre qui compte désormais

Si le chiffre d'efficacité ouvre l'annonce plutôt que celui du débit, ce n'est pas un hasard.

La puissance électrique, et non le silicium, est la contrainte qui borne les nouvelles capacités d'IA. Les files d'attente de raccordement au réseau sont le poste le plus long de la plupart des projets, Microsoft a décrit l'écart entre les puces qu'elle possède et l'électricité pour les faire tourner, et les exploitants européens installent leurs sites à 175 kilomètres des pôles qu'ils préféreraient parce que c'est là qu'est le courant. Dans ce contexte, une pièce qui délivre plus de jetons par watt n'est pas une coquetterie d'efficacité. C'est de la capacité qui ne demande pas de poste électrique.

Cela explique aussi le calendrier. Nvidia prévient d'une hausse des prix des serveurs IA d'environ 15 pour cent début 2027 à cause du coût de la mémoire. Un accélérateur de décodage bâti autour de SRAM sur puce est, entre autres choses, une pièce dont la structure de coût dépend moins du marché HBM que celle d'un GPU.

La moitié réseau de l'annonce

LPX est arrivé avec des nouvelles de tissu attachées, ce qui cadre avec tout le reste de ce mois.

Nvidia a détaillé Spectrum-X Multiplane, qui monterait à 512 000 GPU sans exiger un troisième étage de réseau, délivrerait jusqu'à 1 600 gigabits par seconde et par GPU via les SuperNIC ConnectX-9, et offrirait environ 1,6 fois les performances réseau IA de l'Ethernet standard. Les chiffres de résilience sont les plus intéressants : environ 90 pour cent de la bande passante conservée quand un plan tombe, et une reprise après panne matérielle environ 11 fois plus rapide.

La structure par plans et l'insistance sur la survie à un plan perdu plutôt que sur la prévention de la panne parleront à quiconque a lu la publication MetaRoCE de Meta la même semaine. Deux organisations très différentes ont abouti à la même conclusion à un jour d'intervalle : à cette échelle, on conçoit pour un tissu dégradé, pas pour un tissu parfait.

Nvidia a également annoncé les processeurs Vera pour le volet orchestration et usage d'outils du travail agentique, et cité des adoptants : Nebius en premier sur LPX, CoreWeave sur Spectrum-X Multiplane.

Que faire de tout cela

Si vous achetez des baies, la question est de savoir si votre mélange d'inférence est assez chargé en décodage en contexte long pour justifier un second type de silicium dans la salle. Une baie hétérogène est plus difficile à ordonnancer et à exploiter qu'une baie homogène, et ce coût est réel.

Si vous louez de l'inférence, ce qui est le cas de la plupart des gens, ce qu'il faut surveiller est le prix affiché par million de jetons de sortie en contexte long. C'est le chiffre précis que ce matériel existe pour faire bouger. Les revendications d'efficacité des fournisseurs finissent toujours par se poser sur les grilles tarifaires, et une grille tarifaire est plus difficile à doter d'une base de comparaison favorable qu'un banc d'essai.

Sources et pour aller plus loin

Questions fréquentes

Qu'est ce qu'un LPX et pourquoi n'est ce pas simplement un GPU de plus ?

C'est un accélérateur de décodage, conçu pour la phase de génération jeton par jeton de l'inférence, et non pour l'entraînement ni pour la phase de préremplissage qui avale l'invite. Ces deux phases ont des formes réellement différentes. Le préremplissage est limité par le calcul et parallèle, donc un GPU lui convient. Le décodage produit un jeton à la fois et passe l'essentiel de son temps à attendre la mémoire : le goulet est la bande passante et la latence plutôt que l'arithmétique brute. L'intuition d'origine de Groq, que Nvidia a rachetée, consistait à construire pour cette seconde forme spécifiquement. LPX est vendu comme compagnon de Vera Rubin NVL72, pas comme remplaçant : la baie a toujours besoin de GPU, elle cesse simplement de leur demander un travail pour lequel ils n'étaient pas taillés.

D'où vient le nom Groq dans un produit Nvidia ?

Nvidia a racheté les actifs de Groq pour environ vingt milliards de dollars en décembre 2025. Groq était une jeune pousse de puces d'inférence bâtie autour d'une architecture déterministe qui gardait les poids du modèle en SRAM sur la puce plutôt que de les faire transiter depuis une mémoire externe, ce qui lui permettait d'afficher les chiffres de faible latence qui ont fait sa réputation. Nvidia a conservé le nom sur la gamme. Groq 3 LPX, annoncé à Hot Chips 2026 et désormais en production complète, est le premier résultat livré de ce rachat, un délai court pour une acquisition de silicium qui laisse penser que la conception était déjà bien avancée à la signature.

Quel crédit accorder à la revendication des 35 fois par mégawatt ?

Traitez la comme un chiffre de fournisseur assorti d'une comparaison précise et favorable. Il s'agit d'un débit par mégawatt, sur des modèles à mille milliards de paramètres, face à Blackwell NVL72, autrement dit d'une pièce spécialisée dans le décodage comparée à un GPU généraliste d'entraînement et d'inférence en train de faire du décodage. Cette comparaison flatte le spécialiste par construction. Le chiffre reste significatif, car la puissance électrique est la vraie contrainte de la plupart des nouveaux centres de données, et un étage de décodage qui coûte une fraction des watts vaut de l'argent réel. Mais il décrit une forme de charge sur une comparaison, pas une amélioration de trente cinq fois sur tout ce que vous exécutez.

À quoi ressemble concrètement la baie ?

Nvidia décrit 256 accélérateurs par baie LPX, reliés par des liens directs de puce à puce plutôt que par un tissu commuté, et conçus conjointement avec la plateforme Vera Rubin NVL72 qui les accompagne. Aux côtés de LPX, Nvidia a détaillé Spectrum-X Multiplane, qui monterait à 512 000 GPU sans nécessiter un troisième étage de réseau, offrirait jusqu'à 1 600 gigabits par seconde et par GPU via les SuperNIC ConnectX-9, conserverait environ 90 pour cent de la bande passante en cas de perte d'un plan, et se remettrait d'une panne matérielle environ 11 fois plus vite. Nebius est cité comme premier adoptant de LPX et CoreWeave comme déployeur de Spectrum-X Multiplane.

Cela change t il quelque chose si je loue de l'inférence au lieu d'acheter des baies ?

Probablement oui, sur le prix et la latence, mais pas immédiatement et pas uniformément. Un étage de décodage dédié est un argument sur le coût par jeton en contexte long, c'est à dire précisément là où les factures d'inférence font mal. Si les revendications par mégawatt tiennent ne serait ce que partiellement, cette pression apparaîtra sous forme de service en contexte long moins cher chez les fournisseurs qui déploieront les premiers. Le geste pratique n'est pas de changer quoi que ce soit aujourd'hui, c'est de surveiller le prix affiché par million de jetons en contexte long spécifiquement, car c'est le chiffre que ce matériel est conçu pour faire bouger et celui qui montrera s'il y est parvenu.