SysadminNews

IBM met 240 M$ dans un cluster d'inférence Together AI

Sur cette page
  1. L'accord
  2. Pourquoi servir plutôt qu'entraîner
  3. Le choix réseau
  4. Ce qui va y tourner
  5. La position réelle d'IBM Cloud
  6. Sources et pour aller plus loin

IBM et Together AI ont signé le 11 août 2026 un accord pluriannuel de 240 millions de dollars pour monter un grand cluster d'inférence sur IBM Cloud. Le matériel, ce sont des systèmes Nvidia HGX B300, la génération Blackwell, reliés par de l'Ethernet Spectrum-X, et la presse évoque une commande d'environ 2 000 unités B300 pour une disponibilité attendue au premier trimestre 2027. Ce qui mérite lecture n'est pas le montant. C'est que tout ce cluster vise à servir des modèles à poids ouverts plutôt qu'à en entraîner un de frontière, depuis un nuage qui n'appartient pas aux trois grands.

The short answer

IBM et Together AI ont signé un accord pluriannuel de 240 millions de dollars pour bâtir un grand cluster d'inférence sur IBM Cloud. Il repose sur des systèmes Nvidia HGX B300 de génération Blackwell, reliés en Ethernet Spectrum-X, avec environ 2 000 unités B300 rapportées et une disponibilité attendue au premier trimestre 2027. Le cluster vise le service de modèles à poids ouverts, dont DeepSeek, MiniMax et Kimi, pour des entreprises qui cherchent à faire baisser le coût de leur inférence.

240 M$accord pluriannuel, signé le 11 août 2026
~2 000unités Nvidia B300 rapportées pour le cluster
T1 2027disponibilité attendue
Carte réponse décrivant l'accord entre IBM et Together AI signé le 11 août 2026, un contrat pluriannuel de 240 millions de dollars pour un cluster d'inférence sur IBM Cloud bâti sur environ 2000 systèmes Nvidia HGX B300 Blackwell reliés en Ethernet Spectrum-X, destiné à servir des modèles à poids ouverts et attendu au premier trimestre 2027.
L'accord en une carte. Sources : Reuters et The Next Web, 11 et 12 août 2026. PNG

La plupart des annonces IA à neuf chiffres de cette année portaient sur de la capacité d'entraînement. Celle-ci non, et c'est tout l'intérêt.

L'accord

IBM et Together AI ont signé un accord pluriannuel de 240 millions de dollars, annoncé le 11 août 2026. IBM construit le cluster sur IBM Cloud. Together AI y fait tourner son inférence.

Le calcul repose sur des systèmes Nvidia HGX B300, porteurs d'accélérateurs de génération Blackwell. La presse évoque une commande d'environ 2 000 unités B300. La trame réseau est de l'Ethernet Nvidia Spectrum-X. La disponibilité est attendue au premier trimestre 2027.

Pourquoi servir plutôt qu'entraîner

L'entraînement est un événement d'investissement. On achète un cluster, on en consomme des mois, on obtient un modèle au bout, puis les machines cherchent le travail suivant.

L'inférence est différente d'une façon qui parle à quiconque budgète de l'infrastructure. Elle revient. Chaque requête de chaque utilisateur coûte du calcul, indéfiniment, tant que le produit a des clients. Together AI traiterait de l'ordre de 400 000 milliards de jetons par mois, ce qui n'est pas une charge de recherche mais un service d'utilité publique.

Cette distinction explique la forme de l'achat. Nvidia positionne explicitement Blackwell pour l'inférence, et de l'argent qui se déplace vers la capacité de service signale une demande venue d'applications qui ont de vrais utilisateurs, plutôt que de laboratoires en course les uns contre les autres. Le même courant traverse les travaux d'inférence désagrégée chez AMD et Cerebras et les montages de financement à un demi-billion de dollars assemblés autour de la construction d'infrastructures.

Le choix réseau

Spectrum-X est la pile Ethernet de Nvidia pour le trafic IA : son propre silicium de commutation, des points terminaux SuperNIC, et un contrôle de congestion réglé pour les motifs tous vers tous que produisent les opérations collectives.

Choisir de l'Ethernet plutôt que de l'InfiniBand pour un cluster d'inférence est un choix raisonnable qui mérite d'être compris plutôt que survolé. Le trafic d'inférence ne ressemble pas à celui d'un entraînement à grande échelle. La base de compétences d'exploitation en Ethernet est immense face à celle de l'InfiniBand. Et la supervision, le dépannage et l'automatisation qu'une équipe réseau possède déjà se transposent pour l'essentiel.

Figure en liste résumant le cluster d'inférence IBM et Together AI : accord pluriannuel de 240 millions de dollars, systèmes Nvidia HGX B300 Blackwell, environ 2000 unités rapportées, trame Ethernet Spectrum-X plutôt qu'InfiniBand, modèles à poids ouverts dont DeepSeek MiniMax et Kimi, IBM Cloud plutôt qu'un hyperscaler du trio de tête, et disponibilité au premier trimestre 2027.
De quoi le cluster est fait, et ce que chaque choix signale. PNG

Le réseau pèse modestement dans le coût d'un cluster IA et lourdement dans ce qui déraille lors de son déploiement. Un fournisseur qui retient la trame la mieux comprise pour une charge de service prend une petite décision sur la facture et une grande décision en salle d'exploitation.

Ce qui va y tourner

Des modèles à poids ouverts. La plateforme de Together AI sert entre autres DeepSeek, MiniMax et Kimi, et cette capacité vise explicitement cette catégorie.

L'argument commercial est simple. Les entreprises qui veulent que leur facture d'inférence cesse de grossir, ou une frontière plus nette autour des données sensibles, ou simplement ne pas lier leur feuille de route produit aux sorties de modèles d'un seul laboratoire, se déplacent vers le service de modèles ouverts. Deux mille systèmes Blackwell parient que cela continue jusqu'en 2027.

La position réelle d'IBM Cloud

IBM ne dépassera pas les trois premiers nuages en échelle et ne semble pas essayer. L'argument porte ici sur l'économie et la maîtrise des données : faire tourner des modèles ouverts moins cher, avec une réponse plus claire sur l'endroit où ils tournent.

La couverture cadre aussi l'affaire dans une préférence européenne pour des infrastructures non verrouillées sur un seul fournisseur américain, signal de marché réel même si le fait qu'IBM soit américaine complique le raisonnement.

Pour qui dimensionne de la capacité d'inférence pour l'an prochain, la conclusion utile est plus étroite et plus concrète. Le service devient un marché à plus de trois fournisseurs crédibles, et la pression sur les prix dans ce marché se lit directement dans ce que vous coûte un modèle en production.

Sources et pour aller plus loin

Questions fréquentes

Qu'a-t-on signé exactement ?

Un accord pluriannuel de 240 millions de dollars, annoncé le 11 août 2026, par lequel IBM construit pour Together AI un cluster d'inférence à grande échelle sur IBM Cloud. Le calcul repose sur des systèmes Nvidia HGX B300, qui embarquent les accélérateurs de génération Blackwell, et la trame réseau est de l'Ethernet Nvidia Spectrum-X. La presse évoque un volume d'environ 2 000 unités B300, pour une disponibilité attendue au premier trimestre 2027. Le montant n'est pas un vague engagement de partenariat, c'est un achat de capacité de service, ce qui explique un calendrier exprimé en trimestres plutôt qu'en adjectifs de communiqué.

Pourquoi le mot inférence est-il le plus intéressant de cet accord ?

Parce qu'il change ce pour quoi le matériel est optimisé et qui en paie la facture. L'entraînement est un événement d'investissement : on achète un cluster, on y passe des mois, on obtient un modèle. L'inférence est un coût d'exploitation qui revient à chaque fois qu'un utilisateur fait quoi que ce soit. Nvidia positionne explicitement Blackwell pour les charges d'inférence, et Together AI traiterait de l'ordre de 400 000 milliards de jetons par mois, ce qui est la forme d'une activité de service plutôt que de recherche. Quand de grosses sommes se déplacent vers le service plutôt que vers l'entraînement, c'est que la demande vient d'applications qui existent déjà et ont des utilisateurs.

Que fait l'Ethernet Spectrum-X ici, et pourquoi pas de l'InfiniBand ?

Spectrum-X est la pile Ethernet de Nvidia réglée pour les motifs de trafic de l'IA, associant son silicium de commutation, des points terminaux SuperNIC et un contrôle de congestion visant les communications tous vers tous que produisent les opérations collectives. La préférer à l'InfiniBand pour un cluster d'inférence se défend : le trafic d'inférence n'a pas les mêmes caractéristiques que celui d'un grand entraînement, les compétences d'exploitation Ethernet sont bien plus répandues dans le métier, et l'outillage est familier à des équipes réseau qui n'ont jamais fait tourner de gestionnaire de fabric. Le réseau représente une petite part du coût d'investissement d'un cluster IA et une part démesurée de ses problèmes de déploiement, donc ce choix compte plus que son prix ne le laisse croire.

Quels modèles vont y tourner ?

Des modèles à poids ouverts. La plateforme de Together AI sert notamment DeepSeek, MiniMax et Kimi, et ce cluster vise explicitement cette catégorie plutôt qu'un modèle de frontière propriétaire. C'est le cœur de l'argument commercial. Les entreprises qui cherchent à réduire leur facture d'inférence, à garder des données sensibles dans un périmètre plus net, ou à ne pas dépendre de la feuille de route d'un seul fournisseur de modèle, se déplacent régulièrement vers le service de modèles ouverts, et cet accord parie sur la poursuite de cette tendance jusqu'en 2027.

Qu'est-ce que cela signifie pour IBM Cloud en particulier ?

C'est un positionnement délibéré. IBM Cloud ne dépassera pas les trois premiers hyperscalers en échelle, donc l'argument porte sur l'économie et la maîtrise des données plutôt que sur l'empreinte brute : servir des modèles ouverts moins cher, avec un discours plus clair sur l'endroit où résident les données. La couverture évoque aussi un appétit européen pour des infrastructures qui ne soient pas liées à un seul géant américain, ce qui joue en faveur d'IBM dans certains récits et pas dans d'autres. Pour qui planifie de la capacité d'inférence en 2027, l'enseignement pratique est que le service devient un marché concurrentiel avec plus de trois adresses crédibles.