L’annonce AWS-Nvidia du 26 août prévoit deux millions de GPU supplémentaires en 2027-2028. Elle prolonge le projet de plus d’un million à partir de 2026. Ce calendrier ne décrit pas des GPU déjà accessibles aux clients.

Lire ensemble « supplémentaires » et « prévus »
Le communiqué commun cite Blackwell Ultra, Rubin et Rubin Ultra pour l’expansion future. Il décrit aussi des travaux sur processeurs, réseau et logiciels. Ces programmes ont des livrables distincts ; un titre commun ne leur donne pas une même date de lancement.
La base antérieure est de plus d’un million, et non d’exactement un million. Y ajouter deux millions ne démontre pas le triplement exact d’un parc installé mesuré.
Compter les GPU ne mesure pas une application
Des équipements de générations différentes ne sont pas des unités interchangeables de travail utile. Capacité mémoire, bande passante, interconnexion, précision et logiciel déterminent les traitements possibles et leur passage à l’échelle. Le parc mondial répartit aussi les ressources entre régions et domaines de disponibilité.
Un exemple original rend ce problème concret. Un traitement exige huit GPU connectés dans une même allocation compatible. Un fournisseur disposant de quatre GPU libres dans une région et de quatre dans une autre possède huit GPU libres au total, sans satisfaire cette exigence. Cet exemple ne décrit pas la politique d’AWS : il montre pourquoi un inventaire agrégé ne suffit pas à établir la disponibilité.
Ce qu’un client peut réellement comparer
Pour choisir une installation, relevez le type d’instance, la région, le quota et les modalités de réservation accessibles. Vérifiez ensuite la mémoire utilisable et l’interconnexion pour le modèle et la taille de lot prévus. Prix et disponibilité régionale doivent être contrôlés sur l’offre concernée lors de son ouverture.
Pour l’inférence, une comparaison utile garde constants modèle, précision, longueurs d’entrée et de sortie et objectif de latence. Comptez les requêtes terminées dans ce délai, avec leur coût. Produire davantage de tokens en manquant chaque échéance peut rendre une configuration inadaptée.
Pour l’entraînement, le temps nécessaire pour atteindre un résultat défini informe mieux que l’addition de puissances théoriques. Sauvegardes, alimentation en données et communications peuvent dominer à grande échelle. Aucun résultat applicatif ne découle de ce programme matériel, et PeopleAreGeek n’a pas testé le futur parc annoncé.
Revue du 8 septembre : sources et suites de l’annonce vérifiées, explications et illustration reprises.