Cerebras a annoncé CS-4 le 18 août. Ce rack rassemble trois processeurs WSE-3T, mais ses chiffres de calcul nécessitent de préciser le format numérique et le périmètre de chaque mesure.

Identifier ce que décrit chaque chiffre
La fiche technique CS-4 indique 250 PFLOPS par wafer et 750 pour le système à trois wafers. Sa note précise FP16 sparse, donc avec parcimonie. Comparer ce chiffre à une capacité de calcul dense sans expliquer cette différence ne démontre pas un avantage de performances.
| Spécification publiée | Un wafer WSE-3T | Système CS-4 |
|---|---|---|
| SRAM intégrée | 44 Go | 132 Go répartis sur trois wafers |
| Bande passante mémoire | 43,2 Po/s | 129,6 Po/s |
| Bande passante d’E/S | 2,4 Tbit/s | 7,2 Tbit/s |
Les totaux du système ne décrivent pas une mémoire unique accessible partout sans coût de communication. La conservation du 5 nm, de quatre mille milliards de transistors et de 900 000 cœurs ne prouve pas non plus que le nouveau WSE-3T soit identique à son prédécesseur.
Une conversion qui évite de mélanger les réseaux
En unités décimales, 7,2 Tbit/s divisés par huit donnent 0,9 To/s. Cela ne correspond pas aux 129,6 Po/s de bande passante mémoire interne. Placer ces deux valeurs dans une colonne « vitesse réseau » comparerait des capacités différentes.
Le visuel officiel montre le rack et ses modules exposés. Il situe le matériel ; il ne représente pas le trajet de chaque octet. Les Direct Wafer Links relient les wafers au sein des racks et entre eux. L’annonce décrit séparément des E/S programmables RoCEv2. L’architecture du réseau et ses réglages doivent être établis à partir de la configuration réellement déployée.
Comparer avec le modèle réellement utilisé
L’annonce de lancement rapporte 4 400 tokens par seconde et par utilisateur pour GPT-OSS-120B, avec une comparaison atteignant 30× face à des solutions GPU. Ce sont les résultats de Cerebras, pas nos mesures ni une promesse valable pour tous les modèles. Les premières livraisons étaient prévues pendant le trimestre de l’annonce ; un calendrier ne prouve pas une disponibilité immédiate chez tous les clients.
Une comparaison utile conserve version du modèle, précision, longueurs d’entrée et de sortie, concurrence et exigences de qualité. Demandez séparément délai du premier token et débit de sortie soutenu, puis comparez débit livré, puissance et prix pour cette configuration. Le pic de calcul et un résultat de génération rapide ne remplacent pas cette évaluation ciblée.
Revue du 8 septembre : sources recoupées, données actualisées et explications et visuels remplacés.