SysadminNews

Etched lève 700 M$ à 21 milliards et livre Jane Street

Sur cette page
  1. Le tour de table
  2. Ce que vend réellement Etched aujourd'hui
  3. Pourquoi la séparation est la vraie information
  4. Ce sur quoi rester sceptique
  5. Sources et pour aller plus loin

Etched a levé sept cents millions de dollars à vingt et un milliards de valorisation le mardi 18 août 2026, sous la conduite de la société de trading quantitatif Jane Street. C'est le double de la valorisation fixée quatre semaines plus tôt, et la raison n'est pas un argumentaire commercial. Jane Street a testé le matériel, l'a acheté, et a installé dans son propre centre de données le premier cluster livré par Etched. Le produit a changé lui aussi. Etched ne vend plus une puce transformeur unique, mais un cluster découpé selon les deux phases de l'inférence, avec du silicium différent pour chacune. Voici ce que ce découpage change quand vous dimensionnez de l'inférence.

The short answer

Etched a annoncé un tour de sept cents millions de dollars à vingt et un milliards de valorisation le mardi 18 août 2026. Jane Street l'a mené, après avoir testé le matériel puis installé dans son propre centre de données le premier cluster livré par Etched. La valorisation était de 10,3 milliards en juillet et de 5 milliards en décembre 2025. Le produit a bougé lui aussi : plutôt qu'une puce uniquement transformeur, Etched vend désormais un cluster qui sépare l'inférence en une phase de préremplissage et une phase de décodage, avec du silicium conçu pour chacune.

700 M$levés à 21 milliards de valorisation
x2de valorisation en quatre semaines
1 Md$+de commandes enregistrées à ce jour
Carte réponse : Etched a levé 700 millions de dollars le 18 août 2026 à 21 milliards de valorisation sous la conduite de Jane Street, le double de sa valorisation de juillet à 10,3 milliards, avec plus d'un milliard de dollars de commandes et son premier cluster livré installé dans le centre de données de Jane Street.
Le tour de table, et le détail qui le rend inhabituel. PNG

Un tour de table ne vous dit presque jamais si du matériel fonctionne. Celui ci le fait, parce que l'investisseur qui signe le plus gros chèque avait déjà branché les baies.

Le tour de table

Etched a levé sept cents millions de dollars à vingt et un milliards de valorisation, annoncé le mardi 18 août 2026. Jane Street a mené l'opération. Kleiner Perkins, Sequoia Capital, Andreessen Horowitz, Peter Thiel, Tiger Global, Bain Capital Ventures, Blackstone, Neo, Stripes, Primary, Positive Sum, Diffusion et Argo ont suivi.

L'historique de valorisation mérite d'être noté, car il est raide même pour ce cycle. Cinq milliards de dollars en décembre 2025. Dix virgule trois milliards en juillet 2026, quand Etched a bouclé une série C de 300 millions de dollars. Vingt et un milliards en août. Cela fait environ onze milliards de dollars de valeur ajoutée sur le papier en quatre semaines.

L'annonce de l'entreprise elle même, livraison de la première baie comprise.

Ce qui justifie ce chiffre, c'est la seconde moitié de l'annonce plutôt que la première. Jane Street n'a pas seulement mené un tour. Elle a testé la puce, acheté un système, et installé dans son propre centre de données le premier cluster jamais livré par Etched. Le commentaire public de la société est volontairement plat : elle a testé la puce et se dit satisfaite des premiers résultats. Etched annonce désormais plus d'un milliard de dollars de commandes enregistrées.

Un carnet de commandes et une baie installée sont deux choses différentes, et l'écart entre les deux a enterré plus d'une jeune pousse du silicium. Annoncer les deux d'un même souffle, c'est tout l'objet de cette communication.

Ce que vend réellement Etched aujourd'hui

La description du produit a changé depuis juillet, et c'est la partie à lire attentivement si vous aviez suivi l'épisode précédent.

Le pari d'origine, c'était Sohu, une puce avec le calcul transformeur câblé dans le silicium. L'attention, les projections linéaires, le softmax et la normalisation de couche figés dans le matériel, ce qui achète de l'efficacité en supprimant la souplesse à laquelle un GPU généraliste consacre des transistors. Le risque était tout aussi simple : un matériel qui ne fait tourner que des transformeurs ne vaut plus rien le jour où quelque chose remplace le transformeur.

Etched décrit maintenant ses systèmes comme des clusters d'inférence de pointe bâtis sur deux composants sur mesure, et affirme qu'ils acceptent n'importe quel modèle de pointe. La dépendance à une architecture unique a disparu. Ce qui reste, c'est une séparation le long des deux phases de la génération d'une réponse.

Le préremplissage est la première phase. Le modèle lit votre requête et tout son contexte en une passe, et construit l'état dont il a besoin avant d'écrire quoi que ce soit. Ce travail est très parallèle et limité par le calcul. Le composant de préremplissage d'Etched est décrit comme une puce fonctionnant à basse tension avec une densité de transistors plus élevée, ce qui est la manière classique d'acheter du débit par watt quand la charge est assez parallèle pour s'étaler sur beaucoup d'unités plus lentes.

Le décodage est la seconde phase, et sa forme est inverse. Le modèle émet un jeton, le réinjecte, et émet le suivant. Il y a très peu d'arithmétique par jeton et un trafic mémoire énorme, car chaque jeton impose de relire les poids du modèle et le contexte accumulé. Le décodage est limité par la bande passante mémoire, pas par le calcul. La réponse d'Etched ici, c'est de la mémoire et de l'interconnexion à l'échelle du cluster, avec de la mémoire mutualisée entre plusieurs puces plutôt qu'enfermée sur chacune.

Comparaison des deux phases de l'inférence d'un modèle de langage : le préremplissage est limité par le calcul et très parallèle, il traite la requête et le contexte en une seule passe, tandis que le décodage est limité par la bande passante mémoire et produit la réponse visible un jeton à la fois.
Les deux phases veulent du matériel opposé. Les faire tourner sur un même GPU gaspille la ressource dont l'autre phase a besoin. PNG

Robert Wachen, cofondateur, résume la division sans détour : l'inférence se déroule en deux étapes, l'une traitant la requête et son contexte, l'autre générant la réponse que l'utilisateur voit réellement.

Pourquoi la séparation est la vraie information

Séparer préremplissage et décodage n'est pas une invention d'Etched, et c'est précisément pour cela que cela compte. La même idée est apparue quand AMD et Cerebras ont réparti l'inférence sur deux types de puces plus tôt dans ce cycle, et on la retrouve dans des piles de service qui ne touchent jamais à du silicium sur mesure.

Le raisonnement est partout le même. Si vous faites tourner les deux phases sur un matériel identique, une phase laisse toujours une ressource inutilisée. Pendant le préremplissage, votre bande passante mémoire est sous employée. Pendant le décodage, vos unités arithmétiques attendent. Sur une grande flotte, cette fraction inutilisée est le premier levier sur le coût par jeton, devant la plupart des optimisations de noyaux que vous pourriez tenter à la place.

Pour qui exploite de l'inférence plutôt que d'en construire, il y a deux conséquences pratiques.

La première concerne la mesure. Le délai avant le premier jeton est dominé par le préremplissage. Le nombre de jetons par seconde ensuite est dominé par le décodage. Publier une seule latence moyenne cache la phase qui vous limite vraiment, et les deux se corrigent par des changements complètement différents. Des requêtes longues vous poussent vers la pression de préremplissage. Des réponses longues et une forte concurrence vous poussent vers la pression de décodage. La seconde, c'est que le traitement par lots se comporte différemment selon la phase. Le décodage gagne énormément à regrouper de nombreuses requêtes, car les lectures mémoire coûteuses sont partagées par toutes les requêtes du lot, tandis que le préremplissage y gagne beaucoup moins puisqu'il sature déjà le calcul. Les piles de service qui ordonnancent les deux phases séparément le font pour cette raison, et il vaut la peine de vérifier si la vôtre le fait.

Ce sur quoi rester sceptique

Rien de tout cela ne tranche la question posée au silicium d'inférence spécialisé depuis la première jeune pousse qui a promis de battre l'acteur dominant sur les jetons par dollar.

Un cluster installé chez un client, cela fait un point de mesure. Jane Street est un acheteur d'une compétence inhabituelle avec une charge de travail très particulière, et une société qui exploite sa propre infrastructure quantitative ne représente pas un hyperscaler servant du trafic public varié. Un milliard de dollars de commandes est un chiffre réel, mais les commandes ne se transforment en chiffre d'affaires que si les baies partent, s'installent et tiennent, ce qui est exactement là où le silicium sur mesure a historiquement calé.

La valorisation porte son propre risque. Doubler en quatre semaines intègre par avance beaucoup d'exécution qui n'a pas encore eu lieu, et l'acteur dominant auquel on la compare continue de livrer. Ce qui s'est réellement amélioré, c'est la forme du pari : abandonner la contrainte du tout transformeur supprime le mode de défaillance qui pouvait rendre le matériel obsolète du jour au lendemain, et la séparation des phases relève de l'ingénierie défendable plutôt que d'un pari sur l'immobilisme du domaine.

Sources et pour aller plus loin

Questions fréquentes

Qu'a annoncé exactement Etched le 18 août ?

Etched a bouclé un tour de sept cents millions de dollars à vingt et un milliards de valorisation, mené par Jane Street. Kleiner Perkins, Sequoia Capital, Andreessen Horowitz, Peter Thiel, Tiger Global, Bain Capital Ventures, Blackstone, Neo, Stripes, Primary, Positive Sum, Diffusion et Argo ont également participé. En parallèle, l'entreprise a annoncé la livraison de sa première baie, et le client qui la reçoit est Jane Street elle même. Etched dit avoir désormais plus d'un milliard de dollars de commandes enregistrées. La valorisation était de 5 milliards en décembre 2025 et de 10,3 milliards en juillet 2026 : c'est donc le deuxième doublement en huit mois.

Pourquoi une société de trading achète du matériel d'inférence ?

Pour deux raisons, dont une seule concerne le trading. Jane Street fait tourner des charges quantitatives énormes et a déjà acheté du calcul peu courant, donc évaluer un nouveau cluster d'inférence relève du travail habituel de ses équipes d'infrastructure. Ce qui est inhabituel, c'est de mener ensuite le tour de table. Un client qui a installé le matériel puis signe le plus gros chèque du tour porte une affirmation qu'aucune diapositive de benchmark ne peut porter : la machine fonctionne dans un vrai centre de données, sous vraie charge. C'est pour cela que le marché a lu ce tour comme une validation matérielle plutôt que comme une opération financière.

Concrètement, c'est quoi la séparation préremplissage et décodage ?

Générer une réponse se fait en deux phases aux besoins matériels opposés. Le préremplissage lit votre requête et tout son contexte en une passe : c'est lourd en calcul et très parallèle. Le décodage produit ensuite la réponse un jeton à la fois : c'est lourd en bande passante mémoire et cela sollicite très peu les unités arithmétiques. Faites tourner les deux sur le même GPU et une phase gaspille toujours la ressource dont l'autre a besoin. Etched construit désormais une puce basse tension à forte densité de transistors pour le préremplissage, et une conception mémoire et interconnexion à l'échelle du cluster pour le décodage, avec de la mémoire mutualisée entre puces. Cette séparation est une tendance de fond du secteur, pas une invention d'Etched.

Est ce toujours le pari Sohu, uniquement transformeur ?

Il s'est assoupli, et c'est le changement technique le plus important depuis juillet. Le pari d'origine était Sohu, une puce avec l'architecture transformeur câblée dans le silicium, rapide précisément parce qu'elle ne pouvait rien faire d'autre. Le risque était évident : une nouvelle architecture de modèle rendait le matériel inutilisable. Etched affirme maintenant que ses systèmes prennent en charge n'importe quel modèle de pointe, ce qui supprime le point de défaillance unique qui rendait le pari initial si agressif. L'argument d'efficacité subsiste, mais il ne dépend plus de la domination éternelle du transformeur.

Cela doit il changer ma façon de dimensionner l'inférence ?

Pas encore, mais cela doit changer ce que vous mesurez. Les fournisseurs d'inférence spécialisée poussent tous le même message : les jetons par dollar et les jetons par watt comptent davantage que le débit de pointe brut, et séparer préremplissage et décodage est le moyen d'améliorer les deux. Même si vous n'achetez jamais ce matériel, ce cadrage vaut la peine d'être adopté pour évaluer votre propre pile de service. Mesurez les deux phases séparément, car une pile qui semble correcte en moyenne est souvent bloquée sur une seule d'entre elles. Traitez les chiffres d'efficacité des fournisseurs comme des affirmations tant que vous n'avez pas testé vos modèles sur votre trafic.