DevNews

OpenAI baisse GPT-5.6 Luna de 80 % trois semaines après

Sur cette page
  1. Les chiffres, et le rapport qui compte
  2. D'où vient l'économie
  3. Le mode Fast change le calcul de la latence
  4. Ce qu'il faut faire cette semaine
  5. Sources et pour aller plus loin

OpenAI a retarifé deux de ses trois paliers GPT-5.6 le 30 juillet 2026. Luna passe à 0,20 $ le million de jetons en entrée et 1,20 $ en sortie, contre 1 $ et 6 $ auparavant, soit une baisse de 80 % des deux côtés du compteur. Terra recule de 20 %, à 2 $ et 12 $. Le vaisseau amiral Sol reste à 5 $ et 30 $. La famille n'était disponible en général que depuis le 9 juillet, il s'agit donc d'une retarification trois semaines après le lancement commercial, et elle modifie l'arithmétique du choix de palier plus que la plupart des baisses de prix.

The short answer

OpenAI a baissé le tarif API de deux paliers GPT-5.6 le 30 juillet 2026. Luna recule de 80 %, de 1 $ et 6 $ le million de jetons en entrée et en sortie à 0,20 $ et 1,20 $. Terra recule de 20 %, de 2,50 $ et 15 $ à 2 $ et 12 $. Le vaisseau amiral Sol reste à 5 $ et 30 $. Un nouveau mode Fast remplace Priority Processing et propose jusqu'à 2,5 fois le débit pour le double du tarif standard. OpenAI met en avant des optimisations de service, dont une réécriture des noyaux GPU valant 20 % du coût de bout en bout et des gains de décodage spéculatif supérieurs à 15 %.

80 %de baisse sur GPT-5.6 Luna, entrée comme sortie
0,20 $ / 1,20 $nouveau tarif Luna au million de jetons
21 joursentre la disponibilité générale et la retarification
Carte réponse : OpenAI a ramené GPT-5.6 Luna à 0,20 $ le million de jetons en entrée et 1,20 $ en sortie le 30 juillet 2026, soit une baisse de 80 %, tandis que Terra reculait de 20 % à 2 $ et 12 $ et que le vaisseau amiral Sol restait à 5 $ et 30 $.
La nouvelle grille en une image. Source : l'annonce tarifaire d'OpenAI du 30 juillet 2026. PNG

Une baisse de prix est d'ordinaire ennuyeuse à commenter, puisque la seule réaction utile consiste à multiplier sa facture par un coefficient et à passer à autre chose. Celle ci fait exception, et pas à cause de l'ampleur de la remise. La baisse a été appliquée de façon inégale au sein de la famille, et une baisse inégale modifie les décisions de routage là où une baisse uniforme ne change rien.

Les chiffres, et le rapport qui compte

Il y a trois semaines, la famille GPT-5.6 arrivait en disponibilité générale avec une échelle assez classique : Luna à 1 $ et 6 $ le million de jetons en entrée et en sortie, Terra à 2,50 $ et 15 $, Sol à 5 $ et 30 $. Chaque barreau coûtait environ deux fois et demie celui du dessous.

Graphique en barres des prix de sortie GPT-5.6 au million de jetons : Luna ancien 6 $, Luna nouveau 1,20 $, Terra ancien 15 $, Terra nouveau 12 $, Sol inchangé 30 $.
Prix de sortie au million de jetons avant et après le 30 juillet 2026. Luna s'éloigne d'un ordre de grandeur du palier supérieur. PNG

Depuis le 30 juillet, l'échelle n'est plus régulière. Terra coûte dix fois Luna. Sol coûte vingt cinq fois Luna. L'écart entre le palier le moins cher et le plus cher est passé de 5x à 25x, en entrée comme en sortie.

Si vous faites tourner une charge de classification, d'extraction ou d'aiguillage à fort volume, tout est là. Sous l'ancienne grille, choisir Terra par défaut parce qu'il était un peu plus fiable coûtait 2,5x, ce que la plupart des équipes acceptaient comme une assurance. Sous la nouvelle, ce même réflexe défensif coûte 10x. Sur un pipeline qui pousse cinquante millions de jetons d'entrée par jour, cela fait la différence entre environ 100 $ et environ 10 $ par jour sur la seule entrée.

Sam Altman commente la retarification sur X, le 30 juillet 2026.

D'où vient l'économie

L'explication d'OpenAI est inhabituellement précise pour un billet tarifaire, et elle se lit comme une déclaration d'ingénierie plus que comme du marketing. Deux chiffres sont donnés. La réécriture des noyaux GPU a réduit le coût de service de bout en bout de 20 %. Les améliorations du décodage spéculatif ont augmenté l'efficacité de génération de jetons de plus de 15 %. L'entreprise ajoute que GPT-5.6 Sol a contribué lui même à la réécriture des noyaux.

Aucun de ces chiffres n'explique à lui seul une baisse de 80 %, et OpenAI ne le prétend pas. Une réduction de cette taille est une décision de marge posée par dessus une amélioration de coût, ce qui est le fonctionnement normal de ce type d'annonce. Ce que les chiffres publiés indiquent, en revanche, c'est où se porte l'attention du secteur. Le coût de service par jeton, et non la position dans les classements, est ce que les laboratoires de pointe optimisent aujourd'hui, et le même mouvement s'était vu quand Anthropic a divisé par deux le prix de son palier haut plus tôt ce mois ci.

Le mode Fast change le calcul de la latence

En parallèle des baisses, Priority Processing disparaît au profit du mode Fast. Le marché est simple : jusqu'à 2,5 fois le débit standard, pour exactement le double du tarif standard. Luna Fast est à 0,40 $ et 2,40 $, Terra Fast à 4 $ et 24 $, Sol Fast à 10 $ et 60 $.

La comparaison intéressante est diagonale, pas verticale. Luna en mode Fast coûte moins du cinquième de Terra en standard. Si ce que vous cherchiez dans le palier moyen était de la réactivité et non du raisonnement, le chemin le moins cher consiste désormais à acheter de la vitesse en bas de l'échelle plutôt que de la capacité au milieu. Ce n'était pas vrai la semaine dernière, quand Luna Fast à 2 $ et 12 $ était tarifé exactement comme Terra en standard.

Un détail plus discret mérite d'être noté : Luna en mode Fast coûte aujourd'hui moins cher que Luna en mode standard le 29 juillet. Qui payait déjà Priority Processing sur le palier bas récupère à la fois une remise et un changement de débit dans le même mouvement.

Ce qu'il faut faire cette semaine

Relancer l'évaluation de routage. C'est le seul point d'action qui porte de l'argent réel.

La plupart des piles en production qui utilisent une famille de modèles finissent avec une règle de routage statique écrite la première semaine de l'intégration, en général orientée vers le haut parce que l'écart de coût était faible et que l'écart de fiabilité n'était pas encore mesurable. L'écart de coût n'est plus faible. Si vous n'avez jamais mesuré quel pourcentage de votre trafic Luna traite correctement sur votre propre jeu d'évaluation, la valeur de cette mesure vient d'être multipliée par environ quatre.

Deux précautions pratiques. D'abord, des prix qui bougent aussi vite dans un sens peuvent bouger dans l'autre, évitez donc de réarchitecturer autour d'un palier unique. Ensuite, une retarification trois semaines après la disponibilité générale rappelle que le coût au jeton est devenu une variable molle, et que tout engagement annuel doit être dimensionné en tenant compte de cette volatilité. Les différences de capacité entre paliers n'ont pas changé, seulement leur prix : toute évaluation menée au lancement reste valable sur la qualité et devient obsolète sur l'économie.

Sources et pour aller plus loin

Questions fréquentes

Qu'est ce qui change exactement, et à partir de quand ?

OpenAI a annoncé les nouveaux tarifs API le 30 juillet 2026, avec effet immédiat. GPT-5.6 Luna passe de 1 $ le million de jetons en entrée et 6 $ en sortie à 0,20 $ et 1,20 $, soit une réduction de 80 % sur les deux. GPT-5.6 Terra passe de 2,50 $ et 15 $ à 2 $ et 12 $, une réduction de 20 % sur les deux également. GPT-5.6 Sol, le vaisseau amiral, reste à 5 $ et 30 $. Comme chaque baisse s'applique identiquement à l'entrée et à la sortie, vous pouvez calculer votre nouvelle facture en multipliant votre dépense actuelle par 0,2 pour Luna et par 0,8 pour Terra, quel que soit votre rapport entrée sortie.

Comment OpenAI justifie t il cette baisse ?

Par du travail d'efficacité sur la pile de service, pas par un changement d'architecture des modèles. OpenAI attribue la réduction à des optimisations sur l'inférence et sur le harnais d'agent, avec deux chiffres précis : la réécriture des noyaux GPU a réduit le coût de service de bout en bout de 20 %, et les améliorations du décodage spéculatif ont augmenté l'efficacité de génération de jetons de plus de 15 %. L'entreprise ajoute que GPT-5.6 Sol a lui même participé à la réécriture des noyaux. Traitez cette dernière affirmation comme une déclaration de fournisseur plutôt que comme un résultat mesuré, mais la direction est cohérente avec ce que fait aujourd'hui tout acteur qui sert de grands modèles : la frontière s'est déplacée des astuces d'entraînement vers le coût de service par jeton.

Qu'est ce que le mode Fast et faut il l'utiliser ?

Le mode Fast remplace l'ancienne option Priority Processing. Il délivre jusqu'à 2,5 fois le débit standard pour exactement le double du tarif standard, soit 0,40 $ et 2,40 $ pour Luna, 4 $ et 24 $ pour Terra, 10 $ et 60 $ pour Sol. La comparaison utile n'est pas Fast contre standard, c'est Fast contre le palier du dessus. Luna en mode Fast coûte 0,40 $ et 2,40 $, très en dessous de Terra à 2 $ et 12 $. Si votre goulot d'étranglement est la latence et non la profondeur de raisonnement, acheter de la vitesse sur le palier bas revient désormais bien moins cher qu'acheter de la capacité sur le palier moyen. Notez aussi que Luna en Fast reste moins cher que Luna au tarif standard de la veille.

Cela change t il le palier par défaut à retenir ?

Cela change la forme de la décision. Avant la baisse, Terra coûtait 2,5 fois Luna en entrée comme en sortie, un écart assez faible pour que beaucoup d'équipes montent d'un cran par sécurité. Après la baisse, Terra coûte 10 fois Luna et Sol coûte 25 fois Luna. Une marge qui relevait de l'erreur d'arrondi devient la ligne dominante d'une charge à fort volume. Le geste pratique consiste à relancer votre évaluation de routage plutôt qu'à supposer que la réponse d'hier tient toujours : mesurez quelle fraction de votre trafic Luna traite correctement, car le coût d'une erreur sur cette fraction vient d'être multiplié par dix dans l'autre sens.

Est ce une réponse à la concurrence ?

En partie, et OpenAI ne s'en cache pas. Sam Altman a publié sur X que l'entreprise veut offrir le meilleur compromis prix intelligence à chaque niveau. La couverture de l'annonce cite systématiquement deux pressions : des acheteurs en entreprise devenus sensibles à la ligne budgétaire IA après une année de croissance non budgétée, et des modèles chinois moins chers qui comblent l'écart sur le bas de gamme. Anthropic a bougé dans le même sens plus tôt ce mois ci en divisant par deux le prix de son palier haut. La tendance du marché est claire : la capacité affichée n'est plus le seul axe de compétition, et le coût par million de jetons bouge assez vite pour rendre un contrat annuel risqué.