Sonnet 5 coûte moins cher par token, mais une relance sur Opus 5 se paie en plus. Un calcul simple montre à partir de quel taux d’échec une stratégie « Sonnet d’abord » cesse d’économiser de l’argent.

Le comparatif actuel
Ce comparatif porte désormais sur Sonnet 5 et Opus 5. L'ancien tableau de benchmarks contre Opus 4.8 a été retiré : il ne permet pas de départager les modèles actuels. Il s'agit d'une comparaison documentée des caractéristiques et des coûts, pas d'un test de performance sur machine.
Les fiches officielles de Sonnet 5 et d'Opus 5 indiquent pour les deux un contexte de 1 million de tokens et jusqu'à 128 000 tokens de sortie par requête standard. Leurs identifiants API sont claude-sonnet-5 et claude-opus-5.
| Tarif API standard, USD par million de tokens | Sonnet 5 | Opus 5 |
|---|---|---|
| Entrée | 2 $ | 5 $ |
| Sortie | 10 $ | 25 $ |
| Lecture du cache | 0,20 $ | 0,50 $ |
Tarifs vérifiés le 8 septembre 2026. La hausse de Sonnet à 3 $/15 $, auparavant prévue en septembre, a été annulée. À volumes identiques dans ces catégories, Sonnet coûte 60 % de moins. Cela ne signifie pas que chaque tâche terminée coûte 60 % de moins : longueur des réponses, nouvelles tentatives, frais d'outils et corrections humaines modifient le total.
Quand faut-il payer une seconde tentative ?
Prenons un exemple de 1 million de tokens d'entrée sans cache et 100 000 tokens de sortie. Aux tarifs standards, il coûte 3 $ sur Sonnet et 7,50 $ sur Opus. Les volumes sont choisis pour le calcul ; ce ne sont pas des mesures d'usage typique.
Supposons que chaque tâche commence sur Sonnet et qu'une partie soit relancée sur Opus. Si la relance consomme exactement autant de tokens qu'une tentative directement sur Opus, le coût moyen devient 3 + 7,50 × proportion de relances. Partir directement sur Opus coûte 7,50 $ dans cet exemple.
| Tâches relancées sur Opus | Moyenne en commençant par Sonnet | Opus directement |
|---|---|---|
| 0 % | 3,00 $ | 7,50 $ |
| 20 % | 4,50 $ | 7,50 $ |
| 60 % | 7,50 $ | 7,50 $ |
| 100 % | 10,50 $ | 7,50 $ |
Le graphique montre la limite : une première tentative moins chère ne rend pas automatiquement le parcours moins cher. Au-delà de 60 % de relances, cette stratégie coûte davantage dans cet exemple précis. D'autres volumes de sortie ou usages du cache déplacent le point de croisement. Le temps de relecture et la latence supplémentaire ne sont pas inclus.
Construire une règle de routage à partir des échecs
L'application doit pouvoir déterminer si un résultat est acceptable. Pour du code, exécutez les vérifications pertinentes et relisez la modification. Pour l'extraction, validez le schéma et comparez un échantillon à des réponses annotées. Pour la recherche, vérifiez les pièces citées. Demander au modèle si sa propre réponse est juste ne constitue pas une vérification indépendante.
Conservez la nature de l'échec : résultat erroné, format invalide, affirmation sans preuve, séquence d'outils incomplète ou relecture trop longue. Mesurez les relances par type de tâche. Mélanger de simples mises en forme et de grandes refontes de dépôt peut masquer les usages où le modèle plus cher se justifie.
Avant une migration, vérifiez aussi les paramètres envoyés. Sonnet 5 utilise par défaut le raisonnement adaptatif ; sa documentation indique que les budgets de raisonnement manuels et les paramètres d'échantillonnage non standards ne sont pas acceptés. Exécutez un petit jeu de régression avant de changer le modèle de production.
Choisissez Sonnet lorsqu'il satisfait régulièrement vos critères pour un coût total mesuré plus faible. Choisissez Opus pour les catégories où il évite suffisamment de tentatives ratées ou de relecture. Si des cas difficiles résistent encore, notre comparatif Fable 5.1 contre Opus 5 explique l'étape suivante et la différence de coût du cache.
Révision pour Opus 5 et les tarifs Sonnet 5 de septembre. Graphique calculé à hypothèses explicites ; aucun benchmark indépendant revendiqué.