Opus 5.5 code mieux. Le coût par tâche reste à vérifier

Opus 5.5 progresse dans les tests indépendants et baisse ses tarifs. Je compare le coût des tâches, les niveaux de raisonnement et les premiers avis Reddit.

Sorties
Sur cette page
  1. À quel point Opus 5.5 programme-t-il mieux ?
  2. Opus 5.5 coûte-t-il vraiment moins cher par tâche ?
  3. Que dit Reddit de l’utilisation d’Opus 5.5 ?
  4. Que doivent vérifier les développeurs avant de changer ?

Claude Opus 5.5 est sorti le 22 septembre 2026 avec des tokens moins chers et une nette progression dans les tests de programmation indépendants. Il mérite un essai, mais le coût par tâche terminée demande plus d’attention : les économies annoncées par Anthropic et les mesures d’Artificial Analysis au niveau maximal portent sur des tâches et des réglages différents. Je commencerais au niveau moyen. [1] [2] [3]

À quel point Opus 5.5 programme-t-il mieux ?

Le test indépendant montre une progression sensible par rapport à Opus 5 : Artificial Analysis relève un gain de 10,6 points de pourcentage sur Terminal-Bench 4.0. Ce test confie à un agent des tâches pratiques dans un terminal, ce qui le rapproche davantage du travail dans un dépôt qu’une courte question de programmation. [2]

Afficher les données en tableau
Test Opus 5.5Opus 5
Terminal-Bench 4.0 59,6 %49,0 %
Figure 1. Artificial Analysis, Terminal-Bench 4.0. Raisonnement maximal, consultation du 22 septembre 2026. [2]

Artificial Analysis exécute les 66 tâches avec mini-swe-agent et calcule la moyenne des réussites en un essai sur trois répétitions. Garder le même logiciel d’agent rend la comparaison utile. Elle mesure toutefois cette configuration précise, et non toutes les façons d’utiliser Claude Code. [2]

Les résultats CursorBench publiés par Anthropic vont dans le même sens : 57,8 % au niveau maximal, contre 46,6 % pour Opus 5. Même au niveau moyen, Opus 5.5 atteint 52,5 %, au-dessus de l’ancien maximum. Selon la fiche système d’Anthropic, Cursor a réalisé cette évaluation avec son propre logiciel d’agent. C’est un élément supplémentaire, mais le dispositif diffère de celui d’Artificial Analysis. [10]

Le résultat au niveau moyen m’intéresse davantage qu’une nouvelle victoire au maximum. Dans mon analyse d’Opus 5 comme développeur exécutant, le problème était la supervision que du bon code pouvait encore exiger. Un meilleur résultat avec moins de raisonnement serait utile ; un meilleur résultat après une exécution bien plus longue représente un autre compromis.

Opus 5.5 coûte-t-il vraiment moins cher par tâche ?

Opus 5.5 coûte moins cher par token d’entrée et de sortie, mais la facture dépend de la quantité de travail effectuée. Claude Platform Docs indique 4 dollars par million de tokens d’entrée et 20 dollars par million de tokens de sortie, contre 5 et 25 dollars pour Opus 5. Anthropic annonce un coût habituel par tâche inférieur d’environ 40 %, car le nouveau modèle consomme aussi moins de tokens dans ses évaluations. [5] [1]

Artificial Analysis apporte un contrepoint utile. Son Intelligence Index actuel passe de 51 à 58, alors que le coût mesuré par tâche de l’indice augmente légèrement, de 5,86 à 5,98 dollars, au niveau maximal. Il s’agit des tâches de sa suite d’évaluation, pas d’une prévision de votre facture moyenne de programmation. [3] [4]

Artificial Analysis, raisonnement maximal, consultation du 22 septembre 2026. Les points d’indice ne sont pas des pourcentages. [3][4]

Mesure indépendante Opus 5 Opus 5.5
AA Intelligence Index v4.3.2 51 58 (Meilleure valeur de la ligne)
Coût par tâche de l’indice, USD 5,86 5,98

Dans cette configuration, on obtient donc de meilleures capacités mesurées pour une somme presque identique. Cela ne contredit pas les économies d’Anthropic sur d’autres tâches, mais je ne prévoirais pas une baisse universelle de 40 % dans un budget. La version de l’indice compte aussi : les deux scores viennent de la v4.3.2. Un ancien score d’Opus 5 provenant d’une autre version ne peut pas être comparé directement à 58.

Le guide de prompting d’Anthropic explique pourquoi le niveau de raisonnement mérite votre attention. À réglage de même nom, Opus 5.5 peut réfléchir davantage par tour qu’Opus 5, surtout en xhigh et max. Le guide recommande de tester à nouveau les niveaux au lieu de conserver l’ancien choix. Il indique aussi que le niveau moyen peut égaler ou dépasser Opus 5 au niveau élevé en programmation et dans le travail intellectuel. [6]

J’en retiens qu’il faut payer le raisonnement dont la tâche a besoin. Choisir systématiquement le maximum empêcherait de voir si le nouveau modèle peut accomplir le même travail avec moins d’effort.

Que dit Reddit de l’utilisation d’Opus 5.5 ?

Les témoignages les plus utiles du jour de sortie concernent des réponses plus courtes et des échanges plus simples, avec des désaccords sur les échecs en programmation. Ces publications du 22 septembre constituent un échantillon volontaire, pas un taux d’échec mesuré. Je n’ai pas réalisé de comparaison pratique contrôlée pour cet article.

Dans r/ClaudeCode, un utilisateur a publié les réponses de plusieurs générations d’Opus au même prompt et trouvé celles de 5.5 plus lisibles que celles de 5. L’exemple est limité, mais il donne quelque chose de concret à examiner plutôt qu’une simple impression d’intelligence supérieure. [7]

Un autre fil de r/ClaudeAI apprécie la rapidité et la détection de problèmes d’interface. Dans ses commentaires, une personne rapporte pourtant une boucle de modifications sans issue. Un autre fil de lancement contient à la fois des témoignages de réponses plus rapides et une plainte concernant des implémentations incomplètes et des consignes de projet ignorées. [8] [9]

J’y vois une raison de tester la communication et le respect des consignes séparément de la qualité du code. Un modèle peut produire un meilleur correctif tout en rendant la séance pénible. C’est aussi pourquoi mon analyse du workflow Opus 5 consacre autant de place au périmètre des tâches et aux instructions existantes.

Que doivent vérifier les développeurs avant de changer ?

Une migration d’API demande un peu plus que remplacer le nom du modèle. Opus 5.5 utilise claude-opus-5-5, démarre au niveau de raisonnement moyen et active toujours le raisonnement adaptatif. La documentation décrit aussi des changements dans les appels d’outils, dont des erreurs lorsque leur utilisation est forcée. Les intégrations d’agents existantes devraient consulter ces notes avant de migrer. [5]

Pour l’utilisation courante de Claude Code, je commencerais par un bug existant et un test d’acceptation connu, puis je noterais si le niveau moyen produit un correctif acceptable. Je compterais aussi les corrections : devoir répéter la même consigne fait partie du coût, même si ce temps ne figure pas sur la facture API.

L’alternative a elle aussi changé le même jour. Les baisses de prix et les benchmarks de GPT-6 Sol et Luna proposent un autre intérêt pour le quotidien, avec des gains d’indice plus faibles et des tokens bien moins chers. Je les comparerais sur une tâche que je comprends assez pour en vérifier le résultat, puis choisirais le modèle qui la fait accepter avec le moins d’interventions.

Sources

  1. Introducing Claude Opus 5.5Anthropic · 2026-09-22
  2. Terminal-Bench 4.0Artificial Analysis
  3. Claude Opus 5.5 model analysisArtificial Analysis
  4. Claude Opus 5 model analysisArtificial Analysis
  5. Claude Opus 5.5 overviewClaude Platform Docs
  6. Prompting Claude Opus 5.5Claude Platform Docs
  7. Proof that Opus 5.5 is easier to talk to/deal withReddit, r/ClaudeCode · 2026-09-22
  8. Opus 5.5 in Claude Code is crazy fast especiallyReddit, r/ClaudeAI · 2026-09-22
  9. Opus 5.5 in the release notesReddit, r/ClaudeAI · 2026-09-22
  10. Claude Opus 5.5 System CardAnthropic