Benchmarks

Opus 5 égale Sol, Terra vaut Fable au quart du prix

Sol, Terra, Opus 5 et Fable 5 sur le même agent : égalité en tête, le même score au quart du coût et des niveaux d'effort qui peuvent nuire au résultat.

Sur cette page
  1. Le plateau : prix, fenêtres et niveaux d’effort
  2. Qu’achète-t-on vraiment avec plus d’effort ?
  3. Qui gagne quand l’agent est identique ?
  4. Un mainteneur fusionnerait-il vraiment ce patch ?
  5. Les tableaux de spécialistes : compréhension, tests, refactoring
  6. Terminaux, VM et les problèmes vraiment durs
  7. Comment lire un leaderboard en 2026 ?
  8. Quel modèle pour quel travail ?

Aucun modèle ne gagne le développement logiciel en juillet 2026. Sur DeepSWE de Datacurve, le seul grand classement qui fait passer chaque modèle par le même agent, Claude Opus 5 obtient 74 % et GPT-5.6 Sol 73 %, avec des barres d’erreur qui se chevauchent [1]. GPT-5.6 Terra égale les 70 % de Claude Fable 5 pour moins d’un quart du coût [1]. Ce qui sépare les quatre, c’est le profil, pas le rang.

Je fais tourner les modèles Claude et Sol sur de vrais dépôts chaque semaine ; Terra, je ne le connais que par les tableaux ci-dessous. Voici donc la comparaison que j’aurais voulu qu’on écrive pour moi : les deux ChatGPT les plus forts contre les deux Claude les plus forts, benchmark par benchmark, y compris la partie que les threads de lancement sautent, à savoir ce que chaque chiffre a le droit de vouloir dire.

Le plateau : prix, fenêtres et niveaux d’effort

Les quatre modèles se répartissent proprement par rôle. OpenAI route l’alias nu gpt-5.6 vers Sol, « le modèle pour la capacité phare », et positionne Terra comme le modèle qui « équilibre intelligence et coût » [2] [3]. Les docs d’Anthropic destinent Opus 5 au codage agentique complexe et au travail d’entreprise, et Fable 5, le haut de gamme, aux agents de longue durée [4].

Les prix catalogue racontent la même histoire. Sol coûte 5 $ par million de tokens d’entrée et 30 $ en sortie ; Terra exactement la moitié, 2,50 $ et 15 $ [2]. Opus 5 est à 5 $ et 25 $, Fable 5 à 10 $ et 50 $ [5]. Et la prime d’Anthropic continue de grimper : la page de prix liste un fast mode pour Opus 5, en préversion de recherche, exactement aux tarifs de Fable [5].

Caractéristique SolTerraOpus 5Fable 5
Entrée, $/MTok 5,00 2,50 (Meilleure valeur de la ligne) 5,00 10,00
Sortie, $/MTok 30 15 (Meilleure valeur de la ligne) 25 50
Lecture de cache, $/MTok 0,50 0,25 (Meilleure valeur de la ligne) 0,50 1,00
Fenêtre de contexte 1,05M 1,05M 1M 1M
Niveaux d'effort 6, de none à max 6, de none à max 5, de low à max 5, de low à max
Figure 1. Prix catalogue et caractéristiques des quatre modèles. Docs développeur OpenAI et Anthropic, juillet 2026.

La table en une ligne : Terra est la seule remise de la pièce, et les fenêtres de contexte sont assez proches pour cesser de différencier [2] [4].

Les molettes d’effort méritent plus d’attention que les prix. GPT-5.6 accepte six valeurs, de none à max, et le guide d’OpenAI appelle medium le point de départ équilibré [3]. Les modèles Claude en acceptent cinq, de low à max, avec high par défaut, et Anthropic vous dit de monter Opus 5 à xhigh pour le codage et le travail agentique exigeants, et de réserver max aux tâches qui justifient une dépense de tokens sans contrainte [6]. Rien ne garantit que le high d’OpenAI et le high d’Anthropic achètent un calcul comparable. Les noms d’effort sont des molettes propres à chaque fournisseur, pas des unités.

Qu’achète-t-on vraiment avec plus d’effort ?

Dix à quinze points d’intelligence mesurée, pour huit à seize fois plus de tokens. Artificial Analysis note Opus 5 de 51 à effort low jusqu’à 61 à max, Sol de 49 à 59, et Terra de 40 à 55 sur son Intelligence Index [9] [10] [11].

Cet indice, v4.1, mélange neuf évaluations, du travail agentique en terminal et de l’exécution de tâches réelles jusqu’à GPQA Diamond et au raisonnement en contexte long, pondérées à 34 % agents, 24 % code, 24 % raisonnement scientifique et 18 % général [12]. C’est la meilleure photo publique de la courbe d’effort, parce que la même batterie a tourné à chaque réglage.

  • Opus 5
  • Sol
  • Terra
Intelligence Index par niveau d'effort pour Opus 5, Sol et Terra Opus 5 mène à chaque réglage, Sol suit à deux points, Terra reste derrière mais grimpe le plus vite, de 40 à 55. 30 40 50 60 70 low medium high xhigh max
Afficher les données en tableau
Effort Opus 5SolTerra
low 514940
medium 565446
high 595649
xhigh 605852
max 615955
Figure 2. Intelligence Index v4.1 par niveau d'effort. Artificial Analysis, relevé le 30 juillet 2026.

Deux choses ressortent de la figure 2. Les courbes ne se croisent presque pas, la hiérarchie survit donc à tous les réglages. Et le sommet est plat : le pas imprimé d’Opus 5 de 60 à 61 vaut 0,62 point d’indice non arrondi, payé en faisant passer la facture de sortie de la batterie de 76 à 100 millions de tokens [9].

Les factures de tokens sont la vraie courbe. Opus 5 a dépensé 12 millions de tokens de sortie sur la batterie à low et 100 millions à max ; Sol est passé de 6,6 à 70 millions ; Terra de 5,9 à 96 [9] [10] [11]. Le dernier palier de Terra est le plus cher : de xhigh à max, il triple presque ses tokens pour trois points d’indice [11].

Fable 5 n’a pas de balayage d’effort public. Artificial Analysis liste exactement une configuration, max, à 60, un point arrondi sous Opus 5, générée avec 87 millions de tokens [13]. Les deux vaisseaux amiraux d’Anthropic ont tourné avec un repli côté serveur vers Opus 4.8 pour les prompts que leur couche de sécurité arrête [13] [14]. Le verdict de lancement d’AA sur Opus 5 résume la section : une intelligence de niveau Fable à 2,03 $ par tâche d’indice contre 2,75 $ pour Fable [14].

Qui gagne quand l’agent est identique ?

Personne, et c’est justement le résultat. DeepSWE fait passer les 18 modèles par le même mini-swe-agent, et à effort maximal Opus 5 résout 74 % ± 4 des tâches, Sol 73 % ± 3 [1]. Les intervalles se chevauchent largement. Fable 5 et Terra finissent à égalité à 70 % [1].

DeepSWE est la comparaison à laquelle je fais le plus confiance parce qu’elle supprime la variable du harness. Ses 113 tâches couvrent 91 dépôts et cinq langages, sont écrites de zéro pour qu’aucun modèle n’ait vu une solution à l’entraînement, et sont notées par des vérificateurs écrits à la main qui testent le comportement plutôt que les détails d’implémentation [1]. Les prompts font environ la moitié de ceux de SWE-bench Pro alors que les solutions demandent 5,5 fois plus de code [1].

Mesure Opus 5SolFable 5Terra
Tâches résolues, % 74 73 70 70
Coût par tâche, $ 11,84 8,39 21,63 4,95 (Meilleure valeur de la ligne)
Tokens de sortie, K 118 60 (Meilleure valeur de la ligne) 119 72
Étapes de l'agent 99 61 (Meilleure valeur de la ligne) 88 76
Figure 3. DeepSWE v1.1 à effort maximal, le même mini-swe-agent pour chaque modèle. Datacurve, mis à jour le 25 juillet 2026.

La ligne des tâches résolues de la figure 3 est volontairement non marquée : 74 ± 4 contre 73 ± 3, c’est une égalité, et Datacurve lui-même prévient que les configurations de tête « se chevauchent souvent sur les intervalles de confiance » [1]. Les autres lignes, elles, séparent nettement. Sol a atteint le même résultat avec moitié moins de tokens de sortie, en 61 étapes contre 99 pour Opus 5, à 8,39 $ par tâche contre 11,84 $ [1]. Opus enquête plus longtemps. Sol livre plus tôt.

Terra est la ligne qui refixe les prix du marché : les mêmes 70 % que Fable 5 à 4,95 $ par tâche tentée contre 21,63 $ [1]. Divisez le coût par tentative par le taux de résolution, le plancher optimiste que j’avais utilisé sur les chiffres de Kimi K3, et une tâche résolue coûte 7,07 $ sur Terra et 30,90 $ sur Fable.

tâches résolues à effort maximal
70 %
au niveau de Fable 5 max
mesuré, par tâche tentée
4,95 $
Fable 5 max : 21,63 $
dérivé, par tâche résolue
7,07 $
le moins cher des quatre à max
Figure 4. Ce que la ligne DeepSWE de Terra veut dire en argent. Coûts mesurés par Datacurve ; le chiffre par tâche résolue est mon arithmétique.

Max est de toute façon rarement le réglage rationnel sur ce tableau. Opus 5 à effort high tient 73 % ± 2 à 6,08 $, égalant Sol max pour moins d’argent ; Sol à xhigh tient 71 % ± 1 à 4,70 $, l’intervalle le plus serré près du sommet [1]. Fable ne bat jamais ici sa version moins chère : xhigh obtient les mêmes 70 % que max à 13,41 $ au lieu de 21,63 $ [1]. La propre frontière coût-score de Datacurve désigne comme configurations efficientes Opus 5 à max, Fable 5 à high et Sol à medium [1].

Un mainteneur fusionnerait-il vraiment ce patch ?

FrontierCode de Cognition pose exactement cette question, et elle rebat les cartes. Les tâches sont écrites par des mainteneurs des dépôts testés, les exécutions qui consultent des sources contenant la solution reçoivent zéro, et la notation couvre la justesse, la qualité des tests, le périmètre et les conventions du code [15]. Les meilleures configurations : Fable 5 xhigh à 53,5, Opus 5 medium à 53,4, Sol max à 47,5, Terra max à 41,3 [15].

Relisez cette liste. La meilleure qualité de patch d’Opus 5 sort de son deuxième niveau d’effort le plus bas.

  • Fable 5
  • Opus 5
  • Sol
Score FrontierCode par niveau d'effort pour Fable 5, Opus 5 et Sol Sol monte à chaque palier jusqu'à 47,5, Fable 5 culmine à xhigh avec 53,5, Opus 5 culmine à medium avec 53,4 et tombe à 43,6 à xhigh. 30 40 50 60 low medium high xhigh max
Afficher les données en tableau
Effort Fable 5Opus 5Sol
low 48,041,935,4
medium 49,853,439,9
high 52,748,045,1
xhigh 53,543,646,8
max 51,648,047,5
Figure 5. FrontierCode 1.1, jeu principal, par niveau d'effort. Données du classement Cognition, juillet 2026.

La figure 5 est le graphique le plus utile que j’aie trouvé de la semaine. Sol grimpe à chaque cran de la molette, de 35,4 à 47,5, donc plus d’effort achète à Sol un meilleur patch, de façon fiable [15]. Fable culmine à xhigh et rend 1,9 point à max [15]. Opus 5 culmine à medium avec 53,4, tombe à 43,6 à xhigh et ne se rattrape qu’à moitié à max [15]. La system card d’Anthropic imprime la même courbe et énonce elle-même l’ancre : meilleur score du jeu principal à medium [16].

Le mécanisme se voit dans la notation. FrontierCode note la discipline de périmètre [15] et vérifie les patrons d’implémentation interdits [16], et plus d’effort pousse un modèle à explorer plus, toucher plus, élargir plus. Sur un banc de recherche ouvert, c’est le but. Dans une pull request cadrée, cela se lit comme une dérive de périmètre. C’est la version benchmark de ce que j’écrivais quand Opus 5 a mené ma semaine : un excellent employé dont le chef s’assigne sans cesse du travail en plus.

Deux notes de bas de page avant de couronner Fable. L’écart de 0,1 point sur Opus 5 medium s’étale sur cinq exécutions par configuration et des taux de réussite identiques de 58,9 %, c’est donc du bruit ; les coûts, eux, n’en sont pas, à 13,09 $ par rollout pour Fable xhigh contre 4,30 $ pour Opus medium [15]. Et même le meilleur Sol reste sous le pire Fable : 47,5 contre 48,0 à low [15]. Sur la notation de qualité de merge, la pile Claude mène tout court, avec la réserve habituelle : Claude tournait dans Claude Code et GPT-5.6 dans Codex [15].

Les tableaux de spécialistes : compréhension, tests, refactoring

La famille SWE Atlas de Scale mesure ce qu’un taux de résolution cache, et c’est là que les quatre profils se séparent le plus.

Codebase QnA confie à l’agent un vrai dépôt dans un conteneur et 124 questions qui exigent d’exécuter le logiciel et de tracer l’exécution, pondérées vers l’architecture (35 %) et l’analyse de cause racine (30 %) [17]. Scale Labs note Sol à xhigh dans Codex à 46,0 ± 5,0, Fable 5 à 39,0 ± 5,0 dans Claude Code, et signale que les deux modèles ont refusé des questions bénignes qui déclenchaient des filtres de sécurité, refus comptés comme zéro [17]. Ni Opus 5 ni Terra n’ont de ligne. Tout le tableau est dominé par la génération précédente : Opus 4.8 à 57,26 [17].

Exécutées par un autre labo, les mêmes 124 questions s’inversent. Dans le Coding Agent Index d’Artificial Analysis, Opus 5 xhigh signe la meilleure composante SWE-Atlas-QnA à 54,8, devant les 48,9 de Fable, avec Sol max à 43,3 [18]. Même jeu de tâches, exécutions différentes, ordre inverse. Gardez cela pour la section suivante.

Test Writing est le plus malin : 90 tâches où les tests générés doivent passer contre la vraie implémentation, puis échouer une fois le code concerné muté, si bien que les tests creux ne rapportent rien [19]. Fable 5 mène à 55,6 ± 5,8 contre 45,9 ± 6,0 pour Sol, même si le classement par intervalles du tableau liste encore les deux au rang 1 [19].

  • Fable 5
  • Sol
Scores SWE Atlas en Codebase QnA et Test Writing Sol mène la compréhension de code 46,0 à 39,0, Fable 5 mène l'écriture de tests 55,6 à 45,9. Codebase QnA 39,0 46,0 Test Writing 55,6 45,9
Afficher les données en tableau
Benchmark Fable 5Sol
Codebase QnA 39,046,0
Test Writing 55,645,9
Figure 6. Scores SWE Atlas, Fable 5 (Claude Code, xhigh) contre Sol (Codex, xhigh). Scale Labs, 28 juillet 2026.

Les deux tableaux de la figure 6 pointent dans des directions opposées, et c’est le profil en miniature : sur l’exécution de Scale, Sol lit un système inconnu un peu mieux, Fable le teste nettement mieux.

Le refactoring est la victoire la plus nette de Fable : 54,76 ± 6,76, en tête d’un tableau dont les 70 tâches couvrent décomposition, évolution d’interfaces, extraction et déplacement, et dont les correcteurs traquent régressions, sites d’appel cassés, dépendances circulaires et code mort oublié [20]. Aucune ligne Opus 5, Sol ou Terra n’existe ; la meilleure configuration GPT listée est le GPT-5.5 de la génération précédente à 44,79 [20]. Une ligne absente n’est pas un zéro. Mais le résultat en vigueur appartient à Fable.

Terminaux, VM et les problèmes vraiment durs

Terminal-Bench 2.1 mesure si un modèle peut conduire un shell jusqu’à un état final vérifié, et le sommet est une photo-finish. Sur l’exécution indépendante d’Artificial Analysis, Sol à xhigh mène avec 89,5 %, Opus 5 max affiche 89,1 %, et trois configurations, Sol max, Terra max et Opus 5 xhigh, tombent sur un 88,0 % identique [21]. Avec 89 tâches et trois répétitions [12], un seul essai qui bascule déplace un score d’environ 0,4 point. Fable 5 suit à 84,6 % [21].

Scores Terminal-Bench v2.1, meilleure configuration par modèle Sol xhigh mène à 89,5 pour cent, Opus 5 max à 89,1, Terra max à 88,0, Fable 5 max à 84,6. Sol xhigh 89,5 % Opus 5 max 89,1 % Terra max 88,0 % Fable 5 max 84,6 %
Afficher les données en tableau
Configuration Valeur
Sol xhigh 89,5 %
Opus 5 max 89,1 %
Terra max 88,0 %
Fable 5 max 84,6 %
Figure 7. Terminal-Bench v2.1, meilleure configuration par modèle. Artificial Analysis, relevé le 30 juillet 2026.

L’enseignement de la figure 7 : la couronne du terminal est une erreur d’arrondi partagée par trois modèles, et Fable est le seul visiblement derrière. Notez que Terra tient le rythme des vaisseaux amiraux ici, à 2,50 $ par million de tokens d’entrée [2] [21]. La table de lancement d’OpenAI raconte une histoire proche avec d’autres chiffres, Sol 88,8 %, Terra 87,4 %, Fable 5 83,1 % [7], et le désaccord entre exécutions maison et indépendantes est à peu près de la taille des écarts qu’on se dispute.

FrontierBench v0.1 est le successeur, construit par la même équipe : 74 tâches plus dures penchant vers la biologie computationnelle, la simulation physique, la CAO, les preuves formelles et le travail de performance GPU [16]. Anthropic l’a fait tourner sur mini-swe-agent et rapporte Opus 5 à 44,4 % à effort xhigh, son meilleur résultat, avec max dans le bruit à 43 % et high à 39 % pour 19 % de tokens de sortie en moins ; Sol atterrit à 37,5 % et Fable 5 à 33,7 %, tous deux à max [16]. Sur des problèmes réellement ouverts, Opus 5 mène les quatre sans discussion.

Deux tableaux voisins complètent le versant agentique. Sur OSWorld 2.0, où le modèle pilote une vraie VM Ubuntu à la souris et au clavier pendant jusqu’à 500 actions par tâche, Opus 5 obtient 70,6 %, Fable 5 66,1 % et Sol 62,6 %, le chiffre de Sol étant repris du billet de lancement d’OpenAI [16]. Sur AutomationBench de Zapier, une entreprise simulée avec 47 applications et des règles métier en couches, Opus 5 max obtient 26,0 % et Opus 5 medium 24 % à 0,89 $ par tâche, contre 18,1 % pour Sol et 17,4 % pour Fable [16]. Plus l’environnement est brouillon et outillé, plus Opus creuse l’écart. Et medium continue de faire honte à max.

Comment lire un leaderboard en 2026 ?

Comme la mesure d’un modèle portant un agent donné à un effort donné sous un correcteur donné. Changez l’un des trois et le chiffre bouge, parfois plus que la distance entre la première et la quatrième place. Cinq habitudes gardent la lecture honnête.

L’habitudeLa pièce à conviction dans cette comparaison
Demander quel harness a tournéSWE-bench Pro lit Fable 80,0, Opus 5 79,2, Sol 64,6, chaque éditeur dans son propre agent [16] ; l’agent partagé de DeepSWE compresse les mêmes modèles en quatre points [1]
Respecter les barres d’erreur74 ± 4 contre 73 ± 3 [1] ; trois égalités exactes à 88,0 % [21] ; une avance de 0,1 point sur cinq exécutions [15]
Repérer la saturationOpus 5 obtient 96,0 % sur SWE-bench Verified [16] ; un tableau sans marge ne classe rien
Vérifier la versionLa page de lancement d’OpenAI cite le Coding Agent Index v1.1 avec Sol à 80 [7] ; le v1.3 en ligne note Sol max à 67 [18]
Absent ne veut pas dire zéroOpus 5 n’a de ligne sur aucun des trois tableaux de Scale [17] [19] [20] ; Terra n’existe presque pas hors DeepSWE et FrontierCode

La ligne des versions mérite une phrase de plus, parce que c’est la plus sournoise. Un 80 en v1.1 et un 67 en v1.3 décrivent la même famille de modèles sur l’indice du même nom et ne sont pas comparables du tout ; DeepSWE a pareillement renoté GPT-5.5 xhigh de 70 % à 67 % entre ses jeux v1 et v1.1 [1]. Un nom de benchmark sans numéro de version, c’est une impression.

Même les sources primaires vacillent. La table récapitulative de la system card d’Opus 5 étiquette l’exécution FrontierBench de Sol comme Codex alors que son texte de méthode dit mini-swe-agent sur la même infrastructure, et le document ne tranche pas la contradiction [16]. Sa victoire sur SWE-bench Multimodal, 59,4 contre 54,1 pour Fable, sort d’un harness interne modifié à partir du harness public [16]. Scale, de son côté, accorde aux nouvelles lignes mini-swe-agent 500 étapes là où les anciennes en avaient 250, et observe que les modèles frontière réussissent simplement mieux sur leurs échafaudages natifs [17]. Rien de tout cela n’est de la fraude. C’est à quoi ressemble la mesure d’un système en mouvement, et c’est pourquoi le contrôle du battage autour de Kimi K3 et GLM-5.2 arrivait à la même conclusion depuis d’autres données : les affirmations de capacité survivent à l’examen, celles de comparabilité rarement.

Quel modèle pour quel travail ?

Terra pour le volume routinier, Sol pour les objectifs connus, Opus 5 pour les problèmes inconnus, Fable 5 pour les changements qui doivent fusionner proprement. Voilà ce que les profils ci-dessus additionnent, et le réglage d’effort compte autant que le nom du modèle.

Le travailMon choixEffort
Endpoints routiniers, mappings, petits tests, configTerramedium ou high
Une pull request cadrée avec des critères d’acceptation clairsOpus 5medium
Implémenter un plan connu, corriger un bug reproductibleSolhigh
Trouver la cause racine d’une panne inconnueOpus 5high ou xhigh
Stratégie de tests pour une feature qui compteFable 5xhigh
Refactoring à l’échelle du dépôt et migrations d’interfacesFable 5xhigh
Longues sessions de terminal et de débogageSol ou Opus 5high ou xhigh
Ingénierie ouverte sans solution connueOpus 5xhigh

Aucun de ces tableaux n’a tourné sur mon stack, et aucun sur le vôtre : la table est une inférence à partir des profils, pas une mesure. Les règles d’effort, elles, sont mesurées. Sol est le seul des quatre dont la qualité de merge a monté à chaque cran de la molette [15]. Fable plafonne à xhigh sur les tableaux qu’il domine [15] [19]. Opus 5 veut la molette assortie au travail : medium pour un changement cadré [15], xhigh quand le problème est réellement ouvert [16]. Les docs des deux éditeurs collent à leurs courbes : OpenAI appelle medium le départ équilibré [3], Anthropic met high par défaut et traite max comme l’exception qui doit justifier sa facture de tokens [6].

Trois résultats redessineraient cette table : une ligne Opus 5 sur les tableaux de Scale, un balayage d’effort public pour Fable 5, et n’importe lequel de ces quatre modèles mesuré dans le harness de l’éditeur d’en face. D’ici là, achetez le profil, pas le rang. Le modèle le plus cher de cette comparaison n’est pas le meilleur sur la plupart des travaux, le moins cher en talonne la moitié de façon gênante, et le changement de configuration le plus rentable ne coûte rien du tout : baisser la molette d’effort.

Sources

  1. DeepSWE leaderboardDatacurve · 2026-07-25
  2. API modelsOpenAI Developers
  3. Latest model guideOpenAI Developers
  4. Models overviewClaude Platform Docs
  5. PricingClaude Platform Docs
  6. EffortClaude Platform Docs
  7. GPT-5.6OpenAI
  8. Codex modelsChatGPT Docs
  9. Claude Opus 5 analysisArtificial Analysis
  10. GPT-5.6 Sol analysisArtificial Analysis
  11. GPT-5.6 Terra analysisArtificial Analysis
  12. Intelligence benchmarking methodologyArtificial Analysis
  13. Claude Fable 5 analysisArtificial Analysis
  14. Opus 5: Fable 5 level intelligence at a lower cost per taskArtificial Analysis · 2026-07-24
  15. FrontierCode leaderboardCognition · 2026-07-07
  16. Claude Opus 5 system cardAnthropic on alphaXiv · 2026-07-24
  17. SWE Atlas: Codebase QnAScale Labs · 2026-07-28
  18. Coding Agent IndexArtificial Analysis
  19. SWE Atlas: Test WritingScale Labs · 2026-07-28
  20. SWE Atlas: RefactoringScale Labs
  21. Terminal-Bench v2.1 evaluationArtificial Analysis