Fable 5.1 bat Fable 5. Opus reste difficile à remplacer
Fable 5.1 bat Fable 5 sur les longues tâches d’agents. Opus 5 reste proche, avec des tarifs de base réduits de moitié. J’ai vérifié les benchmarks et les avis.
Sur cette page
- Qu’est-ce qui change dans Fable 5.1 ?
- Fable 5.1 bat-elle Fable 5 et Opus 5 ?
- Pourquoi la victoire à 31,4 % dans AutomationBench concerne deux modèles
- Fable 5.1 coûte-t-elle moins cher que Fable 5 ou Opus 5 ?
- Que pensent les premiers utilisateurs de Fable 5.1 ?
- Faut-il passer de Fable 5 ou d’Opus 5 à Fable 5.1 ?
Anthropic a lancé Claude Fable 5.1 le 1er septembre 2026. Fable 5.1 est une vraie amélioration par rapport à Fable 5, surtout sur les longues tâches d’agents, mais pas un remplacement évident d’Opus 5. Les résultats indépendants placent Fable 5.1 légèrement devant Opus ou à égalité avec lui, tandis que ses tarifs de base pour l’entrée et la sortie sont deux fois plus élevés. [1] [7] [9] [19]
Qu’est-ce qui change dans Fable 5.1 ?
Fable 5.1 conserve la même fenêtre de contexte, limite de sortie et tarif de base de l’API que Fable 5. Opus 5 a les mêmes limites pour la moitié du tarif de base, en entrée comme en sortie. Les changements qui comptent sont de meilleures performances sur des tâches longues, une lecture de cache moins chère, une date limite des connaissances plus récente et plusieurs règles d’API qui font de la migration autre chose qu’un simple changement d’identifiant de modèle. [2] [4] [5]
Anthropic appelle le modèle précédent Claude Fable 5, et non Fable 5.0. J’emploie donc le nom officiel. [4]
| Caractéristique | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Fenêtre de contexte | 1M | 1M | 1M |
| Sortie maximale | 128K | 128K | 128K |
| Entrée, $/MTok | 10 | 10 | 5 (Meilleure valeur de la ligne) |
| Sortie, $/MTok | 50 | 50 | 25 (Meilleure valeur de la ligne) |
| Lecture du cache, $/MTok | 0,25 (Meilleure valeur de la ligne) | 1,00 | 0,50 |
| Effort par défaut | high | high | high |
| Date limite des connaissances | juin 2026 | janv. 2026 | mai 2026 |
La figure 1 explique pourquoi la recommandation d’Anthropic compte. L’entreprise présente Fable 5.1 comme son modèle le plus capable parmi ceux disponibles de façon générale, mais conseille aux développeurs de commencer avec Opus 5 pour la plupart des charges de travail, puis de passer à Fable seulement si Opus utilisé avec un effort plus élevé reste insuffisant. [2] Fable est l’option pour les cas où il faut aller plus loin, pas le choix par défaut masqué par un numéro plus grand.
La baisse annoncée est plus limitée que le langage du lancement ne le laisse penser. Fable 5.1 coûte toujours 10 $ par million de tokens en entrée et 50 $ en sortie, exactement comme Fable 5. Son tarif de lecture du cache baisse de 75 %, de 1 $ à 0,25 $. Anthropic estime que son mix de charges d’août coûterait environ 25 % moins cher, avec des économies qui approcheraient 45 % pour un travail d’agent utilisant beaucoup le cache, mais cette estimation dépend de la réutilisation et du comportement de la tâche. [1] Une requête qui lit une fois un contexte neuf et rédige une longue réponse ne bénéficie pas d’une remise de 75 % sur ses frais principaux.
Le produit a aussi évolué d’une manière que le tableau ne montre pas. Fable 5.1 peut varier l’effort à chaque message, accepter des instructions système propres à un tour de conversation et envoyer des mises à jour visibles de progression entre les appels d’outils. Anthropic documente aussi une prose plus dense, un recours moins prévisible aux appels d’outils parallèles et une tendance à réécrire des fichiers entiers au lieu de faire de petites modifications. [6] Ce ne sont pas des détails secondaires pour les agents de programmation. Pour la personne qui attend, relit ou tente d’arrêter une exécution, ils changent ce qu’un bon score signifie.
Fable 5.1 bat-elle Fable 5 et Opus 5 ?
Dans les évaluations d’agents comparables les plus solides que j’ai trouvées, Fable 5.1 bat clairement Fable 5. Elle ne se détache pas aussi clairement d’Opus 5. Son avance sur Opus va d’un large écart dans un benchmark scientifique mené par Anthropic à une quasi-égalité dans des tests indépendants de programmation et de tâches professionnelles.
| Évaluation | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science 0.1, % | 52,6 (Meilleure valeur de la ligne) | 24,7 | 29,0 |
| CursorBench 3.2 max, % | 73,4 | 70,5 | 70,0 |
| GDPval-AA v2, Elo | 1 853 | 1 723 | 1 824 |
| APEX-SWE max, % | 63,6 | 58,8 | 63,7 |
| FrontierCode Main, meilleur score | 50,9 | 53,5 | 53,4 |
La première ligne indique l’amélioration la plus marquée, mais elle provient d’Anthropic. Dans la configuration Claude Code --bare de l’entreprise avec l’effort max, Fable 5.1 a résolu 52,6 % de 70 tâches scientifiques de terminal, contre 24,7 % pour Fable 5 et 29,0 % pour Opus 5. L’erreur standard était d’environ 3,5 à 4,5 points de pourcentage par modèle. L’avance de Fable 5.1 dépasse donc largement l’incertitude signalée dans cette configuration. [3] Le classement public Terminal-Bench-Science ne répertoriait pas encore Fable 5.1 lorsque je l’ai consulté. C’est pourquoi je le présente comme un résultat d’Anthropic plutôt que comme une victoire dans un classement public.
Les résultats indépendants sont plus nuancés. Cursor place Fable 5.1 en tête à 73,4 %, mais son avance n’est que de 2,9 points sur Fable 5 et de 3,4 sur Opus. Cursor avertit que de petits écarts peuvent venir de la variabilité entre exécutions et que ses tâches sont des exemples privés issus de vraies sessions Cursor. [7] [8] Artificial Analysis attribue à Fable 5.1 la meilleure note de GDPval-AA v2, soit 1 853 Elo. Opus suit à 1 824, et leurs intervalles de confiance affichés se chevauchent. Fable 5, à 1 723, est plus nettement derrière. [9]
L’évaluation APEX-SWE de Mercor rend la comparaison avec Opus encore plus claire. Sur 200 cas de développement logiciel, Fable 5.1 obtient 63,6 % et Opus 63,7 %, avec des intervalles de confiance dont la largeur dépasse six points. Fable 5 atteint 58,8 %. [19] Ces chiffres montrent que Fable 5.1 devance nettement Fable 5, mais qu’Opus reste assez proche pour que la nature de la tâche et le coût décident du choix.
Il existe aussi des résultats contraires. FrontierCode de Cognition vérifie si les mainteneurs accepteraient un patch, en tenant compte des tests, du périmètre et des conventions du dépôt. Fable 5.1 atteint au mieux 50,9 sur l’ensemble principal à medium, en dessous de Fable 5 à 53,5 avec xhigh et d’Opus 5 à 53,4 avec medium. [11] Anthropic indique qu’un niveau d’effort plus élevé dans Fable 5.1 peut déclencher des modifications utiles mais non demandées, que le benchmark pénalise à juste titre parce qu’elles dépassent le périmètre. [3] En faire plus ne produit pas toujours un meilleur patch.
Pourquoi la victoire à 31,4 % dans AutomationBench concerne deux modèles
La première ligne d’AutomationBench chez Zapier mesure un système déployé associant Fable 5.1 et Opus 5, pas un score Fable seul. Opus a traité 260 des 657 tâches après l’intervention du classifieur de sécurité, et Zapier inclut ces réussites dans le résultat de 31,4 %. [12]
- taux de réussite strict
- 31,4 %
- Fable 5.1 avec relais vers Opus 5
- tâches traitées par Opus
- 260/657
- environ 40 % de l’évaluation
- coût affiché par tâche
- 2,45 $
- tokens du relais exclus
Ce n’est pas une raison d’écarter ce résultat. AutomationBench vérifie qu’un agent laisse une entreprise simulée dans le bon état après avoir utilisé 47 outils, et ses contrôles d’état final sont déterministes. Le système combiné est en tête parce qu’il mène à bien davantage de ces flux de travail. Le problème commence seulement lorsqu’on résume la ligne par « Fable 5.1 obtient 31,4 % ».
Les garde-fous de Fable font partie du produit. Anthropic indique que les demandes liées à la biologie peuvent être redirigées vers Opus 5 et que certaines demandes de cybersécurité le sont vers Opus 4.8. [1] Dans l’évaluation de Zapier, Opus rend ensuite la main à Fable pour terminer la tâche. Le coût affiché de 2,45 $ inclut la consommation de Fable mais exclut les tokens du relais. Il ne permet donc pas de comparer proprement le coût avec Opus seul, à 1,27 $ par tâche. [12]
Le même problème apparaît de façon moins évidente ailleurs. Artificial Analysis étiquette ses entrées Fable 5.1 « Default Fallback », y compris la ligne GDPval classée première. [9] Pour un développeur qui choisit un modèle accessible au public, c’est le système déployé qui compte. Ces résultats restent donc utiles. Mais pour savoir quel modèle raisonne le mieux par lui-même, il faut une autre expérience.
Fable 5.1 coûte-t-elle moins cher que Fable 5 ou Opus 5 ?
Fable 5.1 offre généralement un meilleur rapport coût-performance que Fable 5 lorsque la charge réutilise le contexte, mais Opus 5 reste moins cher au prix catalogue. Le coût de bout en bout de chaque modèle dépend des tokens, de la réutilisation du cache, du nombre d’étapes de l’agent, de l’effort et des relais éventuels.
L’exécution de Cursor avec l’effort max est le scénario le plus favorable à la mise à niveau. Fable 5.1 atteint 73,4 % pour 9,64 $ par tâche tentée, tandis que Fable 5 atteint 70,5 % pour 17,32 $. Fable 5.1 utilise 72 060 tokens au lieu de 103 525, soit environ 30 % de moins. Elle est donc à la fois meilleure et 44 % moins chère dans ce harness. Opus atteint 70,0 % pour 8,23 $ et 61 838 tokens. [7]
Artificial Analysis observe l’inverse pour les tokens dans son indice d’intelligence en neuf parties. Son exécution Fable 5.1 avec l’effort max utilise environ 45 236 tokens de sortie et coûte 3,69 $ par tâche. Fable 5 utilise environ 35 565 tokens et coûte 3,14 $, tandis qu’Opus utilise environ 40 249 tokens et coûte 2,34 $. Fable 5.1 met aussi 285 secondes avant sa première réponse, contre 121 pour Fable 5 et 60 pour Opus. [10]
Les deux évaluateurs peuvent avoir raison. Cursor teste des tâches de programmation multi-fichiers ambiguës dans son agent de production, alors qu’Artificial Analysis combine programmation, science, raisonnement général et travail d’agent professionnel. Leurs prompts, outils, réutilisation du cache, règles d’arrêt et critères de notation diffèrent. « Fable 5.1 utilise moins de tokens » est vrai dans un harness et faux dans un autre. C’est le coût par tâche, non le seul tarif par token, qu’il faut mesurer dans votre propre système.
Les abonnés paient un autre prix. Fable 5.1 est disponible dans les forfaits Claude payants, mais l’accès et le quota hebdomadaire varient selon le forfait et le type de licence. [17] Une lecture de cache API moins chère n’empêche pas une longue exécution de Claude Code à xhigh d’entamer fortement le quota hebdomadaire.
Que pensent les premiers utilisateurs de Fable 5.1 ?
Les rapports publiés le 1er septembre 2026 ne dégagent aucun consensus fiable. Les témoignages crédibles font ressortir trois impressions provisoires : Fable 5.1 peut tenir plus longtemps sur un travail difficile, elle peut être plus facile à lire que Fable 5 ou Opus 5, et elle peut consommer bien plus de temps ou de quota qu’attendu.
J’ai examiné un fil de lancement Hacker News comportant 688 commentaires et six fils Reddit dont les pages publiques affichaient 457 commentaires. Cet ensemble de 1 145 commentaires est auto-sélectionné, répétitif et rempli de personnes qui réagissent à l’annonce sans avoir essayé le modèle. Je l’ai utilisé pour repérer des modes d’échec, pas pour mesurer un sentiment. [15] [16]
Les commentaires positifs mentionnent du travail de programmation difficile terminé en une exécution, une meilleure capacité à se souvenir dans un long contexte et moins d’interventions de sécurité injustifiées. Un développeur travaillant sur un dépôt C réel a jugé que 5.1 faisait encore mieux que Fable 5 sur de grandes fonctionnalités planifiées. Un utilisateur Reddit a signalé une application C++ fonctionnelle après une génération de 50 fichiers. Aucun de ces messages ne fournit de point de comparaison contrôlé ni de dépôt que je puisse examiner. Ils restent donc des anecdotes utiles plutôt que des résultats de benchmark. [15] [16]
Les retours négatifs sont tout aussi concrets. Plusieurs utilisateurs ont atteint la limite de cinq heures avant qu’une première tâche longue soit terminée, et un utilisateur de l’offre Max a indiqué qu’une charge multi-agent semblable avait consommé 42 % du quota hebdomadaire avec Fable 5.1, contre 20 % avec Fable 5. Les avis divergent aussi sur la prose. L’un rapporte un texte brouillé après un long contexte, tandis qu’un autre le trouve plus court et plus clair. [15] [16] Ces comptes rendus ne permettent pas d’établir la consommation moyenne de quota ni la qualité de l’écriture, mais ils mettent en garde contre l’idée que les affirmations du lancement décrivent l’expérience par défaut.
Deux évaluations structurées apportent davantage de contexte à ces retours. CodeRabbit a évalué 45 tâches de revue de code contenant 105 problèmes connus. Fable 5.1 a atteint 61,0 % de rappel contre 61,9 % pour Fable 5, tandis que la précision est passée de 32,8 % à 37,3 % et que les commentaires finaux sont passés de 253 à 166. Fable 5.1 a aussi mis 18 minutes 38 secondes par tâche, au lieu de 12 minutes 32 secondes. CodeRabbit a modifié son pipeline de revue entre les passages des modèles. Ces résultats indiquent donc une direction plutôt qu’une comparaison directe nette. [13]
Every a testé Fable 5.1 pendant une semaine avant la sortie et a obtenu un résultat d’agent comparable à celui d’Opus 5 avec moins de la moitié des tokens et en environ 60 % du temps nécessaire à Opus 5. La même revue consigne les échecs qui comptent : une limite de 1 000 mots est devenue 1 288 mots, une demande de 8 à 12 citations en a produit 43, et cinq des 27 citations vérifiées n’existaient pas dans la source. Opus a respecté les limites de sortie, mais a dépassé le délai à deux reprises. [14] Anthropic a fourni un accès anticipé sans intervenir dans l’éditorial, ce qui rend ce test plus utile qu’un témoignage de lancement, mais moins indépendant qu’un test public à l’aveugle.
Mon avis est que Fable 5.1 tient mieux sur la durée que Fable, mais ne dispense toujours pas de fixer des limites et de vérifier le résultat. Le modèle peut maintenant aller plus loin avant d’échouer. C’est utile, mais cela peut aussi rendre une mauvaise exécution plus chère.
Faut-il passer de Fable 5 ou d’Opus 5 à Fable 5.1 ?
Je ferais passer les charges de travail actives sur Fable 5 à la version 5.1 après une vérification de migration, mais je conserverais Opus 5 comme choix par défaut pour la programmation ordinaire. Fable 5.1 se justifie pour les travaux coûteux où un petit gain de capacité peut éviter une heure perdue ou un cycle de revue supplémentaire.
| Charge de travail | Modèle de départ | Pourquoi |
|---|---|---|
| Fonctionnalité bien délimitée ou bug reproductible | Opus 5 à medium ou high | Résultats de benchmark proches, tarif de base inférieur et meilleure discipline dans certains tests de patch |
| Refactoring de grande ampleur lorsque Opus ne suffit pas | Fable 5.1 à high | Meilleurs résultats sur les tâches longues sans commencer avec l’effort le plus cher |
| Travail de terminal scientifique ou de recherche | Fable 5.1 à high ou xhigh | Ses plus grands gains documentés apparaissent dans les longs travaux utilisant des outils |
| Travail avec des limites strictes de sortie | Opus 5 | Les premiers tests montrent un meilleur respect des quantités et des formats |
| Agent utilisant beaucoup le cache avec un contexte répété | Fable 5.1 | Le tarif de 0,25 $ pour la lecture du cache peut changer le coût par tâche |
| Intégration Fable 5 existante avec historique modifiable | Fable 5 jusqu’à la migration | Les blocs de raisonnement Fable 5.1 imposent de nouvelles règles pour l’historique de conversation |
La vérification de migration compte. Fable 5.1 rejette les valeurs imposées de tool_choice, notamment any ou le nom d’un outil, et il est impossible de désactiver son raisonnement adaptatif. Les modèles Claude plus anciens ne peuvent pas lire les blocs de raisonnement de Fable 5.1. Pour les comptes créés à partir du 31 août 2026, modifier le prompt système, les outils ou un tour de conversation antérieur peut aussi invalider des blocs de raisonnement signés. [18] Un relais de Fable 5.1 vers Opus peut donc changer l’état de la conversation autant que le modèle.
Je commencerais aussi en dessous de max. Dans CursorBench, le score est de 69,4 % avec high et de 73,4 % avec max, tandis que le coût par tâche double, de 4,80 $ à 9,64 $. [7] Anthropic avertit que les niveaux d’effort ne représentent pas la même quantité de réflexion selon les modèles. [6] Le seul réglage d’effort utile est le plus bas qui satisfasse les critères d’acceptation dans vos propres tâches.
Fable 5.1 est le Claude le plus capable parmi ceux généralement disponibles quand le travail exige de la persistance. Opus 5 reste pourtant le choix par défaut le plus facile à justifier. Je commencerais par faire passer une seule charge de travail longue et coûteuse à Fable 5.1, puis mesurerais le résultat accepté, la réutilisation du cache et la consommation de quota. Je ne modifierais le choix par défaut qu’ensuite.
Sources
- Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Claude Fable 5.1
- Claude Fable 5.1 and Claude Mythos 5.1 system card
- Claude Fable 5
- Claude Opus 5
- Prompting Claude Fable 5.1
- CursorBench 3.2
- How we compare model quality in Cursor
- GDPval-AA v2 leaderboard
- Claude Fable 5.1 model analysis
- FrontierCode 1.1
- AutomationBench leaderboard
- Fable 5.1 review: Should you switch?
- Vibe Check: Fable 5.1
- Claude Fable 5.1 and Claude Mythos 5.1 discussion
- Claude Fable 5.1 just dropped
- Claude Fable models on your plan
- Migrating to Claude Fable 5.1 and Claude Mythos 5.1
- APEX-SWE leaderboard