Releases

Fable 5.1 schlägt Fable 5. Opus bleibt schwer ersetzbar

Fable 5.1 liegt bei langen Agent-Aufgaben vor Fable 5, doch Opus 5 bleibt bei halbem Basispreis nah dran. Ich habe Benchmarks und erste Berichte geprüft.

Auf dieser Seite
  1. Was hat sich bei Fable 5.1 geändert?
  2. Schlägt Fable 5.1 Fable 5 und Opus 5?
  3. Warum der AutomationBench-Sieg mit 31,4 % zwei Modellen zuzuschreiben ist
  4. Ist Fable 5.1 günstiger als Fable 5 oder Opus 5?
  5. Was denken die ersten Nutzer von Fable 5.1?
  6. Solltest du von Fable 5 oder Opus 5 wechseln?

Anthropic veröffentlichte Claude Fable 5.1 am 1. September 2026. Gegenüber Fable 5 ist es ein echtes Upgrade, besonders bei lang laufender Agent-Arbeit, doch Opus 5 lässt sich nicht einfach ersetzen. Unabhängige Ergebnisse zeigen Fable 5.1 knapp vor Opus oder gleichauf mit ihm, obwohl die Basistarife für Input und Output doppelt so hoch sind. [1] [7] [9] [19]

Was hat sich bei Fable 5.1 geändert?

Fable 5.1 behält dasselbe Kontextfenster, Ausgabelimit und denselben API-Basispreis wie Fable 5. Opus 5 hat dieselben Grenzwerte bei halb so hohen Basistarifen für Input und Output. Wichtig sind bessere Leistung bei lang laufenden Aufgaben, günstigere Cache-Lesezugriffe, ein neuerer Wissensstichtag und mehrere API-Regeln. Deshalb ist eine Migration mehr als ein Wechsel der Modell-ID. [2] [4] [5]

Anthropic nennt den Vorgänger Claude Fable 5, nicht Fable 5.0. Daher verwende ich hier die offizielle Bezeichnung. [4]

Spezifikation Fable 5.1Fable 5Opus 5
Kontextfenster 1M 1M 1M
Maximale Ausgabe 128K 128K 128K
Eingabe, $/MTok 10 10 5 (Bester Wert der Zeile)
Ausgabe, $/MTok 50 50 25 (Bester Wert der Zeile)
Cache-Lesezugriff, $/MTok 0,25 (Bester Wert der Zeile) 1,00 0,50
Standard-Effort high high high
Wissensstichtag Juni 2026 Januar 2026 Mai 2026
Abbildung 1. Aktuelle Modellspezifikationen und API-Listenpreise. Claude Platform Docs, 2. September 2026.

Abbildung 1 zeigt, warum Anthropics eigene Empfehlung wichtig ist. Das Unternehmen bezeichnet Fable 5.1 als sein leistungsfähigstes allgemein verfügbares Modell, empfiehlt Entwicklern jedoch, für die meisten Workloads mit Opus 5 zu beginnen und erst zu Fable zu wechseln, wenn Opus auch mit höherem Effort nicht reicht. [2] Fable ist für schwierigere Fälle gedacht und nicht einfach die Standardwahl, weil seine Versionsnummer höher ist.

Die Preisänderung fällt kleiner aus, als es die Ankündigung nahelegt. Fable 5.1 kostet weiterhin 10 US-Dollar je Million Input-Token und 50 US-Dollar je Million Output-Token, genau wie Fable 5. Der Preis für Cache-Lesezugriffe fällt um 75 %, von 1 auf 0,25 US-Dollar. Anthropic schätzt, dass derselbe Workload-Mix im August etwa 25 % weniger gekostet hätte. Bei Agent-Arbeit mit starkem Cache-Einsatz könnten die Einsparungen bis fast 45 % reichen, doch diese Schätzung hängt von Wiederverwendung und dem Aufgabenverlauf ab. [1] Eine Anfrage, die frischen Kontext einmal liest und eine lange Antwort ausgibt, erhält keinen Rabatt von 75 % auf ihre Hauptkosten.

Auch jenseits der Tabelle hat sich das Produkt verändert. Fable 5.1 kann den Effort für jede Nachricht variieren, Systemanweisungen für einzelne Turns akzeptieren und sichtbare Fortschrittsmeldungen zwischen Tool-Aufrufen senden. Anthropic dokumentiert außerdem kompaktere Texte, weniger vorhersehbaren parallelen Tool-Einsatz und die Tendenz, ganze Dateien umzuschreiben, statt kleine Änderungen vorzunehmen. [6] Für Agenten, die Code schreiben, sind das keine Nebenpunkte. Sie bestimmen, wie sich ein gutes Ergebnis anfühlt, während jemand wartet, prüft oder einen Lauf stoppen will.

Schlägt Fable 5.1 Fable 5 und Opus 5?

Fable 5.1 schlägt Fable 5 klar in den aussagekräftigsten vergleichbaren Agenten-Benchmarks, die ich gefunden habe. Von Opus 5 setzt es sich nicht klar ab. Der Abstand zu Opus reicht von einem großen Vorsprung in einem von Anthropic durchgeführten Wissenschafts-Benchmark bis zu einem faktischen Gleichstand in unabhängigen Tests zu Software und professioneller Arbeit.

Evaluation Fable 5.1Fable 5Opus 5
Terminal-Bench-Science 0.1, % 52,6 (Bester Wert der Zeile) 24,7 29,0
CursorBench 3.2 max, % 73,4 70,5 70,0
GDPval-AA v2, Elo 1.853 1.723 1.824
APEX-SWE max, % 63,6 58,8 63,7
FrontierCode Main, Bestwert 50,9 53,5 53,4
Abbildung 2. Ausgewählte Ergebnisse derselben Modellversionen, verfügbar am 2. September 2026. Die Zeilen verwenden unterschiedliche Einheiten und Harnesses. Vergleiche Modelle daher innerhalb einer Zeile, nicht zwischen Zeilen.

Die erste Zeile zeigt den größten Fortschritt, stammt aber von Anthropic. Im Setup des Unternehmens mit Claude Code --bare und maximalem Effort löste Fable 5.1 52,6 % von 70 wissenschaftlichen Terminal-Aufgaben, verglichen mit 24,7 % für Fable 5 und 29,0 % für Opus 5. Der Standardfehler lag je nach Modell bei ungefähr 3,5 bis 4,5 Prozentpunkten. Der Vorsprung von Fable 5.1 ist in diesem Setup also deutlich größer als die gemeldete Unsicherheit. [3] Als ich nachsah, listete die öffentliche Terminal-Bench-Science-Bestenliste Fable 5.1 noch nicht. Deshalb beschreibe ich dies als Anthropic-Ergebnis und nicht als Sieg auf einer öffentlichen Bestenliste.

Die unabhängigen Ergebnisse fallen nüchterner aus. Cursor sieht Fable 5.1 mit 73,4 % vorn, doch der Abstand beträgt 2,9 Punkte zu Fable 5 und 3,4 zu Opus. Cursor warnt, dass kleine Ergebnisunterschiede auf Varianz zwischen Läufen zurückgehen können, und die Aufgaben sind private Beispiele aus realen Cursor-Sitzungen. [7] [8] Artificial Analysis gibt Fable 5.1 im GDPval-AA v2 mit 1.853 Elo die höchste Wertung. Opus folgt mit 1.824, und ihre angezeigten Konfidenzintervalle überlappen sich. Fable 5 mit 1.723 liegt klarer zurück. [9]

Mercors APEX-SWE macht den Vergleich mit Opus noch klarer. Über alle 200 Softwarefälle hinweg erreicht Fable 5.1 63,6 % und Opus 63,7 %, deren Konfidenzintervalle jeweils mehr als sechs Punkte breit sind. Fable 5 landet bei 58,8 %. [19] Das ergibt ein nützliches Muster: Der Nachfolger entfernt sich von Fable 5, während Opus so nahe bleibt, dass Aufgabenform und Kosten die Wahl bestimmen.

Es gibt auch Gegenbelege. Cognitions FrontierCode prüft, ob Maintainer einen Patch akzeptieren würden. Dabei zählen seine Tests, sein Umfang und die Konventionen der Codebasis. Fable 5.1 erreicht auf dem Main-Set bei medium maximal 50,9. Das liegt unter den 53,5 von Fable 5 bei xhigh und den 53,4 von Opus 5 bei medium. [11] Anthropic sagt, dass ein höherer Fable-5.1-Effort nützliche, aber nicht verlangte Änderungen auslösen kann, die der Benchmark zu Recht als außerhalb des Umfangs wertet. [3] Mehr Arbeit führt nicht immer zu einem besseren Patch.

Warum der AutomationBench-Sieg mit 31,4 % zwei Modellen zuzuschreiben ist

Zapiers beste AutomationBench-Zeile zeigt ein eingesetztes System aus Fable 5.1 und Opus 5, keinen reinen Fable-Score. Nachdem der Sicherheitsklassifikator eingegriffen hatte, bearbeitete Opus 260 von 657 Aufgaben, und Zapier zählt diese Abschlüsse zum Ergebnis von 31,4 %. [12]

strikte Abschlussquote
31,4 %
Fable 5.1 plus Opus-5-Fallback
von Opus bearbeitete Aufgaben
260/657
rund 40 % der Evaluation
angezeigte Kosten pro Aufgabe
2,45 $
Fallback-Token nicht enthalten
Abbildung 3. Was Zapiers führende AutomationBench-Zeile enthält. Fable 5.1 mit Opus-5-Fallback, Version 1.0.6.

Das ist kein Grund, das Ergebnis zu verwerfen. AutomationBench misst, ob ein Agent ein simuliertes Unternehmen nach der Arbeit mit 47 Tools im korrekten Zustand hinterlässt, und die Prüfungen des Endzustands sind deterministisch. Das kombinierte System führt die Rangliste an, weil es mehr dieser Workflows abschließt. Problematisch wird es erst, wenn die Zeile auf „Fable 5.1 erreicht 31,4 %“ verkürzt wird.

Fables Schutzmechanismen sind Teil des Produkts. Anthropic sagt, dass Biologie-Anfragen zu Opus 5 und manche Anfragen zur Cybersicherheit zu Opus 4.8 geleitet werden können. [1] In Zapiers Evaluation gibt Opus die Kontrolle dann an Fable zurück, damit die Aufgabe abgeschlossen wird. Die angezeigten Kosten von 2,45 $ enthalten die Fable-Nutzung, aber keine Fallback-Token. Deshalb erlauben sie keinen sauberen Kostenvergleich mit eigenständigem Opus bei 1,27 $ pro Aufgabe. [12]

Dasselbe Problem zeigt sich an anderer Stelle weniger auffällig. Artificial Analysis bezeichnet seine Fable-5.1-Einträge als „Default Fallback“, einschließlich der GDPval-Zeile auf Platz eins. [9] Für einen Entwickler, der das öffentliche Modell auswählt, ist das eingesetzte System wichtig. Wer wissen will, welches Modell für sich genommen die besseren Schlüsse zieht, braucht ein anderes Experiment.

Ist Fable 5.1 günstiger als Fable 5 oder Opus 5?

Fable 5.1 bietet meist mehr fürs Geld als Fable 5, wenn ein Workload Kontext wiederverwendet, doch Opus 5 bleibt nach Listenpreis günstiger. Die Gesamtkosten im Vergleich zu beiden Modellen hängen von Token, Cache-Treffern, Agent-Schritten, Effort und Fallback-Verhalten ab.

Cursors max-Lauf zeigt, wie gut das Upgrade im besten Fall ausfallen kann. Fable 5.1 erreicht 73,4 % für 9,64 $ je versuchter Aufgabe, während Fable 5 70,5 % für 17,32 $ erreicht. Fable 5.1 verbraucht 72.060 Token statt 103.525, etwa 30 % weniger. Innerhalb dieses Harness ist es damit besser und 44 % günstiger. Opus erreicht 70,0 % für 8,23 $ und 61.838 Token. [7]

Im neunteiligen Intelligenzindex von Artificial Analysis zeigt sich das umgekehrte Tokenmuster. Der Lauf von Fable 5.1 mit max nutzt etwa 45.236 Output-Token und kostet 3,69 $ pro Aufgabe. Fable 5 nutzt etwa 35.565 und kostet 3,14 $, während Opus etwa 40.249 nutzt und 2,34 $ kostet. Fable 5.1 braucht 285 Sekunden bis zur ersten Antwort, gegenüber 121 für Fable 5 und 60 für Opus. [10]

Keine der beiden Evaluationen muss falsch liegen. Cursor testet mehrdeutige Programmieraufgaben mit mehreren Dateien in seinem Produktions-Agenten, während Artificial Analysis Coding, Wissenschaft, allgemeine Denkaufgaben und professionelle Agent-Arbeit verbindet. Ihre Prompts, Tools, Cache-Wiederverwendung, Abbruchregeln und Bewertungsmethoden unterscheiden sich. „Fable 5.1 verbraucht weniger Token“ ist in einem Harness wahr und im anderen falsch. In deinem System solltest du die Kosten pro Aufgabe messen, nicht nur den Tokenpreis.

Für Abo-Nutzer gilt ein anderer Preis. Fable 5.1 ist in kostenpflichtigen Claude-Tarifen verfügbar, aber Zugriff und wöchentliches Kontingent hängen vom Tarif und vom Nutzertyp ab. [17] Ein günstigerer API-Cache-Treffer sorgt nicht dafür, dass ein langer xhigh-Lauf in Claude Code nur wenig vom Wochenkontingent verbraucht.

Was denken die ersten Nutzer von Fable 5.1?

In Berichten vom 1. September 2026 gab es keinen verlässlichen Konsens. Die glaubwürdigen Erfahrungsberichte stützen drei vorläufige Eindrücke: Fable 5.1 kann bei schwieriger Arbeit länger dranbleiben, seine Antworten lassen sich leichter lesen als jene von Fable 5 oder Opus 5, und es kann mehr Zeit oder Kontingent verbrauchen, als Nutzer erwarteten.

Ich habe einen Hacker-News-Thread zum Launch mit 688 Kommentaren sowie sechs Reddit-Threads mit insgesamt 457 Kommentaren ausgewertet, die öffentlich sichtbar waren. Diese 1.145 Kommentare stammen von einer selbstselektierten Gruppe, wiederholen sich oft und enthalten viele Reaktionen auf die Ankündigung statt echte Modelltests. Ich nutzte sie, um Fehlermuster zu finden, nicht um die Stimmung zu berechnen. [15] [16]

Die positiven Erfahrungsberichte beschreiben schwierige Programmieraufgaben, die in einem Durchlauf fertig wurden, besseren Überblick auch bei langem Kontext und weniger falsche Eingriffe der Sicherheitsmechanismen. Ein Entwickler, der an einer realen C-Codebasis arbeitete, nannte 5.1 bei größeren geplanten Features einen weiteren Schritt nach vorn gegenüber Fable 5. Ein Reddit-Nutzer berichtete von einer funktionierenden C++-Anwendung, nachdem das Modell 50 Dateien generiert hatte. Keiner der beiden Beiträge enthält eine kontrollierte Vergleichsbasis oder ein Repository, das ich prüfen kann. Beide bleiben daher nützliche Anekdoten, keine Benchmark-Ergebnisse. [15] [16]

Die negativen Berichte sind genauso konkret. Mehrere Nutzer stießen an ein Fünf-Stunden-Limit, bevor eine lange erste Aufgabe fertig war. Ein Max-Nutzer sagte, eine ähnliche Multi-Agent-Arbeitslast habe bei Fable 5.1 42 % des Wochenkontingents verbraucht, gegenüber 20 % bei Fable 5. Bei der Textqualität widersprachen sich weitere Nutzer: Einer berichtete von wirrem Text nach langem Kontext, ein anderer fand ihn kürzer und klarer. [15] [16] Diese Berichte belegen weder den durchschnittlichen Kontingentverbrauch noch die allgemeine Schreibqualität, aber sie warnen davor, die Aussagen zum Launch als typische Erfahrung zu behandeln.

Zwei strukturierte frühe Tests ordnen die Berichte besser ein. CodeRabbit untersuchte 45 Code-Review-Aufgaben mit 105 bekannten Problemen. Fable 5.1 kam beim Recall auf 61,0 % gegenüber 61,9 % für Fable 5, während die Präzision von 32,8 % auf 37,3 % stieg und die Zahl der abschließenden Kommentare von 253 auf 166 fiel. Die Bearbeitung dauerte pro Aufgabe 18 Minuten und 38 Sekunden statt 12 Minuten und 32 Sekunden. CodeRabbit änderte die Review-Pipeline zwischen den Modellläufen. Das zeigt eine Tendenz, ist aber kein sauberer direkter Vergleich. [13]

Every testete Fable 5.1 eine Woche vor dem Release und fand Agent-Ausgaben, die mit Opus 5 vergleichbar waren. Dabei brauchte Fable 5.1 weniger als die Hälfte der Token und ungefähr 60 % der Zeit. Dieselbe Auswertung hält auch die wichtigen Fehler fest: Ein Limit von 1.000 Wörtern wurde mit 1.288 Wörtern überschritten, eine Anforderung von 8 bis 12 Zitaten ergab 43, und fünf von 27 überprüften Zitaten existierten nicht in der Quelle. Opus hielt die Ausgabelimits ein, überschritt aber zweimal das Zeitlimit. [14] Anthropic gewährte frühzeitigen Zugang, hatte jedoch keinen redaktionellen Einfluss. Das macht den Test nützlicher als einen Erfahrungsbericht zum Release, aber weniger unabhängig als einen verblindeten öffentlichen Test.

Mein Eindruck ist: Fable 5.1 hält bei schwierigen Aufgaben länger durch, aber man muss ihm weiterhin Grenzen setzen und das Ergebnis prüfen. Das Modell kann weiter kommen, bevor es scheitert. Das ist wertvoll, kann einen schlechten Lauf aber auch teurer machen.

Solltest du von Fable 5 oder Opus 5 wechseln?

Ich würde aktive Fable-5-Workloads nach einer Migrationsprüfung auf 5.1 umstellen, Opus 5 aber für gewöhnliches Programmieren als Standard behalten. Fable 5.1 verdient die teuren Aufgaben, bei denen ein kleiner Fähigkeitsgewinn eine verlorene Stunde oder einen zusätzlichen Review-Zyklus verhindern kann.

ArbeitslastMein StartmodellWarum
Abgegrenztes Feature oder reproduzierbarer BugOpus 5 bei medium oder highÄhnliche Benchmark-Ergebnisse, niedrigerer Basispreis und in einigen Patch-Tests mehr Disziplin
Langes Refactoring, wenn Opus nicht weiterkommtFable 5.1 bei highBessere Ergebnisse bei lang laufenden Aufgaben, ohne mit dem teuersten Effort zu starten
Wissenschaftliche Aufgaben im Terminal oder für die RechercheFable 5.1 bei high oder xhighDie größten dokumentierten Fortschritte zeigen sich bei langen Aufgaben mit Tools
Aufgaben mit strikten AusgabelimitsOpus 5Frühe Tests zeigen bessere Einhaltung von Mengen- und Formatvorgaben
Agent mit starker Cache-Nutzung und wiederholtem KontextFable 5.1Der Cache-Lesezugriff für 0,25 $ kann die Kosten pro Aufgabe verändern
Bestehende Fable-5-Integration mit bearbeitbarem GesprächsverlaufFable 5 bis zur MigrationThinking-Blöcke von Fable 5.1 bringen neue Regeln für den Gesprächsverlauf

Die Migrationsprüfung ist wichtig. Fable 5.1 weist erzwungene tool_choice-Werte wie any oder ein benanntes Tool zurück, und sein adaptives Thinking lässt sich nicht deaktivieren. Ältere Claude-Modelle können Thinking-Blöcke von Fable 5.1 nicht lesen. Bei Konten, die am oder nach dem 31. August 2026 erstellt wurden, kann zudem das Bearbeiten des System-Prompts, der Tools oder eines früheren Turns signierte Thinking-Blöcke ungültig machen. [18] Ein Fallback von Fable 5.1 zu Opus kann deshalb sowohl den Gesprächszustand als auch das Modell ändern.

Ich würde auch nicht gleich mit max beginnen. Bei CursorBench steigt das Ergebnis von 69,4 % bei high auf 73,4 % bei max, während sich die Kosten pro Aufgabe von 4,80 $ auf 9,64 $ verdoppeln. [7] Anthropic warnt, dass gleiche Effort-Bezeichnungen bei unterschiedlichen Modellen nicht gleich viel internes Nachdenken bedeuten. [6] Die einzige nützliche Einstellung ist die niedrigste, die die Abnahmekriterien an deinen eigenen Aufgaben erfüllt.

Fable 5.1 ist der stärkste allgemein verfügbare Claude für Arbeit, die das letzte bisschen Ausdauer braucht. Opus 5 bleibt die leichter zu begründende Standardwahl. Ich würde zuerst eine lange, teure Arbeitslast umstellen, akzeptierte Ergebnisse, Cache-Wiederverwendung und Kontingentverbrauch messen und erst dann die Standardwahl ändern.

Quellen

  1. Introducing Claude Fable 5.1 and Claude Mythos 5.1Anthropic · 2026-09-01
  2. Claude Fable 5.1Claude Platform Docs · 2026-09-01
  3. Claude Fable 5.1 and Claude Mythos 5.1 system cardAnthropic · 2026-09-01
  4. Claude Fable 5Claude Platform Docs
  5. Claude Opus 5Claude Platform Docs
  6. Prompting Claude Fable 5.1Claude Platform Docs · 2026-09-01
  7. CursorBench 3.2Cursor
  8. How we compare model quality in CursorCursor · 2026-03-11
  9. GDPval-AA v2 leaderboardArtificial Analysis
  10. Claude Fable 5.1 model analysisArtificial Analysis · 2026-09-01
  11. FrontierCode 1.1Cognition · 2026-07-07
  12. AutomationBench leaderboardZapier
  13. Fable 5.1 review: Should you switch?CodeRabbit · 2026-09-01
  14. Vibe Check: Fable 5.1Every · 2026-09-01
  15. Claude Fable 5.1 and Claude Mythos 5.1 discussionHacker News · 2026-09-01
  16. Claude Fable 5.1 just droppedReddit, r/ClaudeCode · 2026-09-01
  17. Claude Fable models on your planAnthropic Help Center · 2026-09-01
  18. Migrating to Claude Fable 5.1 and Claude Mythos 5.1Claude Platform Docs · 2026-09-01
  19. APEX-SWE leaderboardMercor