Release

Fable 5.1 supera Fable 5. Opus è più difficile da sostituire

Fable 5.1 supera Fable 5 nei compiti lunghi svolti da agenti, ma Opus 5 resta vicino e ha tariffe base dimezzate. Ho verificato benchmark e primi report.

In questa pagina
  1. Cosa è cambiato in Fable 5.1?
  2. Fable 5.1 supera Fable 5 e Opus 5?
  3. Perché la vittoria al 31,4% in AutomationBench riguarda due modelli
  4. Fable 5.1 costa meno di Fable 5 o Opus 5?
  5. Cosa pensano i primi utenti di Fable 5.1?
  6. Dovresti passare da Fable 5 o Opus 5?

Anthropic ha rilasciato Claude Fable 5.1 il 1° settembre 2026. È un vero miglioramento rispetto a Fable 5, soprattutto nelle attività lunghe con agenti, ma non sostituisce Opus 5 senza compromessi. I risultati indipendenti collocano Fable 5.1 leggermente davanti a Opus o in parità con esso, ma le sue tariffe base per input e output sono il doppio. [1] [7] [9] [19]

Cosa è cambiato in Fable 5.1?

Fable 5.1 mantiene la stessa finestra di contesto, lo stesso limite di output e lo stesso prezzo base dell’API di Fable 5. Opus 5 offre gli stessi limiti a metà delle tariffe base per input e output. Le differenze che contano sono prestazioni migliori sul lungo orizzonte, letture dalla cache meno costose, una data limite delle conoscenze più recente e diverse regole API che rendono la migrazione più di un semplice cambio dell’ID del modello. [2] [4] [5]

Anthropic chiama il predecessore Claude Fable 5, non Fable 5.0, quindi qui uso il nome ufficiale. [4]

Specifica Fable 5.1Fable 5Opus 5
Finestra di contesto 1M 1M 1M
Output massimo 128K 128K 128K
Input, $/MTok 10 10 5 (Valore migliore della riga)
Output, $/MTok 50 50 25 (Valore migliore della riga)
Lettura dalla cache, $/MTok 0,25 (Valore migliore della riga) 1,00 0,50
Effort predefinito high high high
Data limite delle conoscenze giu 2026 gen 2026 mag 2026
Figura 1. Specifiche attuali dei modelli e prezzi API di listino. Claude Platform Docs, 2 settembre 2026.

La figura 1 mostra perché conta la raccomandazione di Anthropic. L’azienda definisce Fable 5.1 il suo modello generalmente disponibile più capace, ma dice agli sviluppatori di iniziare con Opus 5 per la maggior parte dei carichi di lavoro e di passare a Fable solo se Opus con effort più alto non basta. [2] Fable è l’opzione a cui passare quando serve più capacità, non il modello da scegliere automaticamente solo perché ha un numero più alto.

Il cambiamento di prezzo è più limitato di quanto faccia pensare il linguaggio del lancio. Fable 5.1 costa ancora $10 per milione di token in input e $50 per milione di token in output, esattamente come Fable 5. La tariffa per leggere dalla cache scende del 75%, da $1 a $0,25. Anthropic stima che il suo mix di carichi di lavoro di agosto costerebbe circa il 25% in meno, con risparmi vicini al 45% per il lavoro degli agenti con un forte riuso della cache, ma la stima dipende dal riuso della cache e dal tipo di attività. [1] Una richiesta che legge una volta un contesto nuovo e scrive una risposta lunga non ottiene il 75% di sconto sulle voci di costo principali.

Il prodotto è cambiato anche in modi che la tabella non mostra. Fable 5.1 può variare l’effort per messaggio, accettare istruzioni di sistema specifiche per singolo turno e inviare aggiornamenti visibili sullo stato di avanzamento tra una chiamata a uno strumento e l’altra. Anthropic documenta inoltre una prosa più densa, un uso parallelo degli strumenti meno prevedibile e la tendenza a riscrivere file interi invece di fare piccole modifiche. [6] Per gli agenti di coding questi dettagli contano. Determinano cosa significhi un buon punteggio per chi aspetta, revisiona il lavoro o cerca di interrompere un’esecuzione.

Fable 5.1 supera Fable 5 e Opus 5?

Fable 5.1 supera chiaramente Fable 5 nelle valutazioni più solide e comparabili sugli agenti che ho trovato. Non si stacca però con chiarezza da Opus 5. Il divario rispetto a Opus va da un ampio vantaggio in un benchmark scientifico eseguito da Anthropic a un pareggio pratico nei test indipendenti su software e lavoro professionale.

Valutazione Fable 5.1Fable 5Opus 5
Terminal-Bench-Science 0.1, % 52,6 (Valore migliore della riga) 24,7 29,0
CursorBench 3.2 max, % 73,4 70,5 70,0
GDPval-AA v2, Elo 1853 1723 1824
APEX-SWE max, % 63,6 58,8 63,7
FrontierCode Main, punteggio migliore 50,9 53,5 53,4
Figura 2. Risultati selezionati con le stesse versioni disponibili il 2 settembre 2026. Le righe usano unità e harness diversi, quindi confronta i modelli nella stessa riga, non tra righe.

La prima riga mostra il miglioramento più grande, ma il risultato proviene da Anthropic. Nella configurazione aziendale Claude Code --bare, con effort max, Fable 5.1 ha risolto il 52,6% di 70 compiti scientifici in terminale, contro il 24,7% di Fable 5 e il 29,0% di Opus 5. L’errore standard variava da circa 3,5 a 4,5 punti percentuali per modello, quindi il vantaggio di Fable 5.1 è molto più grande dell’incertezza riportata in questa configurazione. [3] Quando ho controllato, la classifica pubblica Terminal-Bench-Science non riportava ancora Fable 5.1. Per questo descrivo il dato come un risultato di Anthropic, non come una vittoria in una classifica pubblica.

I risultati indipendenti sono più equilibrati. Cursor colloca Fable 5.1 al primo posto con il 73,4%, ma il divario è di 2,9 punti rispetto a Fable 5 e di 3,4 rispetto a Opus. Cursor avverte che piccole differenze di punteggio possono riflettere la variabilità tra esecuzioni e che i suoi compiti sono esempi privati tratti da sessioni reali di Cursor. [7] [8] Artificial Analysis assegna a Fable 5.1 il punteggio GDPval-AA v2 più alto, 1.853 Elo. Opus segue con 1.824 e gli intervalli di confidenza mostrati si sovrappongono. Fable 5, con 1.723, è più chiaramente indietro. [9]

APEX-SWE di Mercor rende ancora più chiaro il confronto con Opus. Su 200 casi software, Fable 5.1 ottiene il 63,6% e Opus il 63,7%, con intervalli di confidenza di ampiezza superiore a sei punti. Fable 5 arriva al 58,8%. [19] È una dinamica utile: il successore si stacca da Fable 5, mentre Opus resta abbastanza vicino perché siano il tipo di compito e il costo a decidere la scelta.

Ci sono anche risultati in senso contrario. FrontierCode di Cognition verifica se chi mantiene un progetto accetterebbe una patch, inclusi test, ambito dell’intervento e convenzioni della codebase. Fable 5.1 raggiunge 50,9 sul set principale a medium, sotto il 53,5 di Fable 5 a xhigh e il 53,4 di Opus 5 a medium. [11] Anthropic afferma che un effort più alto di Fable 5.1 può attivare modifiche utili ma non richieste, che il benchmark penalizza correttamente perché escono dall’ambito previsto. [3] Fare più lavoro non produce sempre una patch migliore.

Perché la vittoria al 31,4% in AutomationBench riguarda due modelli

La prima riga di AutomationBench di Zapier è un sistema in produzione che combina Fable 5.1 e Opus 5, non un puro punteggio di Fable. Opus ha gestito 260 delle 657 attività dopo l’intervento del classificatore di sicurezza e Zapier include quei completamenti nel risultato del 31,4%. [12]

tasso di completamento rigoroso
31,4 %
Fable 5.1 con fallback a Opus 5
attività gestite da Opus
260/657
circa il 40% della valutazione
costo mostrato per attività
$2.45
token di fallback esclusi
Figura 3. Di cosa è composta la prima riga di AutomationBench di Zapier. Fable 5.1 con fallback a Opus 5, versione 1.0.6.

Non è un motivo per scartare il risultato. AutomationBench misura se un agente lascia un’azienda simulata nello stato corretto dopo aver usato 47 strumenti e le sue verifiche sullo stato finale sono deterministiche. Il sistema combinato è primo perché completa più di questi flussi di lavoro. Il problema nasce solo quando la riga viene ridotta a “Fable 5.1 ottiene il 31,4%.”

Le protezioni di Fable fanno parte del prodotto. Anthropic afferma che le richieste relative alla biologia possono essere instradate a Opus 5, mentre alcune richieste di cybersecurity vengono instradate a Opus 4.8. [1] Nella valutazione di Zapier, Opus restituisce poi il controllo a Fable per finire l’attività. Il costo mostrato di $2,45 include l’uso di Fable ma esclude i token del fallback, quindi non permette un confronto diretto dei costi con Opus usato da solo, a $1,27 per attività. [12]

La stessa questione appare in modo meno evidente altrove. Artificial Analysis contrassegna le proprie voci su Fable 5.1 con “Default Fallback”, compresa la riga GDPval al primo posto. [9] Uno sviluppatore che sceglie tra i modelli disponibili pubblicamente guarda al sistema in produzione, quindi questi risultati sono utili. Chi vuole capire quale modello ragioni meglio, isolato dai fallback, ha bisogno di un esperimento diverso.

Fable 5.1 costa meno di Fable 5 o Opus 5?

Fable 5.1 di solito conviene più di Fable 5 quando il carico di lavoro riusa il contesto, ma Opus 5 resta meno costoso a prezzo di listino. Per entrambi i modelli, il costo complessivo dell’attività dipende da token, cache hit, passaggi dell’agente, effort e comportamento del fallback.

L’esecuzione di Cursor con effort max è il caso più favorevole per l’aggiornamento. Fable 5.1 ottiene il 73,4% a un costo di $9,64 per attività tentata, mentre Fable 5 ottiene il 70,5% a $17,32. Fable 5.1 usa 72.060 token contro 103.525, circa il 30% in meno, quindi in questo harness ottiene un risultato migliore e costa il 44% in meno. Opus ottiene il 70,0% per $8,23 e 61.838 token. [7]

Artificial Analysis rileva un andamento opposto nell’uso dei token nel suo indice di intelligenza in nove parti. La sua esecuzione di Fable 5.1 a effort max usa circa 45.236 token in output e costa $3,69 per attività. Fable 5 ne usa circa 35.565 e costa $3,14, mentre Opus ne usa circa 40.249 e costa $2,34. Fable 5.1 impiega inoltre 285 secondi prima della prima risposta, contro 121 per Fable 5 e 60 per Opus. [10]

Non è necessario che uno dei due valutatori abbia torto. Cursor mette alla prova attività di programmazione su più file con requisiti ambigui nel proprio agente in produzione, mentre Artificial Analysis combina programmazione, scienza, ragionamento generale e lavoro professionale svolto da agenti. I prompt, gli strumenti, il riuso della cache, le regole di arresto e i valutatori sono diversi. “Fable 5.1 usa meno token” è vero in un harness e falso in un altro. Nel tuo sistema, il numero da misurare è il costo dell’attività, non la sola tariffa dei token.

Per gli abbonati c’è poi un altro costo. Fable 5.1 è disponibile sui piani Claude a pagamento, ma accesso e quota settimanale dipendono dal piano e dal tipo di postazione. [17] Un cache hit dell’API più economico non alleggerisce l’impatto di una lunga esecuzione di Claude Code a xhigh sulla quota settimanale.

Cosa pensano i primi utenti di Fable 5.1?

Nei report pubblicati il 1° settembre 2026 non emergeva un consenso affidabile. I resoconti più credibili suggeriscono tre impressioni provvisorie: Fable 5.1 può continuare a lavorare più a lungo su compiti difficili, può risultare più leggibile di Fable 5 o Opus 5 e può consumare molto più tempo o quota di quanto l’utente si aspetti.

Ho esaminato un thread di lancio su Hacker News con 688 commenti e sei thread Reddit con 457 commenti visibili nelle rispettive pagine pubbliche. Questo insieme di 1.145 commenti è auto-selezionato, ripetitivo e pieno di persone che reagiscono all’annuncio invece di usare il modello. L’ho usato per individuare tipi di errore, non per calcolare il sentiment. [15] [16]

I commenti positivi di chi l’ha usato parlano di compiti di programmazione difficili conclusi in una sola esecuzione, di una migliore capacità di ricordare informazioni in contesti molto lunghi e di minori interventi di sicurezza ingiustificati. Uno sviluppatore che lavora su una codebase C reale ha definito 5.1 un altro passo avanti rispetto a Fable 5 per funzionalità più ampie già pianificate. Un utente Reddit ha segnalato un’applicazione C++ funzionante dopo aver generato 50 file. Nessuno dei due post include un confronto controllato o un repository che posso ispezionare, quindi restano aneddoti utili e non risultati di benchmark. [15] [16]

I report negativi sono altrettanto concreti. Diversi utenti hanno raggiunto un limite di cinque ore prima che finisse il loro primo compito lungo e un utente del piano Max ha detto che un carico di lavoro multi-agente simile ha consumato il 42% della quota settimanale con Fable 5.1 contro il 20% con Fable 5. Altri utenti hanno espresso pareri discordanti sulla prosa: uno ha riferito di testo confuso dopo un contesto molto lungo, un altro l’ha trovata più breve e più chiara. [15] [16] Questi resoconti non stabiliscono il consumo medio della quota né la qualità della scrittura, ma mettono in guardia dal trattare le promesse del lancio come se descrivessero l’esperienza standard.

Due test iniziali più strutturati danno più contesto a questi report. CodeRabbit ha valutato 45 compiti di code review con 105 problemi noti. Fable 5.1 ha raggiunto un recall del 61,0% contro il 61,9% di Fable 5, mentre la precisione è salita dal 32,8% al 37,3% e i commenti finali sono scesi da 253 a 166. Ha inoltre impiegato 18 minuti e 38 secondi per attività invece di 12 minuti e 32 secondi. CodeRabbit ha cambiato la pipeline di revisione tra le esecuzioni dei modelli, quindi offre un’indicazione, non un confronto diretto in condizioni comparabili. [13]

Every ha testato Fable 5.1 per una settimana prima del lancio e ha trovato un output dell’agente comparabile a Opus 5 con meno della metà dei token e in circa il 60% del tempo richiesto. La stessa recensione registra gli errori che contano: un limite di 1.000 parole ha prodotto un testo di 1.288 parole, una richiesta da 8 a 12 citazioni ne ha prodotte 43 e cinque delle 27 citazioni verificate non comparivano nella fonte. Opus ha rispettato i limiti di output, ma ha esaurito il tempo due volte. [14] Anthropic ha fornito l’accesso anticipato, ma non ha avuto alcun intervento editoriale. Questo rende la recensione più utile di una testimonianza di lancio e meno indipendente di un test pubblico alla cieca.

La mia lettura è che Fable 5.1 ha migliorato la capacità di Fable di continuare a lavorare, ma non ha eliminato la necessità di fissare limiti e controllare il risultato. Il modello può ora spingersi oltre prima di fallire. È utile, ma può anche rendere più costosa un’esecuzione andata male.

Dovresti passare da Fable 5 o Opus 5?

Migrerei i carichi di lavoro attivi da Fable 5 a 5.1, dopo una verifica della migrazione, ma terrei Opus 5 come predefinito per la programmazione normale. Fable 5.1 merita i compiti costosi, dove un piccolo aumento di capacità può evitare un’ora persa o un ulteriore ciclo di revisione.

Carico di lavoroModello da cui partireiPerché
Funzionalità ben delimitata o bug riproducibileOpus 5 a medium o highRisultati di benchmark vicini, tariffa base inferiore e migliore disciplina in alcuni test sulle patch
Refactoring lungo quando Opus non bastaFable 5.1 a highRisultati migliori nelle attività di lunga durata senza partire dall’effort più costoso
Flusso di lavoro scientifico al terminale o di ricercaFable 5.1 a high o xhighI suoi maggiori miglioramenti documentati emergono nei compiti lunghi svolti con strumenti
Attività con limiti di output rigidiOpus 5I test iniziali mostrano un rispetto migliore di conteggi e formati
Agente che usa molto la cache e ripete il contestoFable 5.1Il prezzo di $0,25 per leggere dalla cache può cambiare il costo dell’attività
Integrazione Fable 5 esistente con cronologia modificabileFable 5 finché non migriI blocchi di thinking di Fable 5.1 impongono nuove regole per la cronologia della conversazione

La verifica della migrazione è importante. Fable 5.1 rifiuta valori tool_choice forzati, come any o il nome di uno strumento, e il suo thinking adattivo non si può disattivare. I modelli Claude più vecchi non possono leggere i blocchi di thinking di Fable 5.1. Per gli account creati a partire dal 31 agosto 2026, modificare il prompt di sistema, gli strumenti o un turno precedente può anche invalidare i blocchi di thinking firmati. [18] Un fallback da Fable 5.1 a Opus può quindi cambiare lo stato della conversazione oltre al modello.

Partirei anche da un livello inferiore a max. Su CursorBench, Fable 5.1 passa dal 69,4% a high al 73,4% a max, mentre il costo per attività raddoppia da $4,80 a $9,64. [7] Anthropic avverte che i livelli di effort non rappresentano la stessa quantità di ragionamento nei diversi modelli. [6] L’unica impostazione di effort utile è la più bassa che soddisfa i criteri di accettazione sui tuoi compiti.

Fable 5.1 è il Claude più capace tra quelli generalmente disponibili per i compiti che richiedono quel poco di perseveranza in più. Opus 5 resta il predefinito più facile da giustificare. Sposterei prima un solo carico di lavoro lungo e costoso, misurerei l’output accettato, il riuso della cache e il consumo della quota, e cambierei il predefinito solo dopo.

Fonti

  1. Introducing Claude Fable 5.1 and Claude Mythos 5.1Anthropic · 2026-09-01
  2. Claude Fable 5.1Claude Platform Docs · 2026-09-01
  3. Claude Fable 5.1 and Claude Mythos 5.1 system cardAnthropic · 2026-09-01
  4. Claude Fable 5Claude Platform Docs
  5. Claude Opus 5Claude Platform Docs
  6. Prompting Claude Fable 5.1Claude Platform Docs · 2026-09-01
  7. CursorBench 3.2Cursor
  8. How we compare model quality in CursorCursor · 2026-03-11
  9. GDPval-AA v2 leaderboardArtificial Analysis
  10. Claude Fable 5.1 model analysisArtificial Analysis · 2026-09-01
  11. FrontierCode 1.1Cognition · 2026-07-07
  12. AutomationBench leaderboardZapier
  13. Fable 5.1 review: Should you switch?CodeRabbit · 2026-09-01
  14. Vibe Check: Fable 5.1Every · 2026-09-01
  15. Claude Fable 5.1 and Claude Mythos 5.1 discussionHacker News · 2026-09-01
  16. Claude Fable 5.1 just droppedReddit, r/ClaudeCode · 2026-09-01
  17. Claude Fable models on your planAnthropic Help Center · 2026-09-01
  18. Migrating to Claude Fable 5.1 and Claude Mythos 5.1Claude Platform Docs · 2026-09-01
  19. APEX-SWE leaderboardMercor