Lanzamientos

Fable 5.1 supera a Fable 5. Opus sigue siendo difícil de sustituir

Fable 5.1 mejora a su antecesor en tareas largas con agentes, pero Opus 5 se mantiene cerca y cuesta la mitad. Revisé benchmarks e informes iniciales.

En esta página
  1. ¿Qué cambió en Fable 5.1?
  2. ¿Fable 5.1 supera a Fable 5 y a Opus 5?
  3. Por qué la victoria del 31,4 % en AutomationBench corresponde a dos modelos
  4. ¿Fable 5.1 es más barato que Fable 5 u Opus 5?
  5. ¿Qué opinan los primeros usuarios de Fable 5.1?
  6. ¿Deberías cambiar de Fable 5 u Opus 5?

Anthropic lanzó Claude Fable 5.1 el 1 de septiembre de 2026. Es una mejora real frente a Fable 5, sobre todo en trabajo largo con agentes, pero no sustituye claramente a Opus 5. Los resultados independientes sitúan a Fable 5.1 ligeramente por delante de Opus o en empate, mientras que sus tarifas base de entrada y salida cuestan el doble. [1] [7] [9] [19]

¿Qué cambió en Fable 5.1?

Fable 5.1 mantiene la misma ventana de contexto, el mismo límite de salida y el mismo precio base de API que Fable 5. Opus 5 ofrece esos mismos límites por la mitad de las tarifas base de entrada y salida. Los cambios importantes son un mejor rendimiento en trabajos de larga duración, lecturas de caché más baratas, una fecha de corte de conocimientos más reciente y varias reglas de API que hacen que la migración sea algo más que cambiar el ID del modelo. [2] [4] [5]

Anthropic llama al modelo anterior Claude Fable 5, no Fable 5.0, así que uso aquí el nombre oficial. [4]

Especificación Fable 5.1Fable 5Opus 5
Ventana de contexto 1M 1M 1M
Salida máxima 128K 128K 128K
Entrada, $/MTok 10 10 5 (El mejor valor de la fila)
Salida, $/MTok 50 50 25 (El mejor valor de la fila)
Lectura de caché, $/MTok 0,25 (El mejor valor de la fila) 1,00 0,50
Esfuerzo predeterminado high high high
Fecha de corte de conocimientos jun 2026 ene 2026 may 2026
Figura 1. Especificaciones actuales de los modelos y precios de lista de la API. Claude Platform Docs, 2 de septiembre de 2026.

La figura 1 muestra por qué importa lo que recomienda Anthropic. La empresa llama a Fable 5.1 su modelo de disponibilidad general más capaz, pero pide a los desarrolladores que empiecen con Opus 5 para la mayoría de las cargas de trabajo y pasen a Fable solo cuando Opus, con un esfuerzo mayor, siga quedándose corto. [2] Fable es la opción a la que se pasa cuando hace falta más capacidad, no la opción predeterminada solo porque tiene un número mayor.

El cambio de precios es más limitado de lo que puede sugerir el lenguaje del lanzamiento. Fable 5.1 aún cuesta 10 $ por millón de tokens de entrada y 50 $ por millón de tokens de salida, igual que Fable 5. Su tarifa de lectura de caché baja un 75 %, de 1 $ a 0,25 $. Anthropic estima que la combinación de cargas de trabajo de agosto costaría alrededor de un 25 % menos, con ahorros que se acercan al 45 % en trabajo con agentes que reutiliza mucho la caché, pero esa estimación depende de la reutilización y del comportamiento de la tarea. [1] Una solicitud que lee contexto nuevo una vez y genera una respuesta larga no recibe un descuento del 75 % en sus cargos principales.

El producto también cambió de formas que la tabla no muestra. Fable 5.1 puede variar el esfuerzo por mensaje, aceptar instrucciones de sistema específicas para cada turno y enviar actualizaciones de progreso visibles entre llamadas a herramientas. Anthropic también documenta una prosa más densa, un uso paralelo de herramientas menos predecible y una tendencia a reescribir archivos completos en lugar de hacer cambios pequeños. [6] No son detalles secundarios para los agentes de programación. Cambian lo que implica una buena puntuación para quien espera, revisa o intenta detener una ejecución.

¿Fable 5.1 supera a Fable 5 y a Opus 5?

Fable 5.1 supera claramente a Fable 5 en las evaluaciones de agentes comparables más sólidas que encontré. No se distancia de Opus 5 con la misma claridad. La ventaja sobre Opus es amplia en un benchmark científico ejecutado por Anthropic, pero equivale en la práctica a un empate en pruebas independientes de software y trabajo profesional.

Evaluación Fable 5.1Fable 5Opus 5
Terminal-Bench-Science 0.1, % 52,6 (El mejor valor de la fila) 24,7 29,0
CursorBench 3.2 max, % 73,4 70,5 70,0
GDPval-AA v2, Elo 1853 1723 1824
APEX-SWE max, % 63,6 58,8 63,7
FrontierCode Main, mejor puntuación 50,9 53,5 53,4
Figura 2. Resultados seleccionados con las mismas versiones de los modelos, disponibles el 2 de septiembre de 2026. Cada fila usa unidades y harnesses diferentes, así que compara los modelos dentro de una misma fila, no entre filas.

La primera fila muestra el mayor avance, pero procede de Anthropic. En su configuración de Claude Code --bare con esfuerzo max, Fable 5.1 resolvió el 52,6 % de 70 tareas científicas de terminal, frente al 24,7 % de Fable 5 y el 29,0 % de Opus 5. El error estándar fue de unos 3,5 a 4,5 puntos porcentuales por modelo, de modo que la ventaja de Fable 5.1 supera con claridad la incertidumbre informada en esta configuración. [3] La clasificación pública de Terminal-Bench-Science aún no incluía a Fable 5.1 cuando la consulté, por eso lo describo como un resultado de Anthropic y no como una victoria en una clasificación pública.

Los resultados independientes muestran una diferencia menos marcada. Cursor sitúa a Fable 5.1 en primer lugar con un 73,4 %, pero la distancia es de 2,9 puntos frente a Fable 5 y de 3,4 frente a Opus. Cursor advierte que las diferencias pequeñas de puntuación pueden deberse a la variación entre ejecuciones, y sus tareas son ejemplos privados extraídos de sesiones reales de Cursor. [7] [8] Artificial Analysis da a Fable 5.1 la calificación más alta de GDPval-AA v2, con 1.853 Elo. Opus le sigue con 1.824, y sus intervalos de confianza mostrados se solapan. Fable 5, con 1.723, queda más claramente atrás. [9]

El APEX-SWE de Mercor aclara aún más la comparación con Opus. En 200 casos de software, Fable 5.1 obtiene un 63,6 % y Opus un 63,7 %, con intervalos de confianza de más de seis puntos de ancho. Fable 5 alcanza el 58,8 %. [19] La conclusión útil es esta: el sucesor se aleja de Fable 5, mientras Opus se mantiene lo bastante cerca como para que el tipo de tarea y el coste determinen la elección.

También hay resultados que apuntan en sentido contrario. FrontierCode de Cognition comprueba si los mantenedores aceptarían un parche, incluidas las pruebas del parche, su alcance y las convenciones de la base de código. Fable 5.1 alcanza su máximo de 50,9 en el conjunto principal con medium, por debajo de los 53,5 de Fable 5 con xhigh y los 53,4 de Opus 5 con medium. [11] Anthropic dice que un esfuerzo mayor de Fable 5.1 puede activar cambios útiles pero no solicitados que el benchmark penaliza correctamente por quedar fuera de alcance. [3] Hacer más trabajo no siempre produce un parche mejor.

Por qué la victoria del 31,4 % en AutomationBench corresponde a dos modelos

La primera fila de AutomationBench de Zapier corresponde a un sistema desplegado con Fable 5.1 y Opus 5, no a una puntuación pura de Fable. Opus se hizo cargo de 260 de las 657 tareas después de que interviniera el clasificador de seguridad, y Zapier incluye esas finalizaciones en el resultado del 31,4 %. [12]

tasa de finalización estricta
31,4 %
Fable 5.1 más respaldo de Opus 5
tareas gestionadas por Opus
260/657
alrededor del 40 % de la evaluación
coste mostrado por tarea
2,45 $
los tokens de respaldo no están incluidos
Figura 3. Qué contiene la primera fila de AutomationBench de Zapier. Fable 5.1 con respaldo de Opus 5, versión 1.0.6.

No es motivo para descartar el resultado. AutomationBench mide si un agente deja un negocio simulado en el estado correcto después de trabajar con 47 herramientas, y sus comprobaciones de estado final son deterministas. El sistema combinado ocupa el primer puesto porque completa más de esos flujos de trabajo. El problema aparece solo cuando la fila se reduce a “Fable 5.1 obtiene un 31,4 %”.

Las salvaguardas de Fable forman parte del producto. Anthropic afirma que las solicitudes de biología pueden dirigirse a Opus 5, mientras que algunas solicitudes de ciberseguridad se dirigen a Opus 4.8. [1] En la evaluación de Zapier, Opus devuelve después el control a Fable para terminar la tarea. Los 2,45 $ de coste mostrados incluyen el uso de Fable pero excluyen los tokens de respaldo, por lo que no permiten comparar limpiamente el coste con Opus independiente, que cuesta 1,27 $ por tarea. [12]

El mismo problema también aparece, de forma menos evidente, en otros resultados. Artificial Analysis etiqueta sus entradas de Fable 5.1 como “Default Fallback”, incluida la fila número uno de GDPval. [9] A un desarrollador que elige el modelo disponible públicamente le importa el sistema desplegado, así que estos resultados siguen siendo útiles. Quien quiere saber cómo rinde el modelo por sí solo necesita otro experimento.

¿Fable 5.1 es más barato que Fable 5 u Opus 5?

Fable 5.1 suele ser una opción más rentable que Fable 5 cuando la carga de trabajo reutiliza contexto, pero Opus 5 sigue siendo más barato por precio de lista. El coste total de una tarea con cualquiera de los dos modelos depende de los tokens, los aciertos de caché, los pasos del agente, el esfuerzo y el comportamiento del respaldo.

La ejecución de Cursor con max es el mejor caso para dar el salto. Fable 5.1 obtiene un 73,4 % por 9,64 $ por tarea intentada, mientras Fable 5 obtiene un 70,5 % por 17,32 $. Fable 5.1 utiliza 72.060 tokens frente a los 103.525 de Fable 5, aproximadamente un 30 % menos, por lo que en este harness es mejor y cuesta un 44 % menos. Opus obtiene un 70,0 % por 8,23 $ y usa 61.838 tokens. [7]

Artificial Analysis encuentra el patrón inverso de uso de tokens en su índice de inteligencia de nueve partes. La ejecución con max de Fable 5.1 usa unos 45.236 tokens de salida y cuesta 3,69 $ por tarea. Fable 5 usa unos 35.565 tokens y cuesta 3,14 $, mientras que Opus usa unos 40.249 tokens y cuesta 2,34 $. Fable 5.1 tarda 285 segundos hasta su primera respuesta, frente a 121 de Fable 5 y 60 de Opus. [10]

Ninguno de los dos evaluadores tiene por qué estar equivocado. Cursor prueba tareas de programación ambiguas que abarcan varios archivos dentro de su agente de producción, mientras Artificial Analysis combina programación, ciencia, razonamiento general y trabajo profesional con agentes. Sus prompts, herramientas, reutilización de caché, reglas de parada y criterios de evaluación son distintos. “Fable 5.1 usa menos tokens” es cierto en un harness y falso en otro. El coste por tarea, no solo la tarifa por token, es la cifra que vale la pena medir en tu propio sistema.

Los usuarios de suscripción tienen otro coste que considerar. Fable 5.1 está disponible en los planes Claude de pago, pero el acceso y la asignación semanal dependen del plan y del tipo de licencia. [17] Un acierto de caché de API más barato no hace que una ejecución larga de Claude Code con xhigh consuma poca cuota semanal.

¿Qué opinan los primeros usuarios de Fable 5.1?

Los informes publicados el 1 de septiembre de 2026 no mostraban un consenso fiable. Los relatos creíbles apuntan a tres impresiones provisionales: Fable 5.1 puede sostener un trabajo más difícil durante más tiempo, puede resultar más fácil de leer que Fable 5 u Opus 5, y puede llegar a consumir mucho más tiempo o cuota de lo previsto.

Revisé un hilo de lanzamiento de Hacker News con 688 comentarios y seis hilos de Reddit con 457 comentarios visibles en sus versiones públicas. Ese conjunto de 1.145 comentarios es autoseleccionado, repetitivo y está lleno de personas que reaccionaron al anuncio en lugar de ejecutar el modelo. Lo usé para localizar modos de fallo, no para calcular la opinión general. [15] [16]

Los comentarios positivos de personas que lo probaron describen trabajo de programación difícil terminado en una sola ejecución, mejor retención en contextos largos y menos intervenciones de seguridad erróneas. Un desarrollador que trabaja en una base de código C real describió 5.1 como otro paso adelante frente a Fable 5 en funcionalidades grandes ya planificadas. Un usuario de Reddit informó de una aplicación de C++ funcional tras generar 50 archivos. Ninguna de las dos publicaciones incluye un punto de comparación controlado ni un repositorio que pueda inspeccionar, por lo que ambas siguen siendo anécdotas útiles, no resultados de benchmark. [15] [16]

Los informes negativos son igual de concretos. Varios usuarios llegaron al límite de cinco horas antes de terminar una primera tarea larga, y un usuario del plan Max dijo que una carga de trabajo de varios agentes similar consumió el 42 % de la cuota semanal con Fable 5.1, frente al 20 % con Fable 5. Otros usuarios discreparon sobre la prosa: uno informó de texto incoherente después de un contexto largo y otro la encontró más corta y clara. [15] [16] Estas cuentas no establecen el uso medio de cuota ni la calidad de la escritura, pero advierten contra tratar las afirmaciones del lanzamiento como si describieran la experiencia predeterminada.

Dos pruebas iniciales estructuradas añaden contexto a los informes. CodeRabbit evaluó 45 tareas de revisión de código con 105 problemas conocidos. El recall, es decir, el porcentaje de problemas conocidos detectados, alcanzó el 61,0 % con Fable 5.1 frente al 61,9 % con Fable 5, mientras que la precisión subió del 32,8 % al 37,3 % y los comentarios finales bajaron de 253 a 166. También tardó 18 minutos y 38 segundos por tarea, en vez de 12 minutos y 32 segundos. CodeRabbit cambió su flujo de revisión entre las ejecuciones de los modelos, por eso solo indica una tendencia, no una comparación directa en igualdad de condiciones. [13]

Every probó Fable 5.1 durante una semana antes del lanzamiento y obtuvo resultados comparables a los de Opus 5 con menos de la mitad de los tokens y aproximadamente el 60 % del tiempo. La misma revisión registra los fallos relevantes: un límite de 1.000 palabras se convirtió en 1.288, una petición de 8 a 12 citas produjo 43 y cinco de las 27 citas comprobadas no existían en la fuente. Opus respetó los límites de salida, pero agotó el tiempo dos veces. [14] Anthropic proporcionó acceso anticipado, pero no tuvo participación editorial, lo que hace esta prueba más útil que un testimonio de lanzamiento y menos independiente que una prueba pública ciega.

Mi impresión es que Fable 5.1 mejoró la capacidad de Fable para seguir trabajando, pero no eliminó la necesidad de fijar límites y verificar el resultado. Ahora el modelo puede avanzar más antes de fallar. Eso tiene valor, y también puede encarecer una mala ejecución.

¿Deberías cambiar de Fable 5 u Opus 5?

Tras comprobar la migración, trasladaría las cargas de trabajo activas de Fable 5 a 5.1, pero mantendría Opus 5 como opción predeterminada para la programación habitual. Fable 5.1 se gana los trabajos caros en los que una pequeña mejora de capacidad puede evitar una hora perdida o un ciclo adicional de revisión.

Tipo de trabajoMi modelo inicialPor qué
Funcionalidad acotada o fallo reproducibleOpus 5 con medium o highResultados de benchmark cercanos, precio base más bajo y mejor disciplina en algunas pruebas de parches
Refactorización larga cuando Opus se queda cortoFable 5.1 con highMejores resultados en tareas largas sin empezar por el esfuerzo más caro
Flujo de terminal científica o investigaciónFable 5.1 con high o xhighSus mayores mejoras documentadas aparecen en trabajo largo que usa herramientas
Trabajo con límites estrictos de salidaOpus 5Las pruebas iniciales muestran mejor cumplimiento de recuentos y formatos
Agente con mucha caché y contexto repetidoFable 5.1La tarifa de 0,25 $ por lectura de caché puede cambiar el coste por tarea
Integración existente con Fable 5 y un historial editableFable 5 hasta completar la migraciónLos bloques de razonamiento de Fable 5.1 imponen nuevas reglas al historial de conversación

La comprobación de migración importa. Fable 5.1 rechaza valores de tool_choice forzados como any o una herramienta con nombre, y su razonamiento adaptativo no se puede desactivar. Los modelos Claude anteriores no pueden leer los bloques de razonamiento de Fable 5.1. Para las cuentas creadas el 31 de agosto de 2026 o después, editar el prompt de sistema, las herramientas o un turno anterior también puede invalidar los bloques de razonamiento firmados. [18] Por tanto, volver de Fable 5.1 a Opus puede cambiar tanto el estado de la conversación como el modelo.

También empezaría por debajo de max. CursorBench pasa de un 69,4 % con high a un 73,4 % con max, mientras el coste por tarea se duplica de 4,80 $ a 9,64 $. [7] Anthropic advierte que las etiquetas de esfuerzo no representan la misma cantidad de razonamiento entre modelos distintos. [6] La única configuración de esfuerzo útil es la más baja que cumple los criterios de aceptación en tus propias tareas.

Fable 5.1 es el Claude de disponibilidad general más capaz para trabajos que necesitan un poco más de persistencia. Opus 5 sigue siendo la opción predeterminada más fácil de justificar. Yo movería primero una carga de trabajo larga y cara, mediría la salida aceptada, la reutilización de caché y el consumo de cuota, y solo después cambiaría la opción predeterminada.

Fuentes

  1. Introducing Claude Fable 5.1 and Claude Mythos 5.1Anthropic · 2026-09-01
  2. Claude Fable 5.1Claude Platform Docs · 2026-09-01
  3. Claude Fable 5.1 and Claude Mythos 5.1 system cardAnthropic · 2026-09-01
  4. Claude Fable 5Claude Platform Docs
  5. Claude Opus 5Claude Platform Docs
  6. Prompting Claude Fable 5.1Claude Platform Docs · 2026-09-01
  7. CursorBench 3.2Cursor
  8. How we compare model quality in CursorCursor · 2026-03-11
  9. GDPval-AA v2 leaderboardArtificial Analysis
  10. Claude Fable 5.1 model analysisArtificial Analysis · 2026-09-01
  11. FrontierCode 1.1Cognition · 2026-07-07
  12. AutomationBench leaderboardZapier
  13. Fable 5.1 review: Should you switch?CodeRabbit · 2026-09-01
  14. Vibe Check: Fable 5.1Every · 2026-09-01
  15. Claude Fable 5.1 and Claude Mythos 5.1 discussionHacker News · 2026-09-01
  16. Claude Fable 5.1 just droppedReddit, r/ClaudeCode · 2026-09-01
  17. Claude Fable models on your planAnthropic Help Center · 2026-09-01
  18. Migrating to Claude Fable 5.1 and Claude Mythos 5.1Claude Platform Docs · 2026-09-01
  19. APEX-SWE leaderboardMercor