Fable 5.1 supera a Fable 5. Opus sigue siendo difícil de sustituir
Fable 5.1 mejora a su antecesor en tareas largas con agentes, pero Opus 5 se mantiene cerca y cuesta la mitad. Revisé benchmarks e informes iniciales.
Anthropic lanzó Claude Fable 5.1 el 1 de septiembre de 2026. Es una mejora real frente a Fable 5, sobre todo en trabajo largo con agentes, pero no sustituye claramente a Opus 5. Los resultados independientes sitúan a Fable 5.1 ligeramente por delante de Opus o en empate, mientras que sus tarifas base de entrada y salida cuestan el doble. [1] [7] [9] [19]
¿Qué cambió en Fable 5.1?
Fable 5.1 mantiene la misma ventana de contexto, el mismo límite de salida y el mismo precio base de API que Fable 5. Opus 5 ofrece esos mismos límites por la mitad de las tarifas base de entrada y salida. Los cambios importantes son un mejor rendimiento en trabajos de larga duración, lecturas de caché más baratas, una fecha de corte de conocimientos más reciente y varias reglas de API que hacen que la migración sea algo más que cambiar el ID del modelo. [2] [4] [5]
Anthropic llama al modelo anterior Claude Fable 5, no Fable 5.0, así que uso aquí el nombre oficial. [4]
| Especificación | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Ventana de contexto | 1M | 1M | 1M |
| Salida máxima | 128K | 128K | 128K |
| Entrada, $/MTok | 10 | 10 | 5 (El mejor valor de la fila) |
| Salida, $/MTok | 50 | 50 | 25 (El mejor valor de la fila) |
| Lectura de caché, $/MTok | 0,25 (El mejor valor de la fila) | 1,00 | 0,50 |
| Esfuerzo predeterminado | high | high | high |
| Fecha de corte de conocimientos | jun 2026 | ene 2026 | may 2026 |
La figura 1 muestra por qué importa lo que recomienda Anthropic. La empresa llama a Fable 5.1 su modelo de disponibilidad general más capaz, pero pide a los desarrolladores que empiecen con Opus 5 para la mayoría de las cargas de trabajo y pasen a Fable solo cuando Opus, con un esfuerzo mayor, siga quedándose corto. [2] Fable es la opción a la que se pasa cuando hace falta más capacidad, no la opción predeterminada solo porque tiene un número mayor.
El cambio de precios es más limitado de lo que puede sugerir el lenguaje del lanzamiento. Fable 5.1 aún cuesta 10 $ por millón de tokens de entrada y 50 $ por millón de tokens de salida, igual que Fable 5. Su tarifa de lectura de caché baja un 75 %, de 1 $ a 0,25 $. Anthropic estima que la combinación de cargas de trabajo de agosto costaría alrededor de un 25 % menos, con ahorros que se acercan al 45 % en trabajo con agentes que reutiliza mucho la caché, pero esa estimación depende de la reutilización y del comportamiento de la tarea. [1] Una solicitud que lee contexto nuevo una vez y genera una respuesta larga no recibe un descuento del 75 % en sus cargos principales.
El producto también cambió de formas que la tabla no muestra. Fable 5.1 puede variar el esfuerzo por mensaje, aceptar instrucciones de sistema específicas para cada turno y enviar actualizaciones de progreso visibles entre llamadas a herramientas. Anthropic también documenta una prosa más densa, un uso paralelo de herramientas menos predecible y una tendencia a reescribir archivos completos en lugar de hacer cambios pequeños. [6] No son detalles secundarios para los agentes de programación. Cambian lo que implica una buena puntuación para quien espera, revisa o intenta detener una ejecución.
¿Fable 5.1 supera a Fable 5 y a Opus 5?
Fable 5.1 supera claramente a Fable 5 en las evaluaciones de agentes comparables más sólidas que encontré. No se distancia de Opus 5 con la misma claridad. La ventaja sobre Opus es amplia en un benchmark científico ejecutado por Anthropic, pero equivale en la práctica a un empate en pruebas independientes de software y trabajo profesional.
| Evaluación | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Terminal-Bench-Science 0.1, % | 52,6 (El mejor valor de la fila) | 24,7 | 29,0 |
| CursorBench 3.2 max, % | 73,4 | 70,5 | 70,0 |
| GDPval-AA v2, Elo | 1853 | 1723 | 1824 |
| APEX-SWE max, % | 63,6 | 58,8 | 63,7 |
| FrontierCode Main, mejor puntuación | 50,9 | 53,5 | 53,4 |
La primera fila muestra el mayor avance, pero procede de Anthropic. En su configuración de Claude Code --bare con esfuerzo max, Fable 5.1 resolvió el 52,6 % de 70 tareas científicas de terminal, frente al 24,7 % de Fable 5 y el 29,0 % de Opus 5. El error estándar fue de unos 3,5 a 4,5 puntos porcentuales por modelo, de modo que la ventaja de Fable 5.1 supera con claridad la incertidumbre informada en esta configuración. [3] La clasificación pública de Terminal-Bench-Science aún no incluía a Fable 5.1 cuando la consulté, por eso lo describo como un resultado de Anthropic y no como una victoria en una clasificación pública.
Los resultados independientes muestran una diferencia menos marcada. Cursor sitúa a Fable 5.1 en primer lugar con un 73,4 %, pero la distancia es de 2,9 puntos frente a Fable 5 y de 3,4 frente a Opus. Cursor advierte que las diferencias pequeñas de puntuación pueden deberse a la variación entre ejecuciones, y sus tareas son ejemplos privados extraídos de sesiones reales de Cursor. [7] [8] Artificial Analysis da a Fable 5.1 la calificación más alta de GDPval-AA v2, con 1.853 Elo. Opus le sigue con 1.824, y sus intervalos de confianza mostrados se solapan. Fable 5, con 1.723, queda más claramente atrás. [9]
El APEX-SWE de Mercor aclara aún más la comparación con Opus. En 200 casos de software, Fable 5.1 obtiene un 63,6 % y Opus un 63,7 %, con intervalos de confianza de más de seis puntos de ancho. Fable 5 alcanza el 58,8 %. [19] La conclusión útil es esta: el sucesor se aleja de Fable 5, mientras Opus se mantiene lo bastante cerca como para que el tipo de tarea y el coste determinen la elección.
También hay resultados que apuntan en sentido contrario. FrontierCode de Cognition comprueba si los mantenedores aceptarían un parche, incluidas las pruebas del parche, su alcance y las convenciones de la base de código. Fable 5.1 alcanza su máximo de 50,9 en el conjunto principal con medium, por debajo de los 53,5 de Fable 5 con xhigh y los 53,4 de Opus 5 con medium. [11] Anthropic dice que un esfuerzo mayor de Fable 5.1 puede activar cambios útiles pero no solicitados que el benchmark penaliza correctamente por quedar fuera de alcance. [3] Hacer más trabajo no siempre produce un parche mejor.
Por qué la victoria del 31,4 % en AutomationBench corresponde a dos modelos
La primera fila de AutomationBench de Zapier corresponde a un sistema desplegado con Fable 5.1 y Opus 5, no a una puntuación pura de Fable. Opus se hizo cargo de 260 de las 657 tareas después de que interviniera el clasificador de seguridad, y Zapier incluye esas finalizaciones en el resultado del 31,4 %. [12]
- tasa de finalización estricta
- 31,4 %
- Fable 5.1 más respaldo de Opus 5
- tareas gestionadas por Opus
- 260/657
- alrededor del 40 % de la evaluación
- coste mostrado por tarea
- 2,45 $
- los tokens de respaldo no están incluidos
No es motivo para descartar el resultado. AutomationBench mide si un agente deja un negocio simulado en el estado correcto después de trabajar con 47 herramientas, y sus comprobaciones de estado final son deterministas. El sistema combinado ocupa el primer puesto porque completa más de esos flujos de trabajo. El problema aparece solo cuando la fila se reduce a “Fable 5.1 obtiene un 31,4 %”.
Las salvaguardas de Fable forman parte del producto. Anthropic afirma que las solicitudes de biología pueden dirigirse a Opus 5, mientras que algunas solicitudes de ciberseguridad se dirigen a Opus 4.8. [1] En la evaluación de Zapier, Opus devuelve después el control a Fable para terminar la tarea. Los 2,45 $ de coste mostrados incluyen el uso de Fable pero excluyen los tokens de respaldo, por lo que no permiten comparar limpiamente el coste con Opus independiente, que cuesta 1,27 $ por tarea. [12]
El mismo problema también aparece, de forma menos evidente, en otros resultados. Artificial Analysis etiqueta sus entradas de Fable 5.1 como “Default Fallback”, incluida la fila número uno de GDPval. [9] A un desarrollador que elige el modelo disponible públicamente le importa el sistema desplegado, así que estos resultados siguen siendo útiles. Quien quiere saber cómo rinde el modelo por sí solo necesita otro experimento.
¿Fable 5.1 es más barato que Fable 5 u Opus 5?
Fable 5.1 suele ser una opción más rentable que Fable 5 cuando la carga de trabajo reutiliza contexto, pero Opus 5 sigue siendo más barato por precio de lista. El coste total de una tarea con cualquiera de los dos modelos depende de los tokens, los aciertos de caché, los pasos del agente, el esfuerzo y el comportamiento del respaldo.
La ejecución de Cursor con max es el mejor caso para dar el salto. Fable 5.1 obtiene un 73,4 % por 9,64 $ por tarea intentada, mientras Fable 5 obtiene un 70,5 % por 17,32 $. Fable 5.1 utiliza 72.060 tokens frente a los 103.525 de Fable 5, aproximadamente un 30 % menos, por lo que en este harness es mejor y cuesta un 44 % menos. Opus obtiene un 70,0 % por 8,23 $ y usa 61.838 tokens. [7]
Artificial Analysis encuentra el patrón inverso de uso de tokens en su índice de inteligencia de nueve partes. La ejecución con max de Fable 5.1 usa unos 45.236 tokens de salida y cuesta 3,69 $ por tarea. Fable 5 usa unos 35.565 tokens y cuesta 3,14 $, mientras que Opus usa unos 40.249 tokens y cuesta 2,34 $. Fable 5.1 tarda 285 segundos hasta su primera respuesta, frente a 121 de Fable 5 y 60 de Opus. [10]
Ninguno de los dos evaluadores tiene por qué estar equivocado. Cursor prueba tareas de programación ambiguas que abarcan varios archivos dentro de su agente de producción, mientras Artificial Analysis combina programación, ciencia, razonamiento general y trabajo profesional con agentes. Sus prompts, herramientas, reutilización de caché, reglas de parada y criterios de evaluación son distintos. “Fable 5.1 usa menos tokens” es cierto en un harness y falso en otro. El coste por tarea, no solo la tarifa por token, es la cifra que vale la pena medir en tu propio sistema.
Los usuarios de suscripción tienen otro coste que considerar. Fable 5.1 está disponible en los planes Claude de pago, pero el acceso y la asignación semanal dependen del plan y del tipo de licencia. [17] Un acierto de caché de API más barato no hace que una ejecución larga de Claude Code con xhigh consuma poca cuota semanal.
¿Qué opinan los primeros usuarios de Fable 5.1?
Los informes publicados el 1 de septiembre de 2026 no mostraban un consenso fiable. Los relatos creíbles apuntan a tres impresiones provisionales: Fable 5.1 puede sostener un trabajo más difícil durante más tiempo, puede resultar más fácil de leer que Fable 5 u Opus 5, y puede llegar a consumir mucho más tiempo o cuota de lo previsto.
Revisé un hilo de lanzamiento de Hacker News con 688 comentarios y seis hilos de Reddit con 457 comentarios visibles en sus versiones públicas. Ese conjunto de 1.145 comentarios es autoseleccionado, repetitivo y está lleno de personas que reaccionaron al anuncio en lugar de ejecutar el modelo. Lo usé para localizar modos de fallo, no para calcular la opinión general. [15] [16]
Los comentarios positivos de personas que lo probaron describen trabajo de programación difícil terminado en una sola ejecución, mejor retención en contextos largos y menos intervenciones de seguridad erróneas. Un desarrollador que trabaja en una base de código C real describió 5.1 como otro paso adelante frente a Fable 5 en funcionalidades grandes ya planificadas. Un usuario de Reddit informó de una aplicación de C++ funcional tras generar 50 archivos. Ninguna de las dos publicaciones incluye un punto de comparación controlado ni un repositorio que pueda inspeccionar, por lo que ambas siguen siendo anécdotas útiles, no resultados de benchmark. [15] [16]
Los informes negativos son igual de concretos. Varios usuarios llegaron al límite de cinco horas antes de terminar una primera tarea larga, y un usuario del plan Max dijo que una carga de trabajo de varios agentes similar consumió el 42 % de la cuota semanal con Fable 5.1, frente al 20 % con Fable 5. Otros usuarios discreparon sobre la prosa: uno informó de texto incoherente después de un contexto largo y otro la encontró más corta y clara. [15] [16] Estas cuentas no establecen el uso medio de cuota ni la calidad de la escritura, pero advierten contra tratar las afirmaciones del lanzamiento como si describieran la experiencia predeterminada.
Dos pruebas iniciales estructuradas añaden contexto a los informes. CodeRabbit evaluó 45 tareas de revisión de código con 105 problemas conocidos. El recall, es decir, el porcentaje de problemas conocidos detectados, alcanzó el 61,0 % con Fable 5.1 frente al 61,9 % con Fable 5, mientras que la precisión subió del 32,8 % al 37,3 % y los comentarios finales bajaron de 253 a 166. También tardó 18 minutos y 38 segundos por tarea, en vez de 12 minutos y 32 segundos. CodeRabbit cambió su flujo de revisión entre las ejecuciones de los modelos, por eso solo indica una tendencia, no una comparación directa en igualdad de condiciones. [13]
Every probó Fable 5.1 durante una semana antes del lanzamiento y obtuvo resultados comparables a los de Opus 5 con menos de la mitad de los tokens y aproximadamente el 60 % del tiempo. La misma revisión registra los fallos relevantes: un límite de 1.000 palabras se convirtió en 1.288, una petición de 8 a 12 citas produjo 43 y cinco de las 27 citas comprobadas no existían en la fuente. Opus respetó los límites de salida, pero agotó el tiempo dos veces. [14] Anthropic proporcionó acceso anticipado, pero no tuvo participación editorial, lo que hace esta prueba más útil que un testimonio de lanzamiento y menos independiente que una prueba pública ciega.
Mi impresión es que Fable 5.1 mejoró la capacidad de Fable para seguir trabajando, pero no eliminó la necesidad de fijar límites y verificar el resultado. Ahora el modelo puede avanzar más antes de fallar. Eso tiene valor, y también puede encarecer una mala ejecución.
¿Deberías cambiar de Fable 5 u Opus 5?
Tras comprobar la migración, trasladaría las cargas de trabajo activas de Fable 5 a 5.1, pero mantendría Opus 5 como opción predeterminada para la programación habitual. Fable 5.1 se gana los trabajos caros en los que una pequeña mejora de capacidad puede evitar una hora perdida o un ciclo adicional de revisión.
| Tipo de trabajo | Mi modelo inicial | Por qué |
|---|---|---|
| Funcionalidad acotada o fallo reproducible | Opus 5 con medium o high | Resultados de benchmark cercanos, precio base más bajo y mejor disciplina en algunas pruebas de parches |
| Refactorización larga cuando Opus se queda corto | Fable 5.1 con high | Mejores resultados en tareas largas sin empezar por el esfuerzo más caro |
| Flujo de terminal científica o investigación | Fable 5.1 con high o xhigh | Sus mayores mejoras documentadas aparecen en trabajo largo que usa herramientas |
| Trabajo con límites estrictos de salida | Opus 5 | Las pruebas iniciales muestran mejor cumplimiento de recuentos y formatos |
| Agente con mucha caché y contexto repetido | Fable 5.1 | La tarifa de 0,25 $ por lectura de caché puede cambiar el coste por tarea |
| Integración existente con Fable 5 y un historial editable | Fable 5 hasta completar la migración | Los bloques de razonamiento de Fable 5.1 imponen nuevas reglas al historial de conversación |
La comprobación de migración importa. Fable 5.1 rechaza valores de tool_choice forzados como any o una herramienta con nombre, y su razonamiento adaptativo no se puede desactivar. Los modelos Claude anteriores no pueden leer los bloques de razonamiento de Fable 5.1. Para las cuentas creadas el 31 de agosto de 2026 o después, editar el prompt de sistema, las herramientas o un turno anterior también puede invalidar los bloques de razonamiento firmados. [18] Por tanto, volver de Fable 5.1 a Opus puede cambiar tanto el estado de la conversación como el modelo.
También empezaría por debajo de max. CursorBench pasa de un 69,4 % con high a un 73,4 % con max, mientras el coste por tarea se duplica de 4,80 $ a 9,64 $. [7] Anthropic advierte que las etiquetas de esfuerzo no representan la misma cantidad de razonamiento entre modelos distintos. [6] La única configuración de esfuerzo útil es la más baja que cumple los criterios de aceptación en tus propias tareas.
Fable 5.1 es el Claude de disponibilidad general más capaz para trabajos que necesitan un poco más de persistencia. Opus 5 sigue siendo la opción predeterminada más fácil de justificar. Yo movería primero una carga de trabajo larga y cara, mediría la salida aceptada, la reutilización de caché y el consumo de cuota, y solo después cambiaría la opción predeterminada.
Fuentes
- Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Claude Fable 5.1
- Claude Fable 5.1 and Claude Mythos 5.1 system card
- Claude Fable 5
- Claude Opus 5
- Prompting Claude Fable 5.1
- CursorBench 3.2
- How we compare model quality in Cursor
- GDPval-AA v2 leaderboard
- Claude Fable 5.1 model analysis
- FrontierCode 1.1
- AutomationBench leaderboard
- Fable 5.1 review: Should you switch?
- Vibe Check: Fable 5.1
- Claude Fable 5.1 and Claude Mythos 5.1 discussion
- Claude Fable 5.1 just dropped
- Claude Fable models on your plan
- Migrating to Claude Fable 5.1 and Claude Mythos 5.1
- APEX-SWE leaderboard