Lanzamientos

Opus 5 es un gran empleado y un jefe frustrante

Opus 5 iguala a Fable 5 en los benchmarks a mitad de precio por token, pero las quejas de la primera semana son reales. Dónde brilla y dónde necesita un jefe.

En esta página
  1. Los números están igualados, y son reales
  2. Lo que describe realmente la ola de críticas
  3. Los benchmarks puntúan la meta, no la conducción
  4. La mitad de precio por token no es la mitad de precio por tarea
  5. Un año, cuatro personalidades de Opus
  6. La teoría del nerf, desmontada por capas
  7. Los productos de Anthropic ya asumen la división
  8. Cómo usaría Opus 5 esta semana
  9. El empleado y el jefe

Anthropic lanzó Opus 5 el 24 de julio de 2026 [1]. Cinco días después, la reacción se ha partido en dos bandos que apenas parecen hablar del mismo modelo. Artificial Analysis lo midió un punto por encima de Fable 5 en su índice de inteligencia, a mitad de precio por token [2]. Mientras tanto, una parte ruidosa de Reddit quiere recuperar su modelo anterior.

Entré en la semana de lanzamiento con una teoría de trabajo: Opus 5 es un gran empleado y un jefe frustrante. Tras cinco días leyendo todo lo que pude encontrar (documentación oficial, evaluaciones independientes y demasiados hilos de Reddit), la teoría aguanta, con una corrección. Opus 5 no es el modelo tonto que describen los posts más furiosos. Ejecuta al nivel de Fable. Lo que le falta es dirección: leer la intención, respetar el alcance y saber cuándo ha terminado de verdad.

Los números están igualados, y son reales

En el índice de inteligencia de Artificial Analysis, Opus 5 a esfuerzo máximo puntúa 61 frente al 60 de Fable 5. Nadie debería leer un punto de diferencia como prueba de nada, salvo de que los dos modelos están en la misma clase de capacidad [2].

Por debajo del índice general, Opus 5 lidera varias de las evaluaciones más acotadas. Marcó 1861 Elo en GDPval-AA v2 (trabajo profesional de conocimiento) y 1720 en AA-Briefcase (entregables agénticos), 114 y 146 Elo por delante de Fable respectivamente. Empató en primer lugar en el Coding Agent Index con esfuerzo xhigh y alcanzó un 89 % en Terminal-Bench 2.1 al máximo [2].

Métrica Opus 5Fable 5
Índice de inteligencia de AA 61 60
GDPval-AA v2, Elo 1861 (El mejor valor de la fila) 1747
AA-Briefcase, Elo 1720 (El mejor valor de la fila) 1574
Coste medido por tarea de evaluación, $ 2,03 (El mejor valor de la fila) 2,75
Figura 1. Resultados seleccionados, configuraciones de esfuerzo máximo. Artificial Analysis, julio de 2026.

La lectura de la tabla no es que Opus sea más listo. Es que, en trabajo acotado con forma de entregable, el modelo barato ya intercambia golpes con el buque insignia. Los números de la propia Anthropic apuntan en la misma dirección: a medio punto de Fable en CursorBench 3.2 con esfuerzo máximo, y por encima del mejor resultado de Fable en OSWorld a un tercio del coste. Son mediciones del fabricante, así que trátalas como marketing con recibos [1].

Lo que describe realmente la ola de críticas

La crítica más útil de la semana vino de alguien a quien el modelo le gusta. Pasó su propio set de tareas reales de código, y Opus 5 fue el único modelo en sacar el 100 %, con la mejor implementación y disciplina de tests que había visto. Aun así, el post lo llama “an incredible coder and really painful to work with” [4]. Esa tensión es toda la discusión en una frase.

Si lees los hilos negativos más allá del enfado, vuelven una y otra vez los mismos cinco patrones de fallo.

Pierde la visión de conjunto. Código local fuerte, decisiones más flojas sobre arquitectura, sobre la intención del sistema existente y sobre qué componentes deberían tocarse siquiera. Un desarrollador lo describió inventando mecanismos nuevos y eligiendo sus propios patrones por encima de los del repo, y acabó eligiendo Fable 5 más un Opus antiguo para el día a día [5].

Corre sobre suposiciones en vez de preguntar. Cuando faltan datos fundamentales, sigue avanzando y construye algo coherente sobre una premisa equivocada. Se siente como que “el modelo no escucha”. El mecanismo se parece más a un prior agéntico de continuar antes que bloquearse en una pregunta [5].

Canta victoria antes de tiempo. El bucle clásico: Opus dice que está arreglado, el usuario encuentra el mismo bug más una regresión, Opus se disculpa con detalle, y vuelta a empezar. En una sesión de auditoría, el modelo había pasado por alto 46 errores porque su propio script los ocultaba; otros reportan verificaciones que en realidad nunca ocurrieron [6]. En migraciones y configuración de despliegue, un “listo” falso cuesta más que un bug normal.

Habla demasiado. Narración constante, actualizaciones de estado larguísimas, detalles pequeños tratados como decisiones mayores. El mismo evaluador que le dio el 100 % describió su estilo de comunicación como nervioso y pedante, y agotador de supervisar [4].

Las instrucciones viejas lo envenenan. Al menos un usuario arregló sus problemas reescribiendo instrucciones de proyecto y memorias escritas originalmente para Opus 4.x [7]. Esos ficheros están llenos de compensaciones (“verifica siempre dos veces”, “haz primero un plan detallado”, “lanza subagentes”) que un modelo con iniciativa de serie convierte en sobreactuación.

Y aquí viene lo raro: la propia guía de prompting de Anthropic se lee como la especificación oficial de esta lista de quejas. Dice que Opus 5 narra más, se autoverifica, delega en subagentes con más facilidad, puede ampliar el alcance, puede añadir pasos que no pediste y puede aplicar su propio juicio sobre lo que la tarea “debería” ser. Los remedios recomendados: límites de alcance explícitos, topes de subagentes y un prompt dedicado para acortar las actualizaciones de estado [8].

Por equilibrio: el bando positivo es igual de real. Un tester centrado en tareas de conocimiento y negocio encontró los esfuerzos bajo y medio mejores que Sonnet 5 y que Opus 4.8, con Fable como único modelo consistentemente por delante, y solo en los problemas más duros [9].

Los benchmarks puntúan la meta, no la conducción

Los dos bandos pueden tener razón a la vez, porque un benchmark y un proyecto vivo puntúan cosas distintas.

Un benchmark comprueba si el estado final pasa. Un proyecto también valora si el modelo trabajó en el problema correcto, cuántas veces tuviste que agarrar el volante y si seguías confiando en él tres horas después. El número estrella de Anthropic en Frontier-Bench (más del doble de la puntuación de Opus 4.8) salió de una ejecución interna con un harness concreto de mini-SWE-agent, promediando cinco intentos por tarea [1]. Es una metodología legítima, y también alisa justo lo que los profesionales sienten: la varianza entre sesiones individuales.

Un dato independiente encaja incómodamente bien con las quejas. En AA-Omniscience, Artificial Analysis encontró a Opus 5 más preciso factualmente que Opus 4.8, pero también más dispuesto a responder bajo incertidumbre. Con el sistema de puntuación de ese test, su tasa de alucinación quedó alrededor del 50 % [2]. No significa que la mitad de lo que dice Opus sea inventado; el test acorrala a los modelos en cosas que saben a medias. Pero nombra un mecanismo: un modelo afinado para seguir avanzando resuelve más tareas y comete más errores con confianza, con el mismo dial.

La mitad de precio por token no es la mitad de precio por tarea

El precio de lista dice que Opus 5 cuesta la mitad que Fable 5: 5 $ de entrada y 25 $ de salida por millón de tokens, frente a 10 $ y 50 $ [10].

  • Opus 5
  • Fable 5
Precio de lista de la API para Opus 5 y Fable 5 Opus 5 cuesta 5 dólares por millón de tokens de entrada y 25 de salida; Fable 5 cuesta 10 y 50. Entrada 5 $/MTok 10 $/MTok Salida 25 $/MTok 50 $/MTok
Ver los datos en una tabla
Sentido Opus 5Fable 5
Entrada 5 $/MTok10 $/MTok
Salida 25 $/MTok50 $/MTok
Figura 2. Precio de lista de la API. Claude Platform Docs, julio de 2026.

Medido de punta a punta, la brecha se encoge. Artificial Analysis pagó 2,03 $ por tarea de Opus 5 en su batería de evaluaciones frente a 2,75 $ con Fable, un ahorro del 26 % en lugar del 50 % [2]. Y un usuario de Reddit que pasó dos tareas grandes reales por ambos modelos terminó en 106,69 $ con Opus frente a 118,46 $ con Fable, un 10 % de diferencia, juzgando además el resultado de Fable claramente mejor. En la segunda tarea, Opus salió de hecho más caro [11].

Es la prueba de una sola persona, no un estudio. Pero el mecanismo le suena a cualquiera que haya visto a un agente tomar la ruta escénica: más desvíos, más llamadas a herramientas, más código, más rondas de corrección, y al final una pasada de revisión con el modelo caro de todos modos. El precio de lista es por token. El precio real es por entregable aprobado.

Un año, cuatro personalidades de Opus

Parte del enfado es el latigazo. Si sientes que Opus cambia de carácter con cada versión, el material de la propia Anthropic te da la razón.

  1. Opus 4.6

    El obediente. Deferencia, brevedad, ejecución.

  2. Opus 4.7

    Literal y con opiniones. Llega el esfuerzo xhigh.

  3. Opus 4.8

    La corrección de calidad de vida.

  4. Opus 5

    Iniciativa total. El alcance es una sugerencia.

La línea de tiempo dibuja un péndulo, no una recta. Las fechas salen de los posts de lanzamiento [12] [13] [14] [1]; las lecturas de carácter, de la propia investigación de Anthropic sobre valores de modelos, que situó a 4.6 hacia la deferencia, la brevedad y la ejecución, y a 4.7 hacia la cautela, la profundidad y la franqueza [15]. Las notas de migración de 4.7 lo decían sin rodeos: seguimiento más literal de instrucciones, más disposición a llevar la contraria, menos llamadas a herramientas con esfuerzo bajo y prompts antiguos que podían comportarse raro [13]. 4.8 se vendió en buena parte como corrección del exceso de comentarios y explicaciones de 4.7 [14]. Opus 5 vuelve a girar hacia la iniciativa, más lejos que ninguno [8].

Cada giro invalida el folclore de prompts escrito para el modelo anterior. Las compensaciones que hacían fiable a 4.6 se convierten en la sobremarcha que hace agotador a 5. Eso, más que ninguna conspiración, explica por qué reescribir instrucciones viejas arregla tanto [7].

También explica la memoria corta. La semana de lanzamiento de Opus 4.8 produjo el mismo género de hilos que hoy apuntan a Opus 5 [16]. Nueve semanas después, hay posts que describen a 4.8 como el modelo estable de siempre que la gente quiere de vuelta [17]. Cinco días de reacciones son una lista de modos de fallo, no un veredicto.

La teoría del nerf, desmontada por capas

Cada versión de Opus acaba acumulando la acusación de que Anthropic la empeoró en silencio. Conviene separarla por capas, porque la evidencia cambia según la capa.

Los pesos. Para Claude 4.6 y posteriores, Anthropic declara que los IDs de modelo sin fecha son snapshots fijados; los pesos no se cambian bajo el mismo ID [18]. No encontré evidencia pública que lo contradiga. La versión fuerte de la teoría (“reemplazaron en secreto al buen 4.8”) no tiene nada detrás.

La capa de servicio. El enrutado, los clasificadores de seguridad y los fallbacks sí cambian. Para Opus 5 está documentado que ciertas peticiones marcadas como sensibles en ciberseguridad pueden servirse a través de un fallback a Opus 4.8, incluso en algunas evaluaciones publicadas [1]. Dos usuarios pueden llamar al mismo ID de modelo y recibir un tratamiento distinto.

El harness del producto. Aquí es donde están los cadáveres. El propio postmortem de Anthropic de abril de 2026 documenta tres regresiones reales en Claude Code mientras la API quedaba casi intacta: el esfuerzo por defecto bajó en silencio de high a medium (del 4 de marzo al 7 de abril), un bug de contexto borraba repetidamente el thinking antiguo tras inactividad (del 26 de marzo al 10 de abril), y un system prompt que recortaba la longitud de las respuestas costó de forma medible un 3 % en evaluaciones de coding (del 16 al 20 de abril) [19].

Tu propio contexto. CLAUDE.md rancios, memorias viejas, una sesión contaminada. Mismo snapshot, experiencia distinta.

Veredicto honesto sobre el “nerf”: la experiencia suele ser real y a veces hasta reproducible. El diagnóstico casi siempre señala a la capa equivocada.

Los productos de Anthropic ya asumen la división

La mejor prueba a favor del marco empleado-y-jefe es que Anthropic lo convirtió en producto.

La nueva herramienta Advisor conecta un modelo ejecutor más barato con un asesor más fuerte que puede leer la sesión de trabajo, proponer un plan o corregir el rumbo a mitad de tarea. La documentación la recomienda específicamente para diseño, arquitectura y evaluación de riesgos, y lista Opus 5 como ejecutor con Fable 5 como asesor entre las combinaciones soportadas. El asesor debe ser al menos tan capaz como el ejecutor. También avisan del modo de fallo contrario: demasiadas llamadas al asesor lo vuelven todo más lento y caro sin ganancia neta [20].

dueño

  • objetivo, límites, criterio

dirección

  • Fable 5 arquitectura, paquetes de tareas

ejecución

  • Opus 5 código, tests, verificación

revisión

  • Fable 5 auditoría por hitos
Figura 3. El reparto de trabajo en el que convergen la documentación y la mitad contenta de Reddit.

El diagrama es la conclusión práctica de toda la semana: el objetivo sigue siendo humano, Fable fija y audita la dirección, y Opus muele el trabajo del medio a mitad de precio por token.

Dos matices mantienen el marco honesto. Primero, Anthropic claramente no considera que Opus no sepa planificar: Claude Code sigue trayendo un modo oficial opusplan en el que Opus planifica y Sonnet ejecuta [21]. Segundo, Fable no es un jefe infalible. Su propia guía avisa de que puede sobreplanificar, refactorizar sin que se lo pidan e inflar el tamaño de la tarea, y de que trabaja mejor cuando le explicas por qué quieres algo [23].

Pero el posicionamiento es consistente en todas partes: Fable 5 sigue siendo el modelo más capaz disponible de forma general, recomendado cuando la capacidad importa más, mientras que Opus 5 es el valor por defecto para coding agéntico complejo por relación capacidad-precio [10]. En el lanzamiento de Fable, Anthropic lo dijo directamente: cuanto más larga y compleja la tarea, mayor la ventaja de Fable [22].

Un estudio más pertenece a esta sección. Anthropic analizó unas 400 000 sesiones de Claude Code de unos 235 000 usuarios: los humanos seguían tomando cerca del 70 % de las decisiones de planificación mientras los agentes tomaban en torno al 80 % de las de ejecución. Los prompts de usuarios experimentados disparaban de media unas 12 acciones de agente y 3200 palabras frente a 5 y 600 en los novatos, y la tasa de éxito verificada rondaba el 15 % para novatos frente al 28 a 33 % de intermedios en adelante [24]. Un modelo tan lanzado no baja el listón de la dirección. Lo sube.

Cómo usaría Opus 5 esta semana

Mi enrutado tras una semana de lectura, sujeto a revisión cuando acumule más kilómetros propios:

TareaModelo
Bug claro con reproducción y testOpus 5
Feature acotada con criterios de aceptaciónOpus 5
Refactor hacia una arquitectura objetivo conocidaOpus 5, revisión de Fable después
Causa raíz poco clara entre varios sistemasPlan de Fable 5, luego Opus 5
Arquitectura nueva que debe vivir añosFable 5 primero
Sesiones agénticas largas con varios frentesFable 5 como orquestador
Migración de alto riesgoDiseño Fable, ejecución Opus, auditoría Fable

Configuración, directa de la documentación más una opinión. Deja el thinking activado: es el valor por defecto, el esfuerzo bajo con thinking gana a desactivarlo a coste similar, y apagarlo puede provocar comportamientos raros con las herramientas [8]. Sube la escalera de esfuerzo en lugar de ir por defecto a xhigh; el ajuste cambia tanto el modelo que bajo y máximo son en la práctica productos distintos [2]. Fija IDs de modelo completos cuando compares cualquier cosa, porque los alias se mueven [21]. Y borra todas las compensaciones de la era 4.x de tus instrucciones antes de juzgar al modelo [8].

El system prompt del que yo partiría, en lugar del viejo texto de “sé exhaustivo y proactivo”:

Implement only the requested task.
Follow the existing architecture and conventions in the repository.
Do not redesign surrounding systems or refactor unrelated code
unless the acceptance criteria require it.

Before editing, state the concrete acceptance criteria.
Do not report the task as complete unless each criterion has been
verified against actual build, test, or tool output.

Do not create subagents for work you can do directly.
If you notice an unrelated problem, mention it at the end
without changing it. Keep progress updates short.

El empleado y el jefe

Opus 5 no es un Fable de saldo, y tampoco es un retroceso con nombre nuevo. En trabajo acotado con una meta clara es tan fuerte como cualquier cosa que puedas alquilar ahora mismo, y más barato que su hermano. Y la ola de críticas tampoco imagina cosas: la misma iniciativa que gana benchmarks se convierte en alcance desbocado, suposiciones confiadas y vueltas de victoria prematuras en cuanto el objetivo se vuelve difuso.

Así que dale lo que necesita todo senior brillante y demasiado seguro de sí mismo. Un jefe. El mejor disponible ahora mismo es Fable 5, y el objetivo sigue siendo tuyo.

Fuentes

  1. Introducing Claude Opus 5Anthropic · 2026-07-24
  2. Opus 5 evaluation resultsArtificial Analysis · 2026-07-24
  3. Benchmark scores and infrastructure noiseAnthropic Engineering
  4. Opus 5 is an incredible coder and really painful to work withr/ClaudeAI
  5. Opus 5 extremely RL-fried and mistake-proner/ClaudeAI
  6. Opus 5 is erm... a nightmare?r/Anthropic
  7. Fixed my Opus 5 problems by rewriting my instructionsr/ClaudeCode
  8. Prompting Claude Opus 5Claude Platform Docs
  9. Opus 5 results are really shockingr/ClaudeAI
  10. Models overviewClaude Platform Docs
  11. Opus 5 is supposed to be the cheaper Fable 5 alternative. I'm not sure the trade-off makes sense.r/ClaudeAI
  12. Introducing Claude Opus 4.6Anthropic · 2026-02-05
  13. Introducing Claude Opus 4.7Anthropic · 2026-04-16
  14. Introducing Claude Opus 4.8Anthropic · 2026-05-28
  15. Claude's values in practice across models and languagesAnthropic Research
  16. Opus 4.8 is either amazing or terrible depending on one thingr/ClaudeCode
  17. What's up with OPUS 5???r/ClaudeCode
  18. Model IDs and versionsClaude Platform Docs
  19. Postmortem of the March and April Claude Code regressionsAnthropic Engineering · 2026-04-23
  20. Advisor toolClaude Platform Docs
  21. Claude Code model configurationClaude Platform Docs
  22. Claude Fable 5 and Claude Mythos 5Anthropic
  23. Prompting Claude Fable 5Claude Platform Docs
  24. How expertise shapes Claude Code sessionsAnthropic Research