Opus 5.5 programa mejor. El coste por tarea no está claro

Opus 5.5 mejora en pruebas independientes y baja el precio de los tokens. Comparo el coste por tarea, el esfuerzo y las primeras experiencias en Reddit.

Lanzamientos
En esta página
  1. ¿Cuánto mejora Opus 5.5 al programar?
  2. ¿Opus 5.5 es realmente más barato por tarea?
  3. ¿Qué dice Reddit sobre trabajar con Opus 5.5?
  4. ¿Qué deben revisar los desarrolladores antes de cambiar?

Claude Opus 5.5 llegó el 22 de septiembre de 2026 con tokens más baratos y una mejora clara en pruebas independientes de programación. Merece la pena probarlo, pero el coste por tarea terminada exige más atención: los ahorros de Anthropic y las mediciones de Artificial Analysis con esfuerzo máximo corresponden a tareas y ajustes distintos. Yo empezaría con esfuerzo medio. [1] [2] [3]

¿Cuánto mejora Opus 5.5 al programar?

El resultado independiente muestra un avance importante frente a Opus 5: Artificial Analysis registra una mejora de 10,6 puntos porcentuales en Terminal-Bench 4.0. La prueba asigna tareas prácticas de terminal a un agente, por lo que se acerca más al trabajo en un repositorio que una pregunta breve de programación. [2]

Ver los datos en una tabla
Prueba Opus 5.5Opus 5
Terminal-Bench 4.0 59,6 %49,0 %
Figura 1. Artificial Analysis, Terminal-Bench 4.0. Esfuerzo máximo, consulta del 22 de septiembre de 2026. [2]

Artificial Analysis ejecuta las 66 tareas con mini-swe-agent y promedia el éxito en un solo intento a lo largo de tres repeticiones. Mantener el mismo software de agente hace útil la comparación. Aun así, mide esa configuración concreta, no todas las formas de utilizar Claude Code. [2]

Los resultados de CursorBench publicados por Anthropic apuntan en la misma dirección: un 57,8 % con esfuerzo máximo frente al 46,6 % de Opus 5. Incluso el 52,5 % de Opus 5.5 con esfuerzo medio supera aquel máximo anterior. Según la ficha del sistema de Anthropic, Cursor realizó la evaluación con su propio software de agente. Es una evidencia adicional, pero procede de una configuración distinta a la de Artificial Analysis. [10]

Me interesa más ese resultado medio que otra victoria con esfuerzo máximo. En mi análisis de Opus 5 como desarrollador ejecutor, el problema era cuánta supervisión podía seguir necesitando un buen código. Obtener un resultado mejor con menos razonamiento sería útil; conseguirlo tras una ejecución mucho más larga supone otro compromiso.

¿Opus 5.5 es realmente más barato por tarea?

Opus 5.5 cuesta menos por token de entrada y salida, pero la factura depende de cuánto trabajo haga. Claude Platform Docs indica 4 dólares por millón de tokens de entrada y 20 por millón de salida, frente a los 5 y 25 dólares de Opus 5. Anthropic anuncia un coste típico por tarea aproximadamente un 40 % menor porque el nuevo modelo también consume menos tokens en sus evaluaciones. [5] [1]

Artificial Analysis aporta un contraste útil. Su Intelligence Index actual sube de 51 a 58, mientras que el coste medido por tarea del índice aumenta ligeramente de 5,86 a 5,98 dólares con esfuerzo máximo. Son tareas de su conjunto de evaluación, no una predicción de tu factura media al programar. [3] [4]

Artificial Analysis, esfuerzo máximo, consulta del 22 de septiembre de 2026. Los puntos del índice no son porcentajes. [3][4]

Medición independiente Opus 5 Opus 5.5
AA Intelligence Index v4.3.2 51 58 (El mejor valor de la fila)
Coste por tarea del índice, USD 5,86 5,98

En esa configuración, se obtiene más capacidad medida por una cantidad casi idéntica. Esto no contradice los ahorros de Anthropic en otras tareas, pero yo no incluiría una reducción universal del 40 % en un presupuesto. La versión del índice también importa: ambas puntuaciones corresponden a v4.3.2. Una puntuación antigua de Opus 5 calculada con otra versión no se puede comparar directamente con 58.

La guía de prompting de Anthropic explica por qué conviene revisar el esfuerzo. Con el mismo nombre de ajuste, Opus 5.5 puede razonar más por turno que Opus 5, especialmente en xhigh y max. Recomienda volver a probar los niveles en lugar de conservar la elección anterior. También afirma que el nivel medio puede igualar o superar a Opus 5 en alto al programar y realizar trabajo intelectual. [6]

Mi lectura práctica es pagar por el razonamiento que necesita la tarea. Usar siempre el máximo impediría comprobar si el nuevo modelo termina el mismo trabajo con menos esfuerzo.

¿Qué dice Reddit sobre trabajar con Opus 5.5?

Los testimonios más útiles del día de lanzamiento hablan de respuestas más cortas y una interacción más sencilla, con desacuerdos sobre los fallos al programar. Son aportaciones voluntarias del 22 de septiembre, no una tasa de fallos medida. No he realizado una comparación práctica controlada para este artículo.

En r/ClaudeCode, un usuario publicó respuestas de varias generaciones de Opus al mismo prompt y encontró más legibles las de 5.5 que las de 5. Es un ejemplo limitado, pero ofrece algo concreto que examinar en lugar de afirmar que el modelo simplemente parece más inteligente. [7]

Otro hilo de r/ClaudeAI elogia la velocidad y la detección de problemas de interfaz. Entre los comentarios aparece también un caso de un bucle de ediciones. Un tercer hilo reúne tanto experiencias con respuestas más rápidas como una queja sobre implementaciones incompletas e instrucciones del proyecto ignoradas. [8] [9]

Para mí, eso justifica evaluar la comunicación y el seguimiento de instrucciones por separado de la calidad del código. Un modelo puede entregar un parche mejor y aun así hacer agotadora la sesión. Por eso mi evaluación del flujo de trabajo con Opus 5 dedica tanto espacio al alcance de la tarea y a las instrucciones existentes.

¿Qué deben revisar los desarrolladores antes de cambiar?

Migrar la API requiere algo más que sustituir el nombre del modelo. Opus 5.5 utiliza claude-opus-5-5, arranca con esfuerzo medio y mantiene siempre activo el razonamiento adaptativo. La documentación también recoge cambios en el uso de herramientas, incluidos errores cuando se fuerza su llamada. Las integraciones de agentes existentes deberían revisar esas notas antes de migrar. [5]

Para el uso habitual de Claude Code, empezaría con un error existente y una prueba de aceptación conocida. Después anotaría si el esfuerzo medio produce un parche aceptable. También contaría las correcciones: repetir la misma instrucción forma parte del coste aunque ese tiempo no aparezca en la factura de la API.

La alternativa también cambió ese día. Las bajadas de precio y los benchmarks de GPT-6 Sol y Luna ofrecen otro argumento para el trabajo diario, con avances menores en el índice de inteligencia y tokens mucho más baratos. Los compararía en una tarea que conozca lo bastante para revisar el resultado y elegiría el modelo que consiga una entrega aceptable con menos intervenciones.

Fuentes

  1. Introducing Claude Opus 5.5Anthropic · 2026-09-22
  2. Terminal-Bench 4.0Artificial Analysis
  3. Claude Opus 5.5 model analysisArtificial Analysis
  4. Claude Opus 5 model analysisArtificial Analysis
  5. Claude Opus 5.5 overviewClaude Platform Docs
  6. Prompting Claude Opus 5.5Claude Platform Docs
  7. Proof that Opus 5.5 is easier to talk to/deal withReddit, r/ClaudeCode · 2026-09-22
  8. Opus 5.5 in Claude Code is crazy fast especiallyReddit, r/ClaudeAI · 2026-09-22
  9. Opus 5.5 in the release notesReddit, r/ClaudeAI · 2026-09-22
  10. Claude Opus 5.5 System CardAnthropic