GPT-5.6 vs Claude 5: por qué difieren los benchmarks
Comparé Sol, Terra, Opus 5 y Fable 5 en benchmarks de código. El ganador cambia según la tarea, el nivel de esfuerzo, el agente y el presupuesto.
En esta página
- ¿Qué modelo usaría para cada tarea de programación?
- Cómo se diferencian GPT-5.6 y Claude 5 en precio y esfuerzo
- Qué aporta más esfuerzo: hasta 15 puntos por 16 veces más tokens
- ¿Quién gana con el mismo agente? Opus 5 y Sol empatan
- ¿Qué modelo escribe el parche más fácil de integrar?
- SWE Atlas reparte el trabajo entre Sol y Fable 5
- ¿Qué modelo resuelve mejor las tareas abiertas para agentes? Opus 5
- Cómo leer un leaderboard de 2026: compara sistemas, no nombres
Los resultados del 30 de julio de 2026 no dejan un ganador claro entre GPT-5.6 y Claude 5. En DeepSWE de Datacurve, Opus 5 y Sol empatan con un 74 % y un 73 % [1], mientras Terra iguala el 70 % de Fable 5 por menos de un cuarto del coste [1]. Elijo según la tarea y el presupuesto.
¿Qué modelo usaría para cada tarea de programación?
Usaría Terra para trabajo rutinario de gran volumen, Sol para un objetivo claro, Opus 5 para un problema desconocido y Fable 5 para cambios cuidadosos en todo el repositorio. El nombre del modelo no basta porque la tarea y el nivel de esfuerzo pueden cambiar tanto la calidad como el coste.
| El trabajo | Mi elección | Esfuerzo |
|---|---|---|
| Endpoints rutinarios, mapeos, tests pequeños y configuración | Terra | medium o high |
| Una pull request acotada con criterios de aceptación claros | Opus 5 | medium |
| Implementar un plan conocido o arreglar un bug reproducible | Sol | high |
| Encontrar la causa raíz de un fallo desconocido | Opus 5 | high o xhigh |
| Estrategia de tests para una función importante | Fable 5 | xhigh |
| Refactorizar todo el repositorio y migrar interfaces | Fable 5 | xhigh |
| Sesiones largas de terminal y depuración | Sol u Opus 5 | high o xhigh |
| Ingeniería abierta sin una solución conocida | Opus 5 | xhigh |
Los datos que respaldan estas elecciones son más útiles que cualquier clasificación universal. Sol es el único que mejora la calidad de sus parches en cada nivel de esfuerzo de FrontierCode, publicado por Cognition [15]. Fable obtiene su mejor resultado con xhigh tanto en ese benchmark como en Test Writing de Scale Labs [15] [19]. Opus 5 necesita un nivel adaptado al trabajo: medium para un cambio acotado en FrontierCode [15] y xhigh para un problema abierto en los resultados de FrontierBench de Anthropic [16].
Las recomendaciones de los proveedores encajan con esos patrones. OpenAI presenta medium como un punto de partida equilibrado [3], mientras Anthropic usa high por defecto y recomienda max solo cuando la tarea justifica los tokens adicionales [6].
Cómo se diferencian GPT-5.6 y Claude 5 en precio y esfuerzo
Terra es la excepción en precio: OpenAI cobra por ella la mitad de la tarifa de Sol, mientras OpenAI y Anthropic ofrecen alrededor de un millón de tokens de contexto en los cuatro modelos [2] [4]. Los niveles de esfuerzo pueden cambiar aún más el coste y el resultado, pero las etiquetas de los dos proveedores no se pueden comparar directamente.
Los proveedores asignan funciones distintas a estos modelos. OpenAI presenta Sol como su GPT-5.6 principal y Terra como la opción de menor coste, y el alias gpt-5.6 apunta a Sol [2] [3]. Anthropic recomienda Opus 5 para programación compleja y trabajo empresarial, mientras Fable 5 ocupa la parte más alta de su gama para agentes de larga duración [4].
Los precios de lista refuerzan esa división. Sol cuesta 5 $ por millón de tokens de entrada y 30 $ por millón de tokens de salida, mientras Terra cuesta exactamente la mitad: 2,50 $ y 15 $ [2]. Opus 5 cuesta 5 $ y 25 $, frente a los 10 $ y 50 $ de Fable 5 [5]. Anthropic también ofrece un modo más rápido de Opus 5 en vista previa de investigación, pero lo cobra a las tarifas de Fable 5 [5].
| Especificación | Sol | Terra | Opus 5 | Fable 5 |
|---|---|---|---|---|
| Entrada, $/MTok | 5,00 | 2,50 (El mejor valor de la fila) | 5,00 | 10,00 |
| Salida, $/MTok | 30 | 15 (El mejor valor de la fila) | 25 | 50 |
| Lectura de caché, $/MTok | 0,50 | 0,25 (El mejor valor de la fila) | 0,50 | 1,00 |
| Ventana de contexto | 1,05M | 1,05M | 1M | 1M |
| Niveles de esfuerzo | 6, de none a max | 6, de none a max | 5, de low a max | 5, de low a max |
La figura 1 muestra la diferencia práctica: Terra es el único modelo de menor coste del grupo. Las ventanas de contexto no permiten distinguirlos.
Los niveles de esfuerzo importan aún más que los precios de lista, pero las dos escalas funcionan de manera distinta. GPT-5.6 ofrece seis niveles, de none a max, y OpenAI recomienda medium como punto de partida equilibrado [3]. Claude ofrece cinco, usa high por defecto y aconseja xhigh para programación o trabajo exigente con agentes. Anthropic reserva max para tareas que justifican un consumo de tokens sin límite [6]. Como estas etiquetas no son unidades normalizadas, el high de OpenAI puede representar una cantidad de cómputo distinta al de Anthropic.
Qué aporta más esfuerzo: hasta 15 puntos por 16 veces más tokens
Pasar de low a max añade entre 10 y 15 puntos al Intelligence Index de Artificial Analysis, pero consume entre ocho y dieciséis veces más tokens. Opus 5 sube de 51 a 61, Sol de 49 a 59 y Terra de 40 a 55 [9] [10] [11].
La versión 4.1 del índice combina nueve evaluaciones que cubren trabajo en terminal, resolución de tareas reales, GPQA Diamond y razonamiento con contextos largos. Asigna un peso del 34 % a las tareas de agentes, del 24 % al código, otro 24 % al razonamiento científico y del 18 % al razonamiento general [12]. Lo más importante para esta comparación es que Artificial Analysis ejecutó la misma batería con cada nivel de esfuerzo, así que los cambios forman una serie coherente.
- Opus 5
- Sol
- Terra
Ver los datos en una tabla
| Esfuerzo | Opus 5 | Sol | Terra |
|---|---|---|---|
| low | 51 | 49 | 40 |
| medium | 56 | 54 | 46 |
| high | 59 | 56 | 49 |
| xhigh | 60 | 58 | 52 |
| max | 61 | 59 | 55 |
La figura 2 mantiene los modelos en el mismo orden en todos los niveles: Opus 5 lidera, Sol queda unos dos puntos por detrás y Terra ocupa el tercer lugar. Lo que cambia cerca del máximo es el valor de subir otro escalón. Opus 5 solo gana 0,62 puntos sin redondear al pasar de xhigh a max, aunque el uso de tokens de salida aumenta de 76 a 100 millones [9].
Los totales de tokens muestran el mismo intercambio. Opus 5 pasa de 12 millones de tokens de salida con low a 100 millones con max, Sol de 6,6 a 70 millones y Terra de 5,9 a 96 millones [9] [10] [11]. El último escalón de Terra resulta especialmente caro porque pasar de xhigh a max casi triplica su salida a cambio de tres puntos del índice [11].
No se puede seguir a Fable 5 por la misma curva porque Artificial Analysis solo publica su resultado con max: 60 puntos con 87 millones de tokens de salida, un punto redondeado menos que Opus 5 [13].
En los dos modelos de Anthropic, el sistema recurrió a Opus 4.8 cuando la capa de seguridad detuvo un prompt [13] [14]. Una vez establecida esa salvedad, Artificial Analysis calcula un coste de 2,03 $ por tarea del índice para Opus 5 y 2,75 $ para Fable 5 [14].
¿Quién gana con el mismo agente? Opus 5 y Sol empatan
DeepSWE de Datacurve no produce un ganador claro cuando los 18 modelos usan el mismo mini-swe-agent. Con max, Opus 5 resuelve el 74 % ± 4 de las tareas y Sol el 73 % ± 3 [1]. Sus intervalos de confianza se solapan, así que la diferencia de un punto no es significativa. Fable 5 y Terra les siguen con el mismo 70 % [1].
Doy más peso a DeepSWE precisamente porque el harness compartido elimina una fuente importante de variación. Sus 113 tareas abarcan 91 repositorios y cinco lenguajes, y los autores las escribieron desde cero para impedir que los modelos hubieran visto las soluciones durante el entrenamiento [1]. Los verificadores escritos a mano comprueban el comportamiento en lugar de detalles de implementación. Los prompts tienen cerca de la mitad de longitud que los de SWE-bench Pro, pero las soluciones requieren 5,5 veces más código [1].
| Medición | Opus 5 | Sol | Fable 5 | Terra |
|---|---|---|---|---|
| Tareas resueltas, % | 74 | 73 | 70 | 70 |
| Coste por tarea, $ | 11,84 | 8,39 | 21,63 | 4,95 (El mejor valor de la fila) |
| Tokens de salida, K | 118 | 60 (El mejor valor de la fila) | 119 | 72 |
| Pasos del agente | 99 | 61 (El mejor valor de la fila) | 88 | 76 |
La figura 3 no marca un ganador en la fila de tareas resueltas porque 74 % ± 4 y 73 % ± 3 representan un empate estadístico, tal como advierte Datacurve al hablar de los intervalos de confianza solapados [1]. La diferencia más clara está en cómo llegan al resultado. Sol usa 60.000 tokens de salida y 61 pasos, frente a los 118.000 tokens y 99 pasos de Opus 5, lo que reduce su coste por tarea intentada de 11,84 $ a 8,39 $ [1].
La diferencia de coste es todavía mayor entre Terra y Fable 5. Ambos resuelven el 70 % de las tareas, pero Terra cuesta 4,95 $ por intento y Fable 21,63 $ [1]. Dividir esas cifras por la tasa de resolución da una estimación optimista de 7,07 $ por tarea resuelta con Terra y 30,90 $ con Fable. Usé el mismo método en mi análisis de Kimi K3.
- tareas resueltas con max
- 70 %
- igual que Fable 5 max
- medido, por tarea intentada
- 4,95 $
- Fable 5 max: 21,63 $
- calculado, por tarea resuelta
- 7,07 $
- el menor coste de los cuatro con max
Incluso dentro de un mismo modelo, max no siempre ofrece la mejor relación entre coste y resultado. Opus 5 con high obtiene 73 % ± 2 por 6,08 $ por tarea, prácticamente lo mismo que Sol max por menos dinero, mientras Sol con xhigh alcanza 71 % ± 1 por 4,70 $ [1]. Fable muestra el intercambio con mayor claridad: xhigh y max resuelven un 70 %, pero xhigh cuesta 13,41 $ en vez de 21,63 $ [1]. La comparación entre coste y puntuación de Datacurve identifica Opus 5 max, Fable 5 high y Sol medium como configuraciones eficientes [1].
¿Qué modelo escribe el parche más fácil de integrar?
Fable 5 xhigh y Opus 5 medium están prácticamente empatados al frente de FrontierCode de Cognition, que pregunta si los responsables de un repositorio aceptarían un parche [15]. El resultado más útil es que Opus alcanza su máximo con medium, no con max.
El benchmark usa tareas escritas por los responsables de los repositorios analizados. Una ejecución obtiene cero si consulta una fuente que contiene la solución, y el evaluador comprueba la corrección, la calidad de los tests, el alcance y las convenciones del código.
Las mejores puntuaciones exactas son 53,5 para Fable 5 xhigh, 53,4 para Opus 5 medium, 47,5 para Sol max y 41,3 para Terra max [15].
- Fable 5
- Opus 5
- Sol
Ver los datos en una tabla
| Esfuerzo | Fable 5 | Opus 5 | Sol |
|---|---|---|---|
| low | 48,0 | 41,9 | 35,4 |
| medium | 49,8 | 53,4 | 39,9 |
| high | 52,7 | 48,0 | 45,1 |
| xhigh | 53,5 | 43,6 | 46,8 |
| max | 51,6 | 48,0 | 47,5 |
La figura 5 muestra tres respuestas distintas al esfuerzo adicional. Sol mejora de forma constante, de 35,4 con low a 47,5 con max [15], mientras Fable 5 alcanza 53,5 con xhigh y pierde 1,9 puntos con max. Opus 5 es menos predecible: llega a 53,4 con medium, cae a 43,6 con xhigh y solo se recupera hasta 48,0 con max [15]. La ficha técnica de Anthropic muestra la misma curva y confirma medium como el mejor nivel de Opus 5 en el conjunto principal [16].
La forma en que FrontierCode puntúa los parches ayuda a explicar por qué más esfuerzo puede empeorar el resultado. El benchmark premia que el cambio respete el alcance [15] y busca patrones de implementación prohibidos [16], mientras un nivel más alto puede llevar al modelo a explorar más archivos y ampliar la modificación. Ese comportamiento puede ayudar en una investigación abierta, pero perjudica a una pull request con un objetivo limitado. Observé la misma tendencia cuando Opus 5 dirigió mi semana.
La ventaja de 0,1 puntos de Fable sobre Opus 5 medium no basta para declarar un ganador porque cada configuración solo tiene cinco ejecuciones y ambas resuelven el 58,9 % de las tareas [15].
Los costes son menos ambiguos: Fable xhigh cuesta 13,09 $ por ejecución, frente a los 4,30 $ de Opus medium. El mejor resultado de Sol, 47,5, también queda por debajo del peor de Fable, 48,0 [15].
Por tanto, Claude lidera este benchmark de calidad de parches. El límite importante es que Claude se ejecutó en Claude Code, mientras GPT-5.6 se ejecutó en Codex [15].
SWE Atlas reparte el trabajo entre Sol y Fable 5
En las ejecuciones de SWE Atlas de Scale Labs, Sol lidera la comprensión del código, mientras Fable 5 encabeza la escritura de tests y la refactorización [17] [19] [20]. Una ejecución independiente de Artificial Analysis invierte el orden en comprensión, lo que muestra cuánto puede influir la configuración del agente [18].
La comprensión del repositorio cambia con el agente
Codebase QnA coloca un repositorio real en un contenedor y plantea al agente 124 preguntas que exigen ejecutar el software y seguir su funcionamiento. La arquitectura aporta un 35 % de la puntuación y el análisis de causa raíz un 30 % [17].
Scale Labs publica 46,0 ± 5,0 para Sol xhigh en Codex y 39,0 ± 5,0 para Fable 5 en Claude Code, aunque ambos modelos perdieron puntos cuando sus filtros de seguridad les hicieron rechazar preguntas inofensivas [17]. Opus 5 y Terra no tienen resultados, y Opus 4.8, de la generación anterior, lidera el tablero con 57,26 [17].
Artificial Analysis obtiene un orden distinto con las mismas 124 preguntas. En su Coding Agent Index, Opus 5 xhigh logra 54,8, Fable 5 obtiene 48,9 y Sol max 43,3 [18]. Como las tareas no cambiaron pero sí las ejecuciones y los harnesses, la inversión muestra cuánto puede influir el sistema que rodea al modelo en un leaderboard.
Fable 5 lidera la escritura de tests y la refactorización
El benchmark Test Writing de Scale Labs usa 90 tareas para comprobar si un agente entiende el comportamiento que pone a prueba. Cada test generado debe pasar con la implementación real y fallar después de modificar a propósito el código relevante, así que los tests vacíos no puntúan [19]. Fable 5 obtiene 55,6 ± 5,8 frente al 45,9 ± 6,0 de Sol, pero los intervalos solapados dejan a ambos modelos en primer lugar [19].
- Fable 5
- Sol
Ver los datos en una tabla
| Benchmark | Fable 5 | Sol |
|---|---|---|
| Codebase QnA | 39,0 | 46,0 |
| Test Writing | 55,6 | 45,9 |
La figura 6 asigna una fortaleza distinta a cada modelo en las ejecuciones de Scale: Sol responde mejor a preguntas sobre un repositorio desconocido, mientras Fable escribe mejores tests para él.
La refactorización es la victoria publicada más clara de Fable, con 54,76 ± 6,76. Las 70 tareas cubren descomposición, cambios de interfaces, extracción y traslado de código, mientras los evaluadores buscan regresiones, puntos de llamada rotos, dependencias circulares y código muerto [20].
Opus 5, Sol y Terra no tienen resultados en este benchmark. El mejor modelo GPT de la lista es GPT-5.5, de la generación anterior, con 44,79 [20]. Esas filas ausentes limitan la comparación, no cuentan como ceros.
¿Qué modelo resuelve mejor las tareas abiertas para agentes? Opus 5
Opus 5 presenta el caso más sólido en el conjunto de tareas abiertas para agentes. Artificial Analysis no puede separar con seguridad a Sol, Opus 5 y Terra en Terminal-Bench 2.1 [21], pero los resultados publicados por Anthropic sitúan a Opus por delante en FrontierBench, OSWorld y AutomationBench [16].
Los tres líderes siguen muy cerca en Terminal-Bench
Artificial Analysis publica un 89,5 % para Sol xhigh y un 89,1 % para Opus 5 max, mientras Sol max, Terra max y Opus 5 xhigh obtienen todos un 88,0 % [21].
El benchmark comprueba si un modelo puede usar una shell hasta alcanzar un resultado verificado. Con 89 tareas y tres repeticiones, un solo intento distinto mueve la puntuación cerca de 0,4 puntos [12]. Fable 5 queda más atrás con un 84,6 % [21].
Ver los datos en una tabla
| Configuración | Valor |
|---|---|
| Sol xhigh | 89,5 % |
| Opus 5 max | 89,1 % |
| Terra max | 88,0 % |
| Fable 5 max | 84,6 % |
La figura 7 no permite declarar un ganador claro entre Sol y Opus 5, mientras Terra se mantiene cerca pese a que su precio de entrada es de 2,50 $ por millón de tokens [2] [21]. La tabla de lanzamiento de OpenAI publica cifras algo distintas: 88,8 % para Sol, 87,4 % para Terra y 83,1 % para Fable 5 [7]. El cambio entre los resultados de OpenAI y la ejecución independiente es casi tan grande como las diferencias entre los modelos líderes, otra razón para no dar demasiada importancia a su orden.
El trabajo abierto más difícil favorece a Opus 5
El mismo equipo diseñó FrontierBench v0.1 con 74 tareas más difíciles de biología computacional, simulación física, CAD, demostraciones formales y rendimiento de GPU [16]. Anthropic ejecutó los modelos con mini-swe-agent y encontró una ventaja más clara para Opus 5: 44,4 % con xhigh, 43 % con max y 39 % con high, que usa un 19 % menos de tokens de salida que max. Sol obtiene 37,5 % y Fable 5 un 33,7 %, ambos con max [16]. En estos problemas abiertos, Opus 5 tiene el mejor resultado publicado.
Otros dos benchmarks amplían esa ventaja a tareas largas que usan muchas herramientas. En OSWorld 2.0, donde un modelo controla una máquina virtual Ubuntu con ratón y teclado durante un máximo de 500 acciones por tarea, Opus 5 obtiene 70,6 %, Fable 5 un 66,1 % y Sol un 62,6 %. Anthropic toma el resultado de Sol del artículo de lanzamiento de OpenAI [16].
AutomationBench de Zapier simula en cambio una empresa con 47 aplicaciones y varias políticas de negocio. Opus 5 max obtiene 26,0 %, mientras medium logra un 24 % con un coste de 0,89 $ por tarea, frente al 18,1 % de Sol y el 17,4 % de Fable [16]. Desde entonces la fila superior de AutomationBench ha cambiado, y explico por qué la mejor puntuación de AutomationBench corresponde a dos modelos.
Opus 5 lidera ambos entornos, pero la pequeña diferencia entre medium y max vuelve a mostrar que el nivel de esfuerzo más alto no siempre es necesario.
Cómo leer un leaderboard de 2026: compara sistemas, no nombres
Un leaderboard mide una configuración completa: un modelo, un harness, un nivel de esfuerzo y un evaluador. Cambiar cualquiera de esas partes puede mover la puntuación más que la distancia entre el primer y el cuarto puesto, así que aplico cinco comprobaciones antes de comparar resultados.
| La comprobación | El ejemplo en esta comparación |
|---|---|
| Pregunta qué harness se usó | SWE-bench Pro da 80,0 a Fable, 79,2 a Opus 5 y 64,6 a Sol, cada uno con el agente de su proveedor [16]; el agente compartido de DeepSWE concentra esos modelos en un margen de cuatro puntos [1] |
| Respeta los intervalos de error | 74 ± 4 frente a 73 ± 3 [1]; tres empates exactos en 88,0 % [21]; una ventaja de 0,1 puntos en cinco ejecuciones [15] |
| Detecta la saturación | Opus 5 obtiene 96,0 % en SWE-bench Verified [16]; un leaderboard sin margen de mejora no permite ordenar nada |
| Comprueba la versión | La página de lanzamiento de OpenAI cita Coding Agent Index v1.1 con Sol en 80 [7]; la versión 1.3 actual puntúa Sol max con 67 [18] |
| Ausente no significa cero | Opus 5 no tiene fila en ninguno de los tres leaderboards de Scale [17] [19] [20]; Terra apenas aparece fuera de DeepSWE y FrontierCode |
Los números de versión merecen especial atención porque un nombre conocido puede ocultar una prueba distinta. Coding Agent Index da 80 y 67 a la misma familia de modelos en v1.1 y v1.3, pero esas cifras no se pueden comparar. En DeepSWE, GPT-5.5 xhigh también pasó del 70 % en v1 al 67 % en v1.1 [1]. Sin la versión, el resultado está incompleto. Un ejemplo posterior es el recálculo de Muse Spark 1.3 en el índice de Artificial Analysis.
Incluso las fuentes primarias pueden dejar detalles importantes sin resolver. La ficha técnica de Opus 5 etiqueta la ejecución de Sol en FrontierBench como Codex en su tabla resumen, pero la sección de métodos dice mini-swe-agent sobre la misma infraestructura y no explica el conflicto [16]. Su resultado de SWE-bench Multimodal, 59,4 para Opus 5 frente a 54,1 para Fable, también procede de un harness interno modificado a partir de la versión pública [16].
Scale añade más variación al conceder 500 pasos a las nuevas ejecuciones de mini-swe-agent en vez de los 250 anteriores, y observa que los modelos líderes funcionan mejor con sus harnesses nativos [17]. Ninguna de estas decisiones vuelve deshonestos los resultados, pero juntas muestran que muchas filas miden sistemas distintos. Mi análisis de Kimi K3 y GLM-5.2 llegó a la misma conclusión con otros datos: las capacidades son reales, pero muchas puntuaciones no se pueden comparar directamente.
Tres resultados ausentes podrían cambiar estas recomendaciones: Opus 5 en los benchmarks de Scale, una serie pública de esfuerzo para Fable 5 y pruebas de cada modelo con el harness del otro proveedor. Hasta que existan, elegiría según la tarea y no según el puesto más alto. El modelo más caro rara vez es el mejor en todo, Terra se mantiene cerca en varios benchmarks y reducir el esfuerzo puede mejorar tanto el coste como la calidad del parche. OpenAI ya ha lanzado un sucesor de Sol, y mi comparación de GPT-6 Astra con Sol 5.6 continúa desde aquí.
Fuentes
- DeepSWE leaderboard
- API models
- Latest model guide
- Models overview
- Pricing
- Effort
- GPT-5.6
- Codex models
- Claude Opus 5 analysis
- GPT-5.6 Sol analysis
- GPT-5.6 Terra analysis
- Intelligence benchmarking methodology
- Claude Fable 5 analysis
- Opus 5: Fable 5 level intelligence at a lower cost per task
- FrontierCode leaderboard
- Claude Opus 5 system card
- SWE Atlas: Codebase QnA
- Coding Agent Index
- SWE Atlas: Test Writing
- SWE Atlas: Refactoring
- Terminal-Bench v2.1 evaluation