DeepSeek compara V4 Flash con Opus 4.8 y pierde las nueve filas
La tabla de lanzamiento de V4 Flash pone a Claude Opus 4.8 por delante en los nueve benchmarks. Compruebo qué compran 0,14 y 0,28 dólares por millón.
DeepSeek publicó la versión oficial de V4 Flash el 31 de julio de 2026 [1], y su gráfico de lanzamiento hace algo poco habitual: compara el modelo con Claude Opus 4.8 en nueve benchmarks y pierde todas las filas [2]. Aun así hay entusiasmo, y la razón es el precio: 0,14 dólares por millón de tokens de entrada y 0,28 por millón de salida [3], frente a los 5 y 25 dólares de Opus 4.8 [4].
El modelo lleva tres días publicado mientras escribo esto, así que nada de lo que sigue es un veredicto de primera mano. Lo que hice fue revisar el material de lanzamiento de DeepSeek, las cifras oficiales de Anthropic para Opus 4.8, las tablas públicas y las primeras mediciones independientes para responder dos preguntas. ¿Qué significa “cerca de Opus 4.8” cuando lees las notas al pie? ¿Y qué te cuesta en realidad un descuento de entre el 97 y el 99 por ciento?
¿Qué salió exactamente el 31 de julio?
DeepSeek-V4-Flash-0731 es la versión oficial de un modelo que llevaba en preview pública desde el 24 de abril de 2026 [1]. DeepSeek explica que la nueva versión conserva la arquitectura y el tamaño de la preview y que solo repitió el post-entrenamiento, es decir, el modelo base no cambió y únicamente se rehicieron las últimas fases de entrenamiento [1]. Por dentro, V4 Flash es un modelo de mezcla de expertos con 284.000 millones de parámetros totales, de los que 13.000 millones se activan por token, y acepta un contexto de un millón de tokens [5].
Los pesos están en Hugging Face bajo licencia MIT, así que el uso comercial y el autoalojamiento no tienen restricciones [2]. En la API, DeepSeek cambió la versión sin avisar en el nombre: el identificador sigue siendo deepseek-v4-flash, y las integraciones existentes pasaron a la nueva versión sin tocar la configuración [1]. Eso resulta cómodo para el usuario e incómodo para cualquiera que cite resultados, porque “V4 Flash” ahora designa dos versiones distintas según la fecha en que se midió cada cifra. El modelo expone un parámetro de esfuerzo de razonamiento con tres niveles, low, high y max, en lugar de publicar una variante de razonamiento separada [2].
Y luego está la lista de precios, que es el motivo de que este lanzamiento haya hecho ruido mucho más allá del circuito de seguidores de modelos. Nikkei Asia lo encuadró en una guerra de precios cada vez más intensa en los modelos de IA, y contó que DeepSeek planea introducir más adelante tarifas por hora punta [6]. La página de precios de DeepSeek confirma ese plan: cuando la política entre en vigor, los precios se duplicarán en horas punta, algo que todavía no ha ocurrido [3]. El hermano mayor, V4 Pro, sigue en preview a 0,435 dólares de entrada y 0,87 de salida, con su versión oficial anunciada como próxima [1] [3].
- precio de entrada, sin caché
- 0,14 $/MTok
- Opus 4.8: 5 $
- precio de salida
- 0,28 $/MTok
- Opus 4.8: 25 $
- ventana de contexto
- 1M
- salida máxima de 384K tokens
- parámetros activos
- 13B
- de 284B totales, licencia MIT
Por millón de tokens de salida, Opus 4.8 cuesta 89 veces más que V4 Flash. Que esa proporción importe o no depende por completo de cuánta capacidad hay al otro lado, que es justo lo que la tabla de lanzamiento debería establecer.
¿Qué tan cerca está de Opus 4.8?
No tan cerca como sugieren los resúmenes que circulan. La model card de Hugging Face compara V4-Flash-0731 con Claude Opus 4.8 en nueve benchmarks de agentes y programación, y Opus 4.8 gana todas las filas [2]. Dos de las distancias son realmente pequeñas: medio punto en Agents’ Last Exam y 2,3 puntos en Terminal-Bench 2.1. Otras son amplias: 15,5 puntos en NL2Repo y 12,1 en DSBench-Hard.
| Benchmark | V4 Flash 0731 | Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 (El mejor valor de la fila) | 81,0 |
| NL2Repo | 54,2 | 69,7 (El mejor valor de la fila) | 48,9 |
| Cybergym | 76,7 | 83,1 (El mejor valor de la fila) | - |
| DeepSWE | 54,4 | 58,0 (El mejor valor de la fila) | 46,2 |
| Toolathlon Verified | 70,3 | 76,2 (El mejor valor de la fila) | 59,9 |
| Agents' Last Exam | 25,2 | 25,7 (El mejor valor de la fila) | 23,8 |
| AutomationBench Public | 25,1 | 27,2 (El mejor valor de la fila) | 12,9 |
| DSBench FullStack | 68,7 | 71,6 (El mejor valor de la fila) | 61,8 |
| DSBench Hard | 59,6 | 71,7 (El mejor valor de la fila) | 54,5 |
La tabla muestra un patrón consistente: V4 Flash queda cerca de Opus 4.8 en los benchmarks de tareas de terminal y claramente por detrás en cuanto el trabajo exige entender o construir un repositorio. Frente a GLM-5.2, el otro modelo chino del gráfico, V4 Flash gana las ocho filas que comparten.
Para ser justos con DeepSeek, su propio encuadre es más modesto que la cobertura. La afirmación central de la card es que la nueva versión supera a la preview del V4 Pro, más grande, activando muchos menos parámetros [2], y publicar una comparación que pierdes en todas las filas es más honesto que la práctica habitual de enseñar solo las victorias.
El rival elegido tiene, eso sí, un problema silencioso. Opus 4.8 era el mejor modelo disponible de Anthropic cuando salió el 28 de mayo de 2026 [7], pero diez semanas después figura en la sección de modelos legacy de la lista de Anthropic [8]. Opus 5 llegó el 24 de julio al mismo precio de 5 y 25 dólares, y Anthropic dirige ahora el trabajo nuevo hacia él, con Fable 5 por encima de ambos [9]. Acercarse a Opus 4.8 en agosto de 2026 significa acercarse a la frontera de mayo, y el mismo dinero compra hoy un Claude más fuerte.
¿Qué puntuación de Opus 4.8 hay que creerse?
Depende de quién ejecutó el benchmark, y la dispersión es tan grande que se traga la comparación entera. El harness de DeepSeek da a Opus 4.8 un 85,0 en Terminal-Bench 2.1 [2]. La tabla pública de Terminal-Bench lista a Opus 4.8 ejecutándose en Claude Code con un 78,9 % [10]. Y el system card de Anthropic reporta un 74,6 %, medido con esfuerzo high en el harness Terminus-2 [7].
Ver los datos en una tabla
| Fuente | Valor |
|---|---|
| DeepSeek Harness, esfuerzo max | 85,0 % |
| Tabla de Terminal-Bench, Claude Code | 78,9 % |
| System card de Anthropic, Terminus-2, esfuerzo high | 74,6 % |
Eso es una dispersión de 10,4 puntos para un solo modelo en un solo benchmark, y el 82,7 de V4 Flash cae dentro de ella. Según qué cifra de Opus pongas al lado, el modelo de DeepSeek está 2,3 puntos por detrás, 3,8 por delante u 8,1 por delante. Una comparación capaz de producir las tres conclusiones a la vez no es realmente una comparación.
La dispersión no es señal de trampa. Cada fuente usó un montaje distinto: otro harness de agente, otro nivel de esfuerzo, otros límites de tiempo. El system card de Anthropic incluso señala que Terminal-Bench penaliza los endpoints lentos, porque las tareas corren contra límites fijos de reloj [7]. Fíjate en que el harness de DeepSeek dio a Opus 4.8 una cifra más alta que la medición de la propia Anthropic, así que DeepSeek no rebajó a su rival. Simplemente, los números salen de montajes que no se pueden comparar entre sí.
Lo que zanjaría la cuestión es que un tercero pasara ambos modelos por un mismo harness. Las cifras de DeepSeek salen de su propio DeepSeek Harness, del que no encontré ninguna versión pública, y a 3 de agosto de 2026 no localicé ninguna reproducción independiente de ninguna de las nueve filas. Hasta que exista una, la tabla de lanzamiento es una afirmación, no una medición.
¿Qué muestran los primeros números independientes?
Por ahora existe una sola evaluación estandarizada de terceros. Artificial Analysis midió V4-Flash-0731 con un 50 en su Intelligence Index el 31 de julio, diez puntos por encima de la preview de abril y un punto por detrás de GPT-5.6 Luna con esfuerzo max [11]. En esa misma clasificación, a 3 de agosto, Gemini 3.6 Flash también está en 50, GLM-5.2 en 51, GPT-5.6 Terra en 55 y Kimi K3 en 57 [12]. La posición independiente es, por tanto, lo más alto de la gama económica y no la frontera, y como Opus 4.8 no aparece en ese índice, no existe ningún número independiente para la comparación con Opus.
El lado de los costes es donde los datos independientes se ponen interesantes. Ejecutar el índice completo le costó a Artificial Analysis 72,02 dólares con V4 Flash [13], frente a 176,34 dólares con el V4 Pro de la propia DeepSeek, que puntuó seis puntos menos, un 44 [14]. Que el modelo pequeño supere a su hermano grande era la afirmación central del lanzamiento de DeepSeek, y esto la confirma en un harness independiente: mejores resultados al 40 por ciento del coste.
El consumo de tokens merece su propia frase, porque la tarifa barata lo esconde. V4 Flash necesitó unos 206 millones de tokens de salida para completar el índice, un 12 por ciento menos que la versión de abril [11], pero todavía más que los 180 millones que usó V4 Pro [14]. El modelo es barato por token, no ahorrador de tokens, así que un presupuesto basado en los consumos de otro modelo se quedará corto.
Dos lecturas independientes más completan el cuadro. En GDPval-AA v2, una comparación de tareas de trabajo puntuada por votos de preferencia, la nueva versión alcanzó un Elo de 1559, desde los 1189 de la preview de abril [11], y su tasa de alucinación en la prueba AA-Omniscience mejoró 12 puntos hasta el 84 por ciento, lo que es un avance desde un punto de partida malo y no un buen resultado [11]. En la tabla WebDev de Arena, donde personas votan entre aplicaciones web generadas, V4 Flash con esfuerzo high ocupaba el séptimo puesto con un Elo de 1577 el 3 de agosto, frente a los 1705 de Opus 5 Max en cabeza [15]. Y un número directamente falta: cuando lo comprobé no existía ninguna medición independiente de velocidad de la versión 0731, así que trata cualquier cifra de tokens por segundo que circule como perteneciente a una versión anterior [16].
¿Qué compran 0,28 dólares por millón de tokens en la práctica?
El precio de lista es solo el principio del modelo de costes. La entrada cacheada cuesta 0,0028 dólares por millón de tokens, una cincuentava parte de la tarifa sin caché [3], y los flujos de agentes reenvían en cada turno un contexto casi idéntico, así que la tarifa de caché domina la factura real. En sentido contrario, la política de horas punta anunciada duplicará los precios durante el horario laboral de Pekín cuando se active [3]. Los revendedores complican más el cuadro: en el lanzamiento, OpenRouter listaba V4 Flash con un 38 por ciento de descuento, unos 0,09 dólares de entrada y 0,17 de salida [17]. Si has visto 0,17 o 0,18 dólares citados como el precio de salida del modelo, eso es la promoción del revendedor, no la lista de DeepSeek.
Una advertencia afecta a todos los precios por token entre proveedores de este artículo. La documentación de precios de Anthropic indica que los modelos Claude desde 4.7 usan un tokenizador que produce aproximadamente un 30 por ciento más de tokens para el mismo texto [4], así que las proporciones por token entre proveedores son aproximaciones. Un factor de 89 en la salida sobrevive de sobra a una corrección del 30 por ciento.
Los primeros informes reales encajan con las cuentas. En Hacker News, un ingeniero publicó su panel de 30 días: 4,55 dólares por 3.467 peticiones a la API con 323 millones de tokens, con el veredicto de que el modelo “no ha decepcionado en absoluto en tareas de programación o de revisión. Para todo lo demás, usa otro modelo” [18]. Eso sale a unos 0,014 dólares por millón de tokens, por debajo de todas las tarifas de la lista salvo la de caché, así que la mayor parte de ese tráfico tuvo que ser entrada cacheada. El mismo usuario describe el método de trabajo que lo hace sostenible: el modelo es flojo en prosa, mejora de forma notable con instrucciones precisas y herramientas de autorrevisión, y “aun así tienes que revisar el 100 % del código como si intentara venderte un seguro” [19].
Los informes de fricción también coinciden. Otro comentarista se topó con un límite estrecho de tokens de salida a través de OpenRouter, donde un modelo que se enreda en un desvío largo de razonamiento se queda sin espacio antes de terminar, y aun así concluyó que “ha sustituido a los modelos Kimi para mí” [20]. La prueba del mismo día de Simon Willison apunta al ajuste que hay detrás de ese comportamiento: con el esfuerzo de razonamiento por defecto su resultado fue claramente peor que con high [21]. La configuración práctica que emerge de tres días de informes: ejecútalo con esfuerzo high, mantén las tareas bien acotadas y deja un modelo más fuerte o a un humano en el asiento de revisión.
La letra pequeña del descuento
La advertencia sobre benchmarks atraviesa todo lo anterior: las nueve filas de la tabla de lanzamiento las midió el propio proveedor en un harness sin publicar, y dos de los nueve benchmarks son conjuntos internos de DeepSeek. Eso es motivo para esperar evaluaciones de agentes independientes, no para descartar el modelo.
Hay otra advertencia que está medida, no sospechada. CTGT, una firma de investigación que analiza el comportamiento de modelos, halló que V4 Flash puntúa 45,45 puntos más censurado en preguntas sensibles sobre China que en preguntas de control estructuralmente idénticas, probando pesos autoalojados para descartar filtros del proveedor de la API [22]. El mismo estudio encontró que un modelo destilado a partir de salidas de V4 Flash no mostraba rastros significativos de ese comportamiento [22]. Si tu producto responde preguntas cerca de territorio políticamente sensible, esa medición pertenece a tu evaluación, y es una propiedad de los pesos, no del alojamiento de DeepSeek.
Dos límites prácticos cierran la lista. El modelo recibe texto y produce texto, sin entrada de imágenes [11], lo que excluye los bucles de frontend guiados por capturas de pantalla en los que se apoyan los montajes de agentes multimodales. Y la API oficial es solo una de las formas de ejecutarlo: gracias a los pesos MIT [2], OpenRouter y otros proveedores occidentales ya sirven el modelo [17], así que el endpoint de DeepSeek, su jurisdicción de datos y sus futuras tarifas de hora punta son opcionales y no parte del trato.
La información realmente nueva del 31 de julio no es que V4 Flash gane a Claude; la propia tabla de DeepSeek dice que no. Es el precio al que pierde. Pagar alrededor del uno por ciento de las tarifas de Opus por un modelo de esta clase cambia qué tareas merecen automatizarse, incluso antes de que se resuelvan las disputas sobre benchmarks. Mi siguiente paso es apuntarlo a mi repositorio de pruebas habitual con el esfuerzo de razonamiento en high y un modelo más fuerte en el asiento de revisión, y volver al gráfico del proveedor si algún día un harness independiente ejecuta todos estos modelos en las mismas condiciones.
Fuentes
- Change log
- DeepSeek-V4-Flash-0731 model card
- Models & Pricing
- Pricing
- DeepSeek-V4 model card
- DeepSeek releases beta version of V4 models as AI price war heats up
- System Card: Claude Opus 4.8
- Models overview
- Introducing Claude Opus 5
- Terminal-Bench 2.1 leaderboard
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index
- Models leaderboard
- DeepSeek V4 Flash 0731: intelligence, performance and price
- DeepSeek V4 Pro: intelligence, performance and price
- Arena leaderboard
- DeepSeek V4 Flash providers
- DeepSeek V4 Flash
- Comment with 30-day usage figures on the V4 Flash release thread
- Comment on working practices with V4 Flash
- Comment on output limits
- deepseek-ai/DeepSeek-V4-Flash-0731
- Distillation censorship transfer