DeepSeek V4 Flash perdió los 9 benchmarks frente a Opus 4.8
V4 Flash cuesta 0,14 dólares de entrada y 0,28 de salida por millón de tokens. Analizo si el descuento del 97 al 99 % compensa sus nueve derrotas.
En esta página
- ¿Hasta qué punto se acerca DeepSeek V4 Flash a Opus 4.8?
- ¿Qué es DeepSeek V4 Flash 0731?
- ¿Qué puntuación de Opus 4.8 hay que creer?
- ¿Qué muestran los primeros resultados independientes?
- ¿Qué compras en la práctica por 0,28 dólares por millón de tokens?
- ¿A qué renuncias a cambio del descuento?
- Mi veredicto: prueba V4 Flash como ejecutor, no como revisor
DeepSeek V4 Flash no sustituye a Opus 4.8. La propia tabla de DeepSeek pone a Opus por delante en los nueve benchmarks, aunque dos diferencias son pequeñas [2]. Su ventaja es el precio: V4 Flash cuesta 0,14 dólares por millón de tokens de entrada y 0,28 de salida [3], frente a los 5 y 25 dólares de Opus 4.8 [4].
¿Hasta qué punto se acerca DeepSeek V4 Flash a Opus 4.8?
DeepSeek V4 Flash se acerca a Opus 4.8 en dos de las nueve pruebas de DeepSeek, pero queda bastante por detrás en los benchmarks que exigen trabajar con repositorios. Opus gana por 0,5 puntos en Agents’ Last Exam y 2,3 en Terminal-Bench 2.1, mientras que la diferencia llega a 15,5 puntos en NL2Repo y a 12,1 en DSBench-Hard [2].
| Benchmark | V4 Flash 0731 | Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 (El mejor valor de la fila) | 81,0 |
| NL2Repo | 54,2 | 69,7 (El mejor valor de la fila) | 48,9 |
| Cybergym | 76,7 | 83,1 (El mejor valor de la fila) | - |
| DeepSWE | 54,4 | 58,0 (El mejor valor de la fila) | 46,2 |
| Toolathlon Verified | 70,3 | 76,2 (El mejor valor de la fila) | 59,9 |
| Agents' Last Exam | 25,2 | 25,7 (El mejor valor de la fila) | 23,8 |
| AutomationBench Public | 25,1 | 27,2 (El mejor valor de la fila) | 12,9 |
| DSBench FullStack | 68,7 | 71,6 (El mejor valor de la fila) | 61,8 |
| DSBench Hard | 59,6 | 71,7 (El mejor valor de la fila) | 54,5 |
El patrón importa más que una fila concreta. V4 Flash se mantiene cerca de Opus en las tareas de terminal, pero pierde más terreno cuando el trabajo exige comprender o construir un repositorio. Aun así, supera a GLM-5.2 en las ocho filas que comparten ambos modelos.
DeepSeek hace una afirmación más limitada que buena parte de la cobertura. La ficha del modelo dice que la nueva versión supera a la versión preliminar de V4 Pro, que es más grande, aunque activa muchos menos parámetros [2]. Publicar una tabla que muestra todas las derrotas frente a Opus también resulta más útil que enseñar solo las filas que gana un modelo nuevo.
Sin embargo, la comparación ya ha quedado desactualizada. Opus 4.8 era el modelo más potente de Anthropic cuando salió el 28 de mayo de 2026 [7], pero diez semanas después aparece en la sección de modelos antiguos de su catálogo [8]. Opus 5 llegó el 24 de julio con las mismas tarifas de 5 dólares de entrada y 25 de salida, y Anthropic recomienda usarlo para el trabajo nuevo, con Fable 5 por encima de ambos [9]. V4 Flash compite con el modelo más avanzado de Anthropic en mayo, no con el de agosto.
¿Qué es DeepSeek V4 Flash 0731?
DeepSeek-V4-Flash-0731 se lanzó el 31 de julio de 2026 como la versión oficial de V4 Flash tras un nuevo postentrenamiento [1]. La versión preliminar llevaba disponible desde el 24 de abril. DeepSeek mantuvo la arquitectura y el tamaño, y repitió solo las fases finales del entrenamiento. El resultado es un modelo de mezcla de expertos con 284.000 millones de parámetros totales, 13.000 millones activos por token y una ventana de contexto de un millón de tokens [5].
Los pesos están disponibles en Hugging Face con licencia MIT, que permite el uso comercial y el autoalojamiento sin restricciones [2].
En la API, DeepSeek sustituyó la versión sin cambiar el nombre: el identificador sigue siendo deepseek-v4-flash, y las integraciones existentes pasaron a la nueva versión sin modificar su configuración [1]. Esto resulta cómodo para los usuarios, pero complica la cita de resultados, porque “V4 Flash” ahora identifica dos versiones distintas según la fecha de la medición. El modelo ofrece un parámetro de esfuerzo de razonamiento con tres niveles, low, high y max, en lugar de una variante de razonamiento separada [2].
El lanzamiento llamó la atención por el precio. Nikkei Asia lo describió como parte de una guerra de precios cada vez más intensa entre modelos de IA e informó de que DeepSeek planea añadir más adelante tarifas para las horas punta [6]. La página de precios de DeepSeek confirma que las tarifas se duplicarán durante esas horas cuando la política entre en vigor, algo que aún no había ocurrido el 3 de agosto de 2026 [3]. V4 Pro, el modelo más grande, sigue en versión preliminar a 0,435 dólares de entrada y 0,87 de salida, y DeepSeek anuncia que su versión oficial llegará pronto [1] [3].
- precio de entrada, sin caché
- 0,14 $/MTok
- Opus 4.8: 5 $
- precio de salida
- 0,28 $/MTok
- Opus 4.8: 25 $
- ventana de contexto
- 1M
- salida máxima de 384K tokens
- parámetros activos
- 13B
- de 284B totales, licencia MIT
Por cada millón de tokens de salida, Opus 4.8 cuesta unas 89 veces lo que cuesta V4 Flash. La diferencia es lo bastante grande como para importar, pero la comparación de precios necesita una referencia fiable de capacidad. Ahí es donde las puntuaciones de Opus complican el análisis.
¿Qué puntuación de Opus 4.8 hay que creer?
Ninguna puntuación de Opus 4.8 es lo bastante estable como para sostener por sí sola esta comparación. El harness de DeepSeek registra 85,0 en Terminal-Bench 2.1 [2], la clasificación pública de Terminal-Bench muestra un 78,9 % con Claude Code [10], y la ficha de sistema de Anthropic da un 74,6 % con esfuerzo high en el harness Terminus-2 [7].
Ver los datos en una tabla
| Fuente | Valor |
|---|---|
| DeepSeek Harness, esfuerzo max | 85,0 % |
| Clasificación de Terminal-Bench, Claude Code | 78,9 % |
| Ficha de sistema de Anthropic, Terminus-2, esfuerzo high | 74,6 % |
El 82,7 de V4 Flash cae dentro de esa diferencia de 10,4 puntos. Según qué resultado de Opus uses, el modelo de DeepSeek queda 2,3 puntos por detrás, 3,8 por delante u 8,1 por delante. Las puntuaciones por sí solas no permiten saber cuál de los dos modelos funciona mejor en tareas de terminal.
DeepSeek publicó la mayor puntuación de Opus de las tres, así que su resultado no rebaja al competidor. La diferencia de 10,4 puntos se debe a distintos harnesses de agentes, niveles de esfuerzo y límites de tiempo. La ficha de sistema de Anthropic también señala que Terminal-Bench penaliza los endpoints lentos, porque las tareas tienen límites fijos de tiempo real [7]. Estas configuraciones no se pueden comparar directamente.
Un tercero podría resolver la comparación si ejecutara ambos modelos con el mismo harness. A 3 de agosto de 2026, no encontré una versión pública del DeepSeek Harness ni una reproducción independiente de ninguna de las nueve filas. Hasta que exista, estamos ante un resultado del proveedor, no una comparación reproducida de forma independiente.
¿Qué muestran los primeros resultados independientes?
Artificial Analysis sitúa V4 Flash en la parte alta de los modelos económicos, no entre los más avanzados. Su puntuación de 50 en el Intelligence Index supera por diez puntos a la versión preliminar de abril y queda un punto por detrás de GPT-5.6 Luna con esfuerzo max [11]. Opus 4.8 no aparece en ese índice, por lo que esta prueba no reproduce la comparación de DeepSeek.
En la misma clasificación del 3 de agosto de 2026, Gemini 3.6 Flash también obtuvo 50, GLM-5.2 llegó a 51, GPT-5.6 Terra a 55 y Kimi K3 a 57 [12]. Es la única referencia independiente y estandarizada que encontré para la versión 0731.
Artificial Analysis también confirmó la afirmación principal de DeepSeek: V4 Flash supera al V4 Pro más grande y cuesta menos. Ejecutar el índice completo costó 72,02 dólares con V4 Flash [13], frente a 176,34 dólares con V4 Pro, que obtuvo seis puntos menos, con 44 [14]. Es un resultado mejor por aproximadamente el 40 % del coste.
El consumo de tokens sigue influyendo en la factura total. V4 Flash necesitó unos 206 millones de tokens de salida para completar el índice, un 12 % menos que la versión de abril [11], pero más que los 180 millones que usó V4 Pro [14]. El modelo cuesta poco por token, pero usa muchos, así que una estimación basada en el consumo de otro modelo se quedará corta.
Otras dos pruebas de Artificial Analysis muestran una mejora considerable frente a la versión preliminar de abril. En GDPval-AA v2, una comparación de tareas laborales evaluada mediante votos de preferencia, la nueva versión alcanzó un Elo de 1559, frente a los 1189 anteriores [11]. Su tasa de alucinación en AA-Omniscience mejoró 12 puntos hasta el 84 %, lo que supone avanzar desde un resultado malo, no alcanzar uno bueno [11].
La clasificación WebDev también sitúa V4 Flash por debajo de los modelos más avanzados. En Arena, donde las personas votan por las aplicaciones web generadas, V4 Flash con esfuerzo high ocupaba el séptimo puesto con un Elo de 1577 el 3 de agosto de 2026, frente a los 1705 de Opus 5 Max en primera posición [15].
La velocidad de esta versión sigue siendo una incógnita. No encontré ninguna medición independiente de tokens por segundo para 0731, así que cualquier cifra de velocidad que circulara el 3 de agosto de 2026 correspondía a una versión anterior de V4 Flash [16].
¿Qué compras en la práctica por 0,28 dólares por millón de tokens?
Los primeros informes describen un agente de programación barato que rinde mejor con supervisión cercana, no un sustituto general de un modelo más potente. La factura real puede quedar por debajo del precio anunciado cuando los flujos de agentes reutilizan el contexto en caché, mientras que las futuras tarifas de hora punta y los descuentos de los revendedores hacen que los 0,28 dólares sean solo el punto de partida.
La entrada en caché cuesta 0,0028 dólares por millón de tokens, una cincuentava parte de la tarifa sin caché [3], y los flujos de agentes vuelven a enviar un contexto casi idéntico en cada turno. En sentido contrario, DeepSeek afirma que los precios se duplicarán durante las horas punta de Pekín cuando se active esa política [3]. En el lanzamiento, OpenRouter aplicó un descuento del 38 %, que dejaba el precio en unos 0,09 dólares de entrada y 0,17 de salida [17]. Por tanto, los precios de salida de 0,17 o 0,18 dólares citados en otros lugares corresponden a la promoción del revendedor, no a la tarifa de DeepSeek.
Hay una salvedad para todas las comparaciones de precios por token entre proveedores de este artículo. La documentación de precios de Anthropic indica que los modelos Claude a partir de la versión 4.7 usan un tokenizador que genera aproximadamente un 30 % más de tokens para el mismo texto [4], por lo que las proporciones por token entre proveedores son aproximadas. Incluso con una corrección del 30 %, Opus sigue costando alrededor de 89 veces lo que cuesta V4 Flash en la salida.
Un ingeniero de Hacker News publicó un panel de 30 días con un coste de 4,55 dólares por 3.467 solicitudes a la API y 323 millones de tokens. Su veredicto fue que el modelo “no ha decepcionado en absoluto en tareas de programación o revisión. Para todo lo demás, usa otro modelo” [18]. La media es de unos 0,014 dólares por millón de tokens, menos que cualquier tarifa publicada salvo la de caché, así que la mayor parte del tráfico debió de ser entrada en caché. El mismo usuario afirma que el modelo escribe una prosa floja, mejora con instrucciones precisas y herramientas de autorrevisión, y que “aun así tienes que revisar el 100 % del código como si intentara venderte un seguro” [19].
Otro comentarista alcanzó un límite bajo de tokens de salida a través de OpenRouter después de que el modelo dedicara demasiado tiempo a razonar, pero aun así concluyó que “ha sustituido a los modelos Kimi para mí” [20]. La prueba que Simon Willison hizo ese mismo día señala una configuración útil: el resultado con el esfuerzo predeterminado fue claramente peor que con high [21]. En conjunto, los informes respaldan el uso de esfuerzo high, tareas bien acotadas y un modelo más potente o una persona encargada de la revisión.
¿A qué renuncias a cambio del descuento?
V4 Flash no admite imágenes, y un estudio controlado detectó una censura mucho mayor en preguntas sensibles sobre China que en preguntas de control equivalentes [11] [22]. Estas limitaciones afectan a los flujos de programación multimodales y a cualquier producto que responda preguntas sobre asuntos políticamente sensibles.
CTGT, una firma de investigación que estudia el comportamiento de los modelos, midió una diferencia de censura de 45,45 puntos entre preguntas sensibles sobre China y preguntas de control con la misma estructura. Los investigadores probaron los pesos autoalojados para descartar el filtrado del proveedor de la API, mientras que un modelo destilado a partir de las respuestas de V4 Flash no mostró rastros significativos del mismo comportamiento [22]. Por tanto, el resultado se aplica a los pesos, no solo al endpoint alojado por DeepSeek.
Sin entrada de imágenes, el modelo no puede ejecutar los ciclos de frontend guiados por capturas de pantalla que usan los agentes multimodales [11]. La API oficial es opcional, porque los pesos con licencia MIT [2] ya están disponibles mediante OpenRouter y otros proveedores occidentales [17]. Elegir otro proveedor puede cambiar el endpoint, la jurisdicción de los datos y el precio, pero no elimina un comportamiento presente en los pesos.
Mi veredicto: prueba V4 Flash como ejecutor, no como revisor
Merece la pena probar V4 Flash porque ofrece un modelo de esta clase por entre el 1 y el 3 % de las tarifas de Opus, no porque supere a Claude. La propia tabla de DeepSeek muestra que pierde, y los datos independientes lo sitúan entre los modelos económicos potentes, no entre los más avanzados.
Mi siguiente paso es usar V4 Flash con mi repositorio de pruebas habitual, el esfuerzo de razonamiento en high y un modelo más potente como revisor. Si algún harness independiente acaba ejecutándolo junto a Opus en las mismas condiciones, revisaré la comparación. Hasta entonces, el descuento aumenta el número de tareas que puedo permitirme automatizar, pero no elimina la necesidad de revisión.
Fuentes
- Change log
- DeepSeek-V4-Flash-0731 model card
- Models & Pricing
- Pricing
- DeepSeek-V4 model card
- DeepSeek releases beta version of V4 models as AI price war heats up
- System Card: Claude Opus 4.8
- Models overview
- Introducing Claude Opus 5
- Terminal-Bench 2.1 leaderboard
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index
- Models leaderboard
- DeepSeek V4 Flash 0731: intelligence, performance and price
- DeepSeek V4 Pro: intelligence, performance and price
- Arena leaderboard
- DeepSeek V4 Flash providers
- DeepSeek V4 Flash
- Comment with 30-day usage figures on the V4 Flash release thread
- Comment on working practices with V4 Flash
- Comment on output limits
- deepseek-ai/DeepSeek-V4-Flash-0731
- Distillation censorship transfer