Sorties

DeepSeek V4 Flash perd les 9 benchmarks face à Opus 4.8

V4 Flash coûte 0,14 $ en entrée et 0,28 $ en sortie par million de tokens. J'ai vérifié si cette remise de 97 à 99 % rend ses neuf défaites acceptables.

Sur cette page
  1. DeepSeek V4 Flash est-il vraiment proche d’Opus 4.8 ?
  2. Qu’est-ce que DeepSeek V4 Flash 0731 ?
  3. Quel score d’Opus 4.8 faut-il croire ?
  4. Que montrent les premiers résultats indépendants ?
  5. Que permettent 0,28 $ par million de tokens en pratique ?
  6. Que sacrifiez-vous pour cette remise ?
  7. Mon verdict : testez V4 Flash comme exécutant, pas comme relecteur

DeepSeek V4 Flash ne remplace pas Opus 4.8. Dans son propre tableau de lancement, DeepSeek place Opus en tête des neuf benchmarks, même si deux écarts sont faibles [2]. L’intérêt vient du prix : V4 Flash coûte 0,14 $ par million de tokens en entrée et 0,28 $ en sortie [3], contre 5 $ et 25 $ pour Opus 4.8 [4].

DeepSeek V4 Flash est-il vraiment proche d’Opus 4.8 ?

DeepSeek V4 Flash se rapproche d’Opus 4.8 dans deux des neuf tests de DeepSeek, mais reste nettement derrière sur les benchmarks centrés sur les dépôts de code. Opus mène de 0,5 point sur Agents’ Last Exam et de 2,3 sur Terminal-Bench 2.1, puis creuse l’écart à 15,5 points sur NL2Repo et 12,1 sur DSBench-Hard [2].

Benchmark V4 Flash 0731Opus 4.8GLM-5.2
Terminal-Bench 2.1 82,7 85,0 (Meilleure valeur de la ligne) 81,0
NL2Repo 54,2 69,7 (Meilleure valeur de la ligne) 48,9
Cybergym 76,7 83,1 (Meilleure valeur de la ligne) -
DeepSWE 54,4 58,0 (Meilleure valeur de la ligne) 46,2
Toolathlon Verified 70,3 76,2 (Meilleure valeur de la ligne) 59,9
Agents' Last Exam 25,2 25,7 (Meilleure valeur de la ligne) 23,8
AutomationBench Public 25,1 27,2 (Meilleure valeur de la ligne) 12,9
DSBench FullStack 68,7 71,6 (Meilleure valeur de la ligne) 61,8
DSBench Hard 59,6 71,7 (Meilleure valeur de la ligne) 54,5
Figure 1. La comparaison publiée par DeepSeek au lancement de V4-Flash-0731. Tous les chiffres ont été mesurés par DeepSeek sur son propre harness, avec l'effort de raisonnement max.

La répartition des écarts compte davantage qu’une ligne isolée. V4 Flash reste proche d’Opus sur les tâches qui s’exécutent dans un terminal, mais décroche lorsqu’il faut comprendre ou faire évoluer un dépôt de code. Il devance tout de même GLM-5.2 sur les huit lignes que les deux modèles ont en commun.

DeepSeek formule une affirmation plus étroite qu’une grande partie de la couverture médiatique. Selon la fiche du modèle, cette version dépasse la préversion du V4 Pro, pourtant plus grand, tout en activant beaucoup moins de paramètres [2]. Publier un graphique où le nouveau modèle perd chaque comparaison avec Opus reste aussi plus utile que de ne montrer que ses victoires.

La comparaison a toutefois déjà vieilli. Opus 4.8 était le modèle le plus puissant d’Anthropic lors de sa sortie le 28 mai 2026 [7], mais dix semaines plus tard, il figure dans la section legacy de la liste des modèles d’Anthropic [8]. Opus 5 est arrivé le 24 juillet aux mêmes tarifs de 5 $ en entrée et 25 $ en sortie. Anthropic le recommande désormais pour les nouveaux projets, tandis que Fable 5 se place au-dessus des deux [9]. V4 Flash affronte donc la meilleure offre d’Anthropic de mai, pas celle d’août.

Qu’est-ce que DeepSeek V4 Flash 0731 ?

DeepSeek-V4-Flash-0731 est sorti le 31 juillet 2026 comme version officielle de la préversion V4 Flash, après une nouvelle phase de post-entraînement [1]. Cette préversion était publique depuis le 24 avril.

DeepSeek a conservé l’architecture et la taille, puis n’a refait que les dernières étapes d’entraînement. Le résultat est un modèle à mélange d’experts de 284 milliards de paramètres au total, dont 13 milliards actifs par token, avec une fenêtre de contexte d’un million de tokens [5].

Les poids sont disponibles sur Hugging Face sous licence MIT, ce qui permet l’usage commercial et l’auto-hébergement sans restriction [2].

Côté API, DeepSeek a remplacé la version existante sans changer son identifiant : il reste deepseek-v4-flash, et les intégrations ont basculé vers la nouvelle version sans modification de configuration [1]. C’est pratique pour les utilisateurs, mais gênant pour citer des résultats, car « V4 Flash » désigne maintenant deux versions selon la date de la mesure. Le modèle propose un réglage de l’effort de raisonnement sur trois niveaux, low, high et max, au lieu d’une variante de raisonnement séparée [2].

Le prix a attiré l’attention sur cette sortie. Nikkei Asia la présente comme un nouvel épisode d’une guerre des prix qui s’intensifie entre les modèles d’IA et rapporte que DeepSeek prévoit d’ajouter plus tard un tarif aux heures de pointe [6]. La page tarifaire de DeepSeek confirme que les prix doubleront pendant ces périodes quand la mesure entrera en vigueur, ce qui n’était pas encore le cas au 3 août 2026 [3]. Le plus grand V4 Pro reste en préversion à 0,435 $ en entrée et 0,87 $ en sortie, avec une version officielle annoncée pour bientôt [1] [3].

prix d'entrée, hors cache
0,14 $/MTok
Opus 4.8 : 5 $
prix de sortie
0,28 $/MTok
Opus 4.8 : 25 $
fenêtre de contexte
1M
sortie maximale de 384K tokens
paramètres actifs
13B
sur 284B au total, licence MIT

Pour un million de tokens en sortie, Opus 4.8 coûte environ 89 fois plus cher que V4 Flash. L’écart est assez grand pour compter, mais le prix n’a de sens qu’avec une référence fiable sur les capacités. C’est là que les scores d’Opus compliquent la comparaison.

Quel score d’Opus 4.8 faut-il croire ?

Aucun score d’Opus 4.8 n’est assez stable pour servir seul de référence. Le harness de DeepSeek affiche 85,0 sur Terminal-Bench 2.1 [2], le classement public de Terminal-Bench indique 78,9 % avec Claude Code [10], et la system card d’Anthropic donne 74,6 % avec l’effort high sur le harness Terminus-2 [7].

Claude Opus 4.8 sur Terminal-Bench 2.1, trois mesures Le harness de DeepSeek affiche 85,0, le classement public 78,9 et la system card d'Anthropic 74,6 pour le même modèle sur le même benchmark. DeepSeek Harness, effort max 85,0 % Classement Terminal-Bench, Claude Code 78,9 % System card d'Anthropic, Terminus-2, effort high 74,6 %
Afficher les données en tableau
Source Valeur
DeepSeek Harness, effort max 85,0 %
Classement Terminal-Bench, Claude Code 78,9 %
System card d'Anthropic, Terminus-2, effort high 74,6 %
Figure 2. Un modèle, un benchmark, trois mesures. Les scores de Claude Opus 4.8 sur Terminal-Bench 2.1 publiés par trois sources différentes.

Le score de 82,7 de V4 Flash tombe dans cette dispersion de 10,4 points. Selon le résultat d’Opus retenu, le modèle de DeepSeek accuse 2,3 points de retard, ou prend 3,8 voire 8,1 points d’avance. Ces scores ne suffisent donc pas à départager les modèles sur les tâches en terminal.

Comme DeepSeek publie le meilleur score d’Opus parmi les trois, il ne sous-évalue pas son concurrent. L’écart de 10,4 points vient de harness d’agents, de niveaux d’effort et de délais différents. La system card d’Anthropic précise aussi que Terminal-Bench pénalise les endpoints lents, car les tâches doivent respecter des limites fixes de temps écoulé [7]. Ces configurations ne sont pas directement comparables.

Un tiers pourrait régler la question en faisant passer les deux modèles dans le même harness. Je n’ai trouvé ni version publique du DeepSeek Harness ni reproduction indépendante de l’une des neuf lignes au 3 août 2026. En attendant, il s’agit d’un résultat fourni par le vendeur, pas d’une comparaison reproduite indépendamment.

Que montrent les premiers résultats indépendants ?

Artificial Analysis place V4 Flash en tête des modèles économiques, pas parmi les modèles les plus puissants. Son Intelligence Index de 50 dépasse de dix points la preview d’avril et reste un point derrière GPT-5.6 Luna à l’effort max [11]. Opus 4.8 n’apparaît pas dans cet index, ce résultat ne reproduit donc pas la comparaison de DeepSeek.

Sur le même classement au 3 août 2026, Gemini 3.6 Flash obtient aussi 50, GLM-5.2 atteint 51, GPT-5.6 Terra 55 et Kimi K3 57 [12]. C’est le seul positionnement indépendant et standardisé que j’ai trouvé pour la version 0731.

Artificial Analysis confirme aussi l’affirmation centrale de DeepSeek : V4 Flash dépasse le plus grand V4 Pro à moindre coût. L’exécution de l’index complet a coûté 72,02 $ avec V4 Flash [13], contre 176,34 $ avec V4 Pro, qui a obtenu six points de moins avec un score de 44 [14]. Le résultat est meilleur pour environ 40 % du coût.

La consommation de tokens continue de peser sur la facture totale. V4 Flash a utilisé environ 206 millions de tokens en sortie pour terminer l’index, soit 12 % de moins que la version d’avril [11], mais davantage que les 180 millions de V4 Pro [14]. Chaque token coûte peu, mais le modèle en consomme beaucoup. Une estimation fondée sur la consommation d’un autre modèle risque donc d’être trop basse.

Deux autres tests d’Artificial Analysis montrent un net progrès par rapport à la preview d’avril. Sur GDPval-AA v2, une comparaison de tâches professionnelles évaluée par des votes de préférence, la nouvelle version atteint un Elo de 1559, contre 1189 auparavant [11]. Son taux d’hallucination sur AA-Omniscience s’améliore de 12 points pour atteindre 84 %, ce qui reste un mauvais résultat malgré le progrès [11].

Le classement WebDev place lui aussi V4 Flash derrière les meilleurs modèles. Sur Arena, où des personnes votent entre des applications web générées, V4 Flash à l’effort high occupait la septième place avec un Elo de 1577 le 3 août 2026, contre 1705 pour Opus 5 Max en tête [15].

La vitesse de cette version reste inconnue. Je n’ai trouvé aucune mesure indépendante de tokens par seconde pour la version 0731. Les chiffres de vitesse qui circulaient le 3 août 2026 concernaient donc une version antérieure de V4 Flash [16].

Que permettent 0,28 $ par million de tokens en pratique ?

Les premiers retours décrivent un agent de code peu coûteux qui donne ses meilleurs résultats sous étroite supervision, pas un remplaçant général d’un modèle plus puissant.

La facture réelle peut être inférieure au prix affiché quand les workflows d’agents réutilisent le contexte en cache, tandis que la future tarification aux heures de pointe et les remises des revendeurs font de 0,28 $ un simple point de départ.

L’entrée en cache coûte 0,0028 $ par million de tokens, soit un cinquantième du tarif hors cache [3], et les workflows d’agents renvoient un contexte presque identique à chaque tour. À l’inverse, DeepSeek annonce que les prix doubleront pendant les heures de pointe à Pékin dès l’activation de cette politique [3]. Au lancement, OpenRouter proposait une remise de 38 %, soit environ 0,09 $ en entrée et 0,17 $ en sortie [17]. Les tarifs de 0,17 $ ou 0,18 $ cités ailleurs correspondent donc à la promotion du revendeur, pas au prix catalogue de DeepSeek.

Une réserve s’applique à tous les prix par token comparés entre fournisseurs dans cet article. La documentation tarifaire d’Anthropic indique que les modèles Claude à partir de la version 4.7 utilisent un tokenizer qui produit environ 30 % de tokens supplémentaires pour un même texte [4]. Les rapports de prix par token restent donc approximatifs, mais un facteur 89 sur la sortie reste considérable après une correction de 30 %.

Un ingénieur sur Hacker News a publié un tableau de bord sur 30 jours : 4,55 $ pour 3 467 requêtes API et 323 millions de tokens. Selon lui, le modèle « ne l’a pas déçu du tout pour les tâches de code ou de revue, mais il vaut mieux en utiliser un autre pour le reste » [18]. Cela représente en moyenne environ 0,014 $ par million de tokens, sous tous les tarifs affichés sauf celui d’une entrée en cache. La majeure partie du trafic devait donc provenir de contexte mis en cache. Le même utilisateur juge le modèle faible en prose, mais meilleur avec des instructions précises et des outils d’auto-revue. Il conseille tout de même de « relire 100 % du code comme s’il essayait de vous vendre une assurance » [19].

Un autre commentateur a rencontré une limite stricte de tokens en sortie sur OpenRouter après que le modèle a raisonné trop longtemps, mais il conclut tout de même qu’il « a remplacé les modèles Kimi » dans son usage [20]. Le test publié le même jour par Simon Willison donne un réglage utile : son résultat avec l’effort par défaut était nettement moins bon qu’à high [21]. Ensemble, ces retours plaident pour l’effort high, des tâches bien délimitées et un modèle plus puissant ou une personne chargée de la revue.

Que sacrifiez-vous pour cette remise ?

V4 Flash n’accepte pas d’images, et une étude contrôlée a relevé une censure beaucoup plus forte sur les questions sensibles liées à la Chine que sur des questions de contrôle comparables [11] [22]. Ces limites comptent pour les workflows de code multimodaux et pour tout produit amené à traiter des sujets politiquement sensibles.

CTGT, une société de recherche qui étudie le comportement des modèles, a mesuré un écart de censure de 45,45 points entre des questions sensibles sur la Chine et des questions de contrôle structurellement identiques. Les chercheurs ont testé les poids auto-hébergés afin d’écarter un filtrage par le fournisseur de l’API. Un modèle distillé à partir des sorties de V4 Flash ne présentait aucune trace significative du même comportement [22]. Le résultat concerne donc les poids, pas seulement l’endpoint hébergé par DeepSeek.

Sans entrée d’images, le modèle ne peut pas exécuter les boucles frontend guidées par des captures d’écran qu’utilisent les agents multimodaux [11]. L’API officielle reste facultative, car les poids sous licence MIT [2] sont déjà proposés par OpenRouter et d’autres fournisseurs occidentaux [17]. Changer de fournisseur peut modifier l’endpoint, la juridiction des données et le prix, mais pas un comportement inscrit dans les poids.

Mon verdict : testez V4 Flash comme exécutant, pas comme relecteur

V4 Flash mérite un test parce qu’il fournit un modèle de cette catégorie pour 1 à 3 % des tarifs d’Opus, pas parce qu’il bat Claude. Le propre tableau de DeepSeek le donne perdant, et les données indépendantes le placent parmi les bons modèles économiques plutôt qu’au niveau des plus puissants.

Je vais maintenant lancer V4 Flash sur mon dépôt de test habituel avec l’effort de raisonnement réglé sur high et un modèle plus puissant chargé de la revue. Si un harness indépendant finit par le comparer à Opus dans les mêmes conditions, je reviendrai sur cette analyse. D’ici là, la remise élargit le nombre de tâches que je peux automatiser, mais elle ne supprime pas le besoin de relire le résultat.

Sources

  1. Change logDeepSeek API Docs · 2026-07-31
  2. DeepSeek-V4-Flash-0731 model cardDeepSeek on Hugging Face · 2026-07-31
  3. Models & PricingDeepSeek API Docs
  4. PricingClaude Platform Docs
  5. DeepSeek-V4 model cardDeepSeek on Hugging Face
  6. DeepSeek releases beta version of V4 models as AI price war heats upNikkei Asia · 2026-07-31
  7. System Card: Claude Opus 4.8Anthropic · 2026-05-28
  8. Models overviewClaude Platform Docs
  9. Introducing Claude Opus 5Anthropic · 2026-07-24
  10. Terminal-Bench 2.1 leaderboardTerminal-Bench
  11. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence IndexArtificial Analysis · 2026-07-31
  12. Models leaderboardArtificial Analysis
  13. DeepSeek V4 Flash 0731: intelligence, performance and priceArtificial Analysis
  14. DeepSeek V4 Pro: intelligence, performance and priceArtificial Analysis
  15. Arena leaderboardArena
  16. DeepSeek V4 Flash providersArtificial Analysis
  17. DeepSeek V4 FlashOpenRouter
  18. Comment with 30-day usage figures on the V4 Flash release threadHacker News · 2026-07-31
  19. Comment on working practices with V4 FlashHacker News · 2026-07-31
  20. Comment on output limitsHacker News · 2026-07-31
  21. deepseek-ai/DeepSeek-V4-Flash-0731Simon Willison · 2026-07-31
  22. Distillation censorship transferCTGT · 2026-07-29