Sorties

DeepSeek compare V4 Flash à Opus 4.8 et perd les neuf lignes

Le tableau de lancement de V4 Flash met Claude Opus 4.8 en tête des neuf benchmarks. Je vérifie ce qu'achètent 0,14 et 0,28 dollar par million de tokens.

Sur cette page
  1. Qu’est-ce qui est sorti exactement le 31 juillet ?
  2. À quel point est-il proche d’Opus 4.8 ?
  3. Quel score d’Opus 4.8 faut-il croire ?
  4. Que montrent les premiers chiffres indépendants ?
  5. Qu’achètent 0,28 dollar par million de tokens en pratique ?
  6. Les petites lignes de la remise

DeepSeek a publié la version officielle de V4 Flash le 31 juillet 2026 [1], et son graphique de lancement fait quelque chose d’inhabituel : il compare le modèle à Claude Opus 4.8 sur neuf benchmarks et perd toutes les lignes [2]. L’enthousiasme vient malgré tout, et il vient du prix : 0,14 dollar par million de tokens en entrée et 0,28 dollar par million en sortie [3], contre 5 et 25 dollars pour Opus 4.8 [4].

Le modèle a trois jours au moment où j’écris, donc rien ici n’est un verdict de terrain. J’ai plutôt repris le matériel de lancement de DeepSeek, les chiffres officiels d’Anthropic pour Opus 4.8, les classements publics et les premières mesures indépendantes, avec deux questions en tête. Que vaut « proche d’Opus 4.8 » une fois qu’on lit les notes de bas de page ? Et que coûte réellement une remise de 97 à 99 pour cent ?

Qu’est-ce qui est sorti exactement le 31 juillet ?

DeepSeek-V4-Flash-0731 est la version officielle d’un modèle en preview publique depuis le 24 avril 2026 [1]. DeepSeek précise que la nouvelle version garde l’architecture et la taille de la preview et n’a été que ré-entraînée en post-entraînement, autrement dit le modèle de base n’a pas changé, seules les dernières phases d’entraînement ont été refaites [1]. Sous le capot, V4 Flash est un modèle à mélange d’experts de 284 milliards de paramètres au total, dont 13 milliards actifs par token, et il accepte un contexte d’un million de tokens [5].

Les poids sont sur Hugging Face sous licence MIT, l’usage commercial et l’auto-hébergement sont donc sans restriction [2]. Côté API, DeepSeek a remplacé la version en place : l’identifiant reste deepseek-v4-flash, et les intégrations existantes sont passées à la nouvelle version sans changement de configuration [1]. C’est pratique pour l’utilisateur et gênant pour quiconque cite des résultats, car « V4 Flash » désigne désormais deux versions différentes selon la date où un chiffre a été mesuré. Le modèle expose un paramètre d’effort de raisonnement à trois niveaux, low, high et max, au lieu de livrer une variante de raisonnement séparée [2].

Reste la grille tarifaire, la raison pour laquelle cette sortie a fait du bruit bien au-delà du cercle des observateurs de modèles. Nikkei Asia l’a classée dans une guerre des prix qui s’intensifie sur les modèles d’IA, et rapporte que DeepSeek prévoit d’introduire plus tard une tarification aux heures de pointe [6]. La page de prix de DeepSeek confirme ce plan : une fois la politique en vigueur, les prix doubleront aux heures de pointe, ce qui n’est pas encore le cas [3]. Le grand frère, V4 Pro, reste en preview à 0,435 dollar en entrée et 0,87 en sortie, sa version officielle étant annoncée comme imminente [1] [3].

prix d'entrée, hors cache
0,14 $/MTok
Opus 4.8 : 5 $
prix de sortie
0,28 $/MTok
Opus 4.8 : 25 $
fenêtre de contexte
1M
sortie max de 384K tokens
paramètres actifs
13B
sur 284B au total, licence MIT

Par million de tokens en sortie, Opus 4.8 coûte 89 fois plus que V4 Flash. Que ce rapport compte ou non dépend entièrement de la capacité qui se trouve en face, et c’est précisément ce que le tableau de lancement est censé établir.

À quel point est-il proche d’Opus 4.8 ?

Moins proche que ne le laissent entendre les résumés qui circulent. La model card sur Hugging Face compare V4-Flash-0731 à Claude Opus 4.8 sur neuf benchmarks d’agents et de code, et Opus 4.8 mène chaque ligne [2]. Deux des écarts sont vraiment petits : un demi-point sur Agents’ Last Exam et 2,3 points sur Terminal-Bench 2.1. D’autres sont larges : 15,5 points sur NL2Repo et 12,1 sur DSBench-Hard.

Benchmark V4 Flash 0731Opus 4.8GLM-5.2
Terminal-Bench 2.1 82,7 85,0 (Meilleure valeur de la ligne) 81,0
NL2Repo 54,2 69,7 (Meilleure valeur de la ligne) 48,9
Cybergym 76,7 83,1 (Meilleure valeur de la ligne) -
DeepSWE 54,4 58,0 (Meilleure valeur de la ligne) 46,2
Toolathlon Verified 70,3 76,2 (Meilleure valeur de la ligne) 59,9
Agents' Last Exam 25,2 25,7 (Meilleure valeur de la ligne) 23,8
AutomationBench Public 25,1 27,2 (Meilleure valeur de la ligne) 12,9
DSBench FullStack 68,7 71,6 (Meilleure valeur de la ligne) 61,8
DSBench Hard 59,6 71,7 (Meilleure valeur de la ligne) 54,5
Figure 1. La comparaison de lancement de DeepSeek pour V4-Flash-0731. Tous les chiffres ont été mesurés par DeepSeek sur son propre harness, avec un effort de raisonnement max.

Le tableau suit un schéma cohérent : V4 Flash reste près d’Opus 4.8 sur les benchmarks de tâches en terminal et décroche nettement dès que le travail demande de comprendre ou de faire évoluer un dépôt de code. Face à GLM-5.2, l’autre modèle chinois du graphique, V4 Flash gagne les huit lignes qu’ils partagent.

Pour être juste envers DeepSeek, son propre cadrage est plus modeste que la couverture médiatique. L’affirmation centrale de la card est que la nouvelle version dépasse la preview du V4 Pro, pourtant plus gros, en activant beaucoup moins de paramètres [2], et publier une comparaison qu’on perd sur toutes les lignes est plus honnête que la pratique habituelle qui consiste à ne montrer que les victoires.

Le choix de l’adversaire pose toutefois un problème discret. Opus 4.8 était le meilleur modèle disponible d’Anthropic à sa sortie le 28 mai 2026 [7], mais dix semaines plus tard il figure dans la section legacy de la liste des modèles d’Anthropic [8]. Opus 5 est arrivé le 24 juillet au même tarif de 5 et 25 dollars, Anthropic y oriente désormais les nouveaux projets, et Fable 5 se place au-dessus des deux [9]. S’approcher d’Opus 4.8 en août 2026, c’est s’approcher de la frontière de mai, et le même argent achète aujourd’hui un Claude plus fort.

Quel score d’Opus 4.8 faut-il croire ?

Cela dépend de qui a exécuté le benchmark, et la dispersion est assez large pour avaler la comparaison entière. Le harness de DeepSeek donne à Opus 4.8 un score de 85,0 sur Terminal-Bench 2.1 [2]. Le classement public de Terminal-Bench liste Opus 4.8 tournant dans Claude Code à 78,9 % [10]. La system card d’Anthropic annonce 74,6 %, mesurés avec un effort high sur le harness Terminus-2 [7].

Claude Opus 4.8 sur Terminal-Bench 2.1, trois mesures Le harness de DeepSeek annonce 85,0, le classement public 78,9 et la system card d'Anthropic 74,6 pour le même modèle sur le même benchmark. DeepSeek Harness, effort max 85,0 % Classement Terminal-Bench, Claude Code 78,9 % System card d'Anthropic, Terminus-2, effort high 74,6 %
Afficher les données en tableau
Source Valeur
DeepSeek Harness, effort max 85,0 %
Classement Terminal-Bench, Claude Code 78,9 %
System card d'Anthropic, Terminus-2, effort high 74,6 %
Figure 2. Un modèle, un benchmark, trois mesures. Les scores de Claude Opus 4.8 sur Terminal-Bench 2.1 selon trois sources différentes.

Cela fait une dispersion de 10,4 points pour un seul modèle sur un seul benchmark, et le 82,7 de V4 Flash tombe dedans. Selon le chiffre d’Opus que vous posez à côté, le modèle de DeepSeek est 2,3 points derrière, 3,8 devant ou 8,1 devant. Une comparaison capable de produire les trois conclusions à la fois n’est pas vraiment une comparaison.

Cette dispersion n’est pas un signe de triche. Chaque source a utilisé un montage différent : un autre harness d’agent, un autre niveau d’effort, d’autres délais. La system card d’Anthropic note d’ailleurs que Terminal-Bench pénalise les endpoints lents, parce que les tâches courent contre des limites de temps fixes [7]. Remarquez que le harness de DeepSeek a donné à Opus 4.8 un score plus élevé que la mesure d’Anthropic elle-même : DeepSeek n’a donc pas sous-coté son concurrent. Les chiffres sortent simplement de montages qui ne se comparent pas directement.

Ce qui trancherait la question, c’est un tiers qui ferait passer les deux modèles par un même harness. Les chiffres de DeepSeek viennent de son propre DeepSeek Harness, dont je n’ai trouvé aucune version publiée, et au 3 août 2026 je n’ai repéré aucune reproduction indépendante d’une seule des neuf lignes. Tant qu’il n’y en a pas, le tableau de lancement est une affirmation, pas une mesure.

Que montrent les premiers chiffres indépendants ?

Une seule évaluation standardisée de tiers existe pour l’instant. Artificial Analysis a mesuré V4-Flash-0731 à 50 sur son Intelligence Index le 31 juillet, dix points au-dessus de la preview d’avril et un point derrière GPT-5.6 Luna à effort max [11]. Sur le même classement au 3 août, Gemini 3.6 Flash est aussi à 50, GLM-5.2 à 51, GPT-5.6 Terra à 55 et Kimi K3 à 57 [12]. Le positionnement indépendant, c’est donc le haut de la catégorie économique, pas la frontière, et comme Opus 4.8 n’apparaît pas dans cet index, il n’existe aucun chiffre indépendant pour la comparaison avec Opus.

C’est sur les coûts que les données indépendantes deviennent intéressantes. Faire tourner l’index complet a coûté 72,02 dollars à Artificial Analysis avec V4 Flash [13], contre 176,34 dollars avec le V4 Pro de DeepSeek, pourtant plus gros, qui a marqué six points de moins, à 44 [14]. Le petit modèle qui bat son grand frère était l’affirmation centrale du lancement de DeepSeek, et la voilà confirmée sur un harness indépendant : de meilleurs résultats à 40 % du coût.

La consommation de tokens mérite sa propre phrase, parce que le tarif bas la masque. V4 Flash a eu besoin d’environ 206 millions de tokens en sortie pour boucler l’index, 12 % de moins que la version d’avril [11], mais toujours plus que les 180 millions utilisés par V4 Pro [14]. Le modèle est bon marché par token, pas économe en tokens, donc un budget estimé à partir des consommations d’un autre modèle sera trop bas.

Deux autres lectures indépendantes complètent le tableau. Sur GDPval-AA v2, une comparaison de tâches professionnelles notée par votes de préférence, la nouvelle version atteint un Elo de 1559, contre 1189 pour la preview d’avril [11], et son taux d’hallucination au test AA-Omniscience s’améliore de 12 points pour atteindre 84 %, ce qui est un progrès depuis un mauvais point de départ, pas un bon résultat [11]. Sur le classement WebDev d’Arena, où des humains votent entre applications web générées, V4 Flash à effort high tenait la septième place avec un Elo de 1577 au 3 août, contre 1705 pour Opus 5 Max en tête [15]. Et un chiffre manque tout simplement : aucune mesure de vitesse indépendante de la version 0731 n’existait quand j’ai vérifié, donc considérez tout chiffre de tokens par seconde en circulation comme appartenant à une version antérieure [16].

Qu’achètent 0,28 dollar par million de tokens en pratique ?

Le prix catalogue n’est que le début du modèle de coûts. L’entrée en cache coûte 0,0028 dollar par million de tokens, un cinquantième du tarif hors cache [3], et les workflows d’agents renvoient à chaque tour un contexte presque identique, si bien que le tarif du cache domine la facture réelle. Dans l’autre sens, la politique d’heures de pointe annoncée doublera les prix pendant les heures de bureau de Pékin quand elle s’activera [3]. Les revendeurs compliquent encore le tableau : au lancement, OpenRouter affichait V4 Flash avec 38 % de remise, environ 0,09 dollar en entrée et 0,17 en sortie [17]. Si vous avez vu 0,17 ou 0,18 dollar cité comme prix de sortie du modèle, c’est la promotion du revendeur, pas le tarif de DeepSeek.

Une réserve s’applique à tous les prix par token entre fournisseurs dans cet article. La documentation tarifaire d’Anthropic indique que les modèles Claude depuis 4.7 utilisent un tokenizer qui produit environ 30 % de tokens en plus pour le même texte [4], les rapports de prix par token entre fournisseurs sont donc des approximations. Un facteur 89 sur la sortie survit largement à une correction de 30 %.

Les premiers retours de terrain collent au calcul. Sur Hacker News, un ingénieur a publié son tableau de bord sur 30 jours : 4,55 dollars pour 3 467 requêtes API couvrant 323 millions de tokens, avec ce verdict : le modèle « n’a pas déçu du tout sur les tâches de code ou de revue. Pour tout le reste, prenez un autre modèle » [18]. Cela fait en moyenne environ 0,014 dollar par million de tokens, moins que tous les tarifs affichés sauf celui du cache, donc l’essentiel de ce trafic devait être de l’entrée en cache. Le même utilisateur décrit la méthode de travail qui rend cela tenable : le modèle est faible en prose, progresse nettement avec des instructions précises et de l’outillage d’auto-revue, et « vous devez quand même relire 100 % du code comme s’il essayait de vous vendre une assurance » [19].

Les frictions signalées concordent aussi. Un autre commentateur a buté sur une limite serrée de tokens en sortie via OpenRouter, où un modèle qui s’égare dans un long détour de raisonnement manque de place avant de finir, et il conclut malgré tout que le modèle « a remplacé les modèles Kimi » pour lui [20]. Le test du jour même de Simon Willison pointe le réglage derrière ce comportement : à l’effort de raisonnement par défaut, son résultat était nettement moins bon qu’à high [21]. La configuration pratique qui ressort de trois jours de retours : lancez-le à effort high, gardez des tâches bien cadrées, et gardez un modèle plus fort ou un humain au poste de relecture.

Les petites lignes de la remise

La réserve sur les benchmarks traverse tout ce qui précède : les neuf lignes du tableau de lancement ont été mesurées par le fournisseur lui-même sur un harness non publié, et deux des neuf benchmarks sont des jeux de test internes de DeepSeek. C’est une raison d’attendre des évaluations d’agents indépendantes, pas une raison d’écarter le modèle.

Une réserve d’un autre genre est mesurée plutôt que soupçonnée. CTGT, une société de recherche qui teste le comportement des modèles, a constaté que V4 Flash répond de façon 45,45 points plus censurée aux questions sensibles sur la Chine qu’à des questions de contrôle structurellement identiques, en testant des poids auto-hébergés pour écarter tout filtrage côté fournisseur d’API [22]. La même étude montre qu’un modèle distillé à partir de sorties de V4 Flash ne garde aucune trace significative de ce comportement [22]. Si votre produit répond à des questions ne serait-ce que proches de terrains politiquement sensibles, cette mesure appartient à votre évaluation, et c’est une propriété des poids, pas de l’hébergement de DeepSeek.

Deux limites pratiques ferment la liste. Le modèle prend du texte et produit du texte, sans entrée d’images [11], ce qui exclut les boucles frontend pilotées par captures d’écran sur lesquelles s’appuient les montages d’agents multimodaux. Et l’API officielle n’est qu’une façon de l’exécuter parmi d’autres : grâce aux poids MIT [2], OpenRouter et d’autres fournisseurs occidentaux servent déjà le modèle [17], donc l’endpoint de DeepSeek, sa juridiction de données et ses futurs tarifs d’heures de pointe restent optionnels et non une partie du contrat.

L’information réellement nouvelle du 31 juillet n’est pas que V4 Flash bat Claude ; le propre tableau de DeepSeek dit le contraire. C’est le prix auquel le modèle perd. Payer environ un pour cent des tarifs d’Opus pour un modèle de cette classe change quelles tâches valent la peine d’être automatisées, avant même que les querelles de benchmarks soient réglées. Ma prochaine étape : le pointer vers mon dépôt de test habituel avec l’effort de raisonnement à high et un modèle plus fort au poste de relecture, puis revenir au graphique du fournisseur si un harness indépendant fait un jour tourner tous ces modèles dans les mêmes conditions.

Sources

  1. Change logDeepSeek API Docs · 2026-07-31
  2. DeepSeek-V4-Flash-0731 model cardDeepSeek on Hugging Face · 2026-07-31
  3. Models & PricingDeepSeek API Docs
  4. PricingClaude Platform Docs
  5. DeepSeek-V4 model cardDeepSeek on Hugging Face
  6. DeepSeek releases beta version of V4 models as AI price war heats upNikkei Asia · 2026-07-31
  7. System Card: Claude Opus 4.8Anthropic · 2026-05-28
  8. Models overviewClaude Platform Docs
  9. Introducing Claude Opus 5Anthropic · 2026-07-24
  10. Terminal-Bench 2.1 leaderboardTerminal-Bench
  11. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence IndexArtificial Analysis · 2026-07-31
  12. Models leaderboardArtificial Analysis
  13. DeepSeek V4 Flash 0731: intelligence, performance and priceArtificial Analysis
  14. DeepSeek V4 Pro: intelligence, performance and priceArtificial Analysis
  15. Arena leaderboardArena
  16. DeepSeek V4 Flash providersArtificial Analysis
  17. DeepSeek V4 FlashOpenRouter
  18. Comment with 30-day usage figures on the V4 Flash release threadHacker News · 2026-07-31
  19. Comment on working practices with V4 FlashHacker News · 2026-07-31
  20. Comment on output limitsHacker News · 2026-07-31
  21. deepseek-ai/DeepSeek-V4-Flash-0731Simon Willison · 2026-07-31
  22. Distillation censorship transferCTGT · 2026-07-29