Releases

DeepSeek V4 Flash verliert alle 9 Benchmarks gegen Opus 4.8

V4 Flash kostet 0,14 Dollar für Input und 0,28 Dollar für Output. Ich prüfe, ob 97 bis 99 Prozent Rabatt die neun Niederlagen gegen Opus aufwiegen.

Auf dieser Seite
  1. Wie nah kommt DeepSeek V4 Flash an Opus 4.8 heran?
  2. Was ist DeepSeek V4 Flash 0731?
  3. Welchem Opus-4.8-Wert soll man glauben?
  4. Was zeigen die ersten unabhängigen Zahlen?
  5. Was bekommst du für 0,28 Dollar pro Million Tokens?
  6. Was gibst du für den Rabatt auf?
  7. Mein Fazit: V4 Flash als Worker testen, nicht als Reviewer

DeepSeek V4 Flash ist kein Ersatz für Opus 4.8. In DeepSeeks eigener Launch-Tabelle liegt Opus in allen neun Benchmarks vorn, auch wenn zwei Abstände klein sind [2]. Interessant wird das Modell durch seinen Preis: V4 Flash kostet pro Million Tokens 0,14 Dollar für Input und 0,28 Dollar für Output [3], Opus 4.8 dagegen 5 und 25 Dollar [4].

Wie nah kommt DeepSeek V4 Flash an Opus 4.8 heran?

In zwei von DeepSeeks neun Tests liegt V4 Flash nah an Opus 4.8, bei den Repository-lastigen Benchmarks aber deutlich dahinter. Opus führt bei Agents’ Last Exam mit 0,5 Punkten und bei Terminal-Bench 2.1 mit 2,3 Punkten. Bei NL2Repo wächst der Abstand auf 15,5 Punkte, bei DSBench-Hard auf 12,1 [2].

Benchmark V4 Flash 0731Opus 4.8GLM-5.2
Terminal-Bench 2.1 82,7 85,0 (Bester Wert der Zeile) 81,0
NL2Repo 54,2 69,7 (Bester Wert der Zeile) 48,9
Cybergym 76,7 83,1 (Bester Wert der Zeile) -
DeepSWE 54,4 58,0 (Bester Wert der Zeile) 46,2
Toolathlon Verified 70,3 76,2 (Bester Wert der Zeile) 59,9
Agents' Last Exam 25,2 25,7 (Bester Wert der Zeile) 23,8
AutomationBench Public 25,1 27,2 (Bester Wert der Zeile) 12,9
DSBench FullStack 68,7 71,6 (Bester Wert der Zeile) 61,8
DSBench Hard 59,6 71,7 (Bester Wert der Zeile) 54,5
Abbildung 1. DeepSeeks Launch-Vergleich für V4-Flash-0731. Alle Werte stammen von DeepSeek und wurden mit dem eigenen Harness bei Reasoning-Effort max gemessen.

Wichtiger als eine einzelne Zeile ist das Muster. Bei Terminal-Aufgaben bleibt V4 Flash nah an Opus, doch beim Verstehen oder Erweitern eines Repositorys fällt es weiter zurück. Gegen GLM-5.2 gewinnt V4 Flash alle acht Zeilen, die beide Modelle gemeinsam haben.

DeepSeek selbst behauptet weniger, als viele Berichte daraus machen. Laut Model Card übertrifft der neue Build die größere V4-Pro-Preview, obwohl er deutlich weniger Parameter aktiviert [2]. Eine Tabelle zu veröffentlichen, in der das eigene Modell jeden Vergleich mit Opus verliert, ist außerdem nützlicher, als nur die gewonnenen Zeilen zu zeigen.

Der Vergleich ist allerdings schon veraltet. Bei seinem Release am 28. Mai 2026 war Opus 4.8 Anthropics stärkstes Modell [7]. Zehn Wochen später steht es im Legacy-Bereich der Anthropic-Modellliste [8]. Opus 5 erschien am 24. Juli zu denselben Preisen von 5 Dollar für Input und 25 Dollar für Output. Anthropic empfiehlt es inzwischen für neue Arbeit, während Fable 5 über beiden Modellen steht [9]. V4 Flash tritt also gegen Anthropics Spitzenmodell vom Mai an, nicht gegen das vom August.

Was ist DeepSeek V4 Flash 0731?

DeepSeek-V4-Flash-0731 erschien am 31. Juli 2026 als offizielle, erneut nachtrainierte Version der V4-Flash-Preview [1]. Die Preview war seit dem 24. April öffentlich. DeepSeek behielt Architektur und Größe bei und wiederholte nur die letzten Trainingsphasen. Das Ergebnis ist ein Mixture-of-Experts-Modell mit insgesamt 284 Milliarden Parametern, davon 13 Milliarden aktiv pro Token, und einem Kontextfenster von einer Million Tokens [5].

Die Gewichte stehen auf Hugging Face unter einer MIT-Lizenz. Kommerzielle Nutzung und Selbsthosting sind damit uneingeschränkt möglich [2].

In der API hat DeepSeek den Build direkt ausgetauscht. Der Modellname bleibt deepseek-v4-flash, und bestehende Integrationen wechselten ohne Konfigurationsänderung auf die neue Version [1]. Für Nutzer ist das bequem, für die Einordnung von Messwerten aber unpraktisch: Je nach Datum bezeichnet “V4 Flash” zwei unterschiedliche Builds. Das Modell bietet einen Parameter für den Reasoning-Effort mit den drei Stufen low, high und max, statt eine eigene Reasoning-Variante bereitzustellen [2].

Aufmerksamkeit bekam der Release vor allem wegen des Preises. Nikkei Asia ordnete ihn in einen wachsenden Preiskampf bei KI-Modellen ein und berichtete über DeepSeeks Plan, später Preise für Stoßzeiten einzuführen [6]. Laut DeepSeeks Preisseite sollen sich die Preise in diesen Zeiten verdoppeln. Am 3. August 2026 war die Regel noch nicht aktiv [3]. Das größere V4 Pro bleibt bei 0,435 Dollar für Input und 0,87 Dollar für Output in der Preview. DeepSeek kündigt die offizielle Version als bald verfügbar an [1] [3].

Input-Preis, Cache-Miss
0,14 $/MTok
Opus 4.8: 5 $
Output-Preis
0,28 $/MTok
Opus 4.8: 25 $
Kontextfenster
1M
max. Output 384K Tokens
aktive Parameter
13B
von 284B insgesamt, MIT-Lizenz

Pro Million Output-Tokens kostet Opus 4.8 etwa 89-mal so viel wie V4 Flash. Dieser Unterschied ist groß genug, um relevant zu sein. Ein Preisvergleich braucht aber einen verlässlichen Ausgangspunkt für die Modellleistung, und genau dort werden die Opus-Benchmarkwerte schwierig.

Welchem Opus-4.8-Wert soll man glauben?

Kein einzelner Wert für Opus 4.8 ist stabil genug, um diesen Vergleich darauf aufzubauen. DeepSeeks Harness meldet 85,0 auf Terminal-Bench 2.1 [2]. Die öffentliche Terminal-Bench-Rangliste nennt 78,9 Prozent mit Claude Code [10], Anthropics System Card dagegen 74,6 Prozent mit Effort high auf dem Terminus-2-Harness [7].

Claude Opus 4.8 auf Terminal-Bench 2.1, drei Messungen DeepSeeks Harness meldet 85,0, die öffentliche Rangliste 78,9 und Anthropics System Card 74,6 für dasselbe Modell im selben Benchmark. DeepSeek Harness, Effort max 85,0 % Terminal-Bench-Rangliste, Claude Code 78,9 % Anthropic System Card, Terminus-2, Effort high 74,6 %
Daten als Tabelle anzeigen
Quelle Wert
DeepSeek Harness, Effort max 85,0 %
Terminal-Bench-Rangliste, Claude Code 78,9 %
Anthropic System Card, Terminus-2, Effort high 74,6 %
Abbildung 2. Ein Modell, ein Benchmark, drei Messungen. Drei Quellen melden unterschiedliche Terminal-Bench-2.1-Werte für Claude Opus 4.8.

Der eigene Wert von V4 Flash, 82,7, liegt innerhalb dieser Spanne von 10,4 Punkten. Je nachdem, welchen Opus-Wert du verwendest, liegt DeepSeeks Modell 2,3 Punkte dahinter, 3,8 Punkte davor oder 8,1 Punkte davor. Aus den Modellwerten allein lässt sich deshalb nicht ableiten, welches Modell Terminal-Aufgaben besser erledigt.

DeepSeek meldet den höchsten der drei Opus-Werte und rechnet den Konkurrenten damit nicht klein. Die Spanne von 10,4 Punkten entsteht durch unterschiedliche Agenten-Harnesses, Effort-Stufen und Zeitlimits. Anthropics System Card weist außerdem darauf hin, dass Terminal-Bench langsame Endpoints benachteiligt, weil die Aufgaben feste Zeitlimits haben [7]. Diese Setups lassen sich nicht direkt vergleichen.

Klarheit könnte ein unabhängiger Anbieter schaffen, der beide Modelle mit demselben Harness testet. Bis zum 3. August 2026 konnte ich weder eine öffentliche Version des DeepSeek Harness noch eine unabhängige Reproduktion einer der neun Zeilen finden. Bis es eine solche Messung gibt, bleibt die Tabelle ein Ergebnis des Anbieters und kein unabhängig reproduzierter Vergleich.

Was zeigen die ersten unabhängigen Zahlen?

Artificial Analysis ordnet V4 Flash an der Spitze der günstigen Modelle ein, nicht bei den Spitzenmodellen. Im Intelligence Index erreicht es 50 Punkte, zehn mehr als die April-Preview und einen weniger als GPT-5.6 Luna bei Effort max [11]. Opus 4.8 fehlt in diesem Index, daher reproduziert das Ergebnis DeepSeeks Vergleich nicht.

Auf derselben Rangliste erreichte Gemini 3.6 Flash am 3. August 2026 ebenfalls 50 Punkte, GLM-5.2 kam auf 51, GPT-5.6 Terra auf 55 und Kimi K3 auf 57 [12]. Das ist die einzige standardisierte, unabhängige Einordnung, die ich für den 0731-Build finden konnte.

Artificial Analysis bestätigt auch DeepSeeks zentrale Behauptung, dass V4 Flash das größere V4 Pro bei geringeren Kosten schlägt. Der vollständige Index kostete mit V4 Flash 72,02 Dollar [13]. V4 Pro kostete 176,34 Dollar und erreichte mit 44 Punkten sechs Punkte weniger [14]. V4 Flash liefert damit das bessere Ergebnis für etwa 40 Prozent der Kosten.

Für die Gesamtrechnung bleibt der Token-Verbrauch wichtig. V4 Flash benötigte für den Index rund 206 Millionen Output-Tokens, 12 Prozent weniger als der April-Build [11], aber mehr als die 180 Millionen von V4 Pro [14]. Das Modell ist pro Token billig, geht mit Tokens jedoch nicht sparsam um. Wer mit dem Verbrauch eines anderen Modells kalkuliert, wird die Kosten deshalb unterschätzen.

Zwei weitere Tests von Artificial Analysis zeigen eine deutliche Verbesserung gegenüber der April-Preview. Bei GDPval-AA v2, einem Vergleich von Arbeitsaufgaben anhand von Präferenzstimmen, stieg der neue Build von einem Elo-Wert von 1189 auf 1559 [11]. Die Halluzinationsrate bei AA-Omniscience verbesserte sich um 12 Punkte auf 84 Prozent. Das ist ein Fortschritt von einem schlechten Ausgangswert, kein gutes Ergebnis [11].

Auch die WebDev-Rangliste sieht V4 Flash unterhalb der Spitzenmodelle. Bei Arena stimmen Menschen über generierte Web-Apps ab. Dort lag V4 Flash mit Effort high am 3. August 2026 mit einem Elo-Wert von 1577 auf Platz sieben, während Opus 5 Max mit 1705 an der Spitze stand [15].

Unbekannt bleibt die Geschwindigkeit dieses Builds. Ich habe keine unabhängige Messung der Tokens pro Sekunde für 0731 gefunden. Jede Geschwindigkeitsangabe, die am 3. August 2026 kursierte, bezog sich daher auf einen älteren V4-Flash-Build [16].

Was bekommst du für 0,28 Dollar pro Million Tokens?

Die ersten Berichte beschreiben V4 Flash als günstigen Coding-Worker, der unter enger Aufsicht am besten arbeitet, nicht als allgemeinen Ersatz für ein stärkeres Modell. Durch wiederverwendeten Cache-Kontext kann die tatsächliche Rechnung unter dem Listenpreis liegen. Künftige Stoßzeitenpreise und Rabatte von Resellern machen die 0,28 Dollar zugleich nur zum Ausgangspunkt.

Gecachter Input kostet 0,0028 Dollar pro Million Tokens, ein Fünfzigstel des Cache-Miss-Preises [3]. Agenten-Workflows senden bei jedem Schritt meist fast unveränderten Kontext erneut. In die andere Richtung wirkt DeepSeeks angekündigte Regel für Stoßzeiten: Sobald sie aktiv ist, verdoppeln sich die Preise während der Pekinger Geschäftszeiten [3]. Zum Release bot OpenRouter 38 Prozent Rabatt, etwa 0,09 Dollar für Input und 0,17 Dollar für Output [17]. Die andernorts genannten Output-Preise von 0,17 oder 0,18 Dollar stammen deshalb aus der Reseller-Aktion, nicht aus DeepSeeks Preisliste.

Für alle Token-Preisvergleiche zwischen Anbietern in diesem Artikel gilt eine Einschränkung. Laut Anthropics Preisdokumentation verwenden Claude-Modelle ab Version 4.7 einen Tokenizer, der für denselben Text etwa 30 Prozent mehr Tokens erzeugt [4]. Preisverhältnisse pro Token sind zwischen Anbietern deshalb Näherungen. Der Faktor 89 beim Output bleibt allerdings auch nach einer Korrektur um 30 Prozent sehr groß.

Ein Entwickler veröffentlichte auf Hacker News ein 30-Tage-Dashboard mit Kosten von 4,55 Dollar für 3.467 API-Anfragen und 323 Millionen Tokens. Sein Urteil: Das Modell habe ihn “bei Coding- oder Review-Aufgaben überhaupt nicht enttäuscht. Für alles andere sollte man ein anderes Modell verwenden” [18]. Im Durchschnitt sind das rund 0,014 Dollar pro Million Tokens, weniger als jeder angegebene Preis außer einem Cache-Treffer. Der größte Teil des Datenverkehrs muss deshalb aus gecachtem Input bestanden haben. Derselbe Nutzer beschreibt das Modell als schwach bei Prosa, aber deutlich besser mit genauen Anweisungen und Tools zur Selbstprüfung. Trotzdem müsse man “100 % des Codes prüfen, als wolle es einem eine Versicherung verkaufen” [19].

Ein anderer Kommentator stieß bei OpenRouter auf ein knappes Output-Token-Limit, nachdem das Modell zu lange nachgedacht hatte. Trotzdem kam er zu dem Schluss, dass es “die Kimi-Modelle für mich ersetzt” habe [20]. Simon Willisons Test vom selben Tag weist auf eine nützliche Einstellung hin: Sein Ergebnis mit dem Standard-Effort war deutlich schlechter als mit high [21]. Zusammengenommen sprechen die Berichte für Effort high, klar begrenzte Aufgaben und ein stärkeres Modell oder einen Menschen auf dem Review-Platz.

Was gibst du für den Rabatt auf?

V4 Flash unterstützt keine Bildeingabe. Eine kontrollierte Studie fand außerdem deutlich stärkere Zensur bei China-sensiblen Fragen als bei passenden Kontrollfragen [11] [22]. Diese Grenzen sind für multimodale Coding-Workflows und Produkte relevant, die Fragen zu politisch sensiblen Themen beantworten.

CTGT, ein Forschungsunternehmen für Modellverhalten, maß zwischen China-sensiblen Fragen und strukturell identischen Kontrollfragen einen Zensurabstand von 45,45 Punkten. Die Forschenden testeten selbst gehostete Gewichte, um Filter des API-Anbieters auszuschließen. Bei einem Modell, das aus Ausgaben von V4 Flash destilliert wurde, fanden sie dagegen keine signifikante Spur desselben Verhaltens [22]. Das Ergebnis betrifft daher die Gewichte und nicht nur DeepSeeks gehosteten Endpoint.

Ohne Bildeingabe kann das Modell keine screenshotbasierten Frontend-Schleifen ausführen, wie sie multimodale Agenten verwenden [11]. Die offizielle API ist optional, weil die MIT-Gewichte [2] bereits über OpenRouter und andere westliche Anbieter verfügbar sind [17]. Ein anderer Anbieter kann Endpoint, Datenjurisdiktion und Preis ändern, nicht aber ein Verhalten entfernen, das in den Gewichten steckt.

Mein Fazit: V4 Flash als Worker testen, nicht als Reviewer

V4 Flash ist einen Test wert, weil ich damit ein Modell dieser Klasse für ein bis drei Prozent der Opus-Preise bekomme, nicht weil es Claude schlägt. DeepSeeks eigene Tabelle zeigt die Niederlagen, und die unabhängigen Daten ordnen das Modell bei den starken Budgetmodellen statt an der Spitze ein.

Als Nächstes werde ich V4 Flash mit Reasoning-Effort high auf mein übliches Test-Repository ansetzen und ein stärkeres Modell auf dem Review-Platz behalten. Wenn ein unabhängiger Harness beide Modelle unter denselben Bedingungen testet, werde ich den Vergleich neu bewerten. Bis dahin erweitert der Rabatt die Aufgaben, deren Automatisierung ich mir leisten kann, ersetzt aber nicht die Prüfung der Ergebnisse.

Quellen

  1. Change logDeepSeek API Docs · 2026-07-31
  2. DeepSeek-V4-Flash-0731 model cardDeepSeek on Hugging Face · 2026-07-31
  3. Models & PricingDeepSeek API Docs
  4. PricingClaude Platform Docs
  5. DeepSeek-V4 model cardDeepSeek on Hugging Face
  6. DeepSeek releases beta version of V4 models as AI price war heats upNikkei Asia · 2026-07-31
  7. System Card: Claude Opus 4.8Anthropic · 2026-05-28
  8. Models overviewClaude Platform Docs
  9. Introducing Claude Opus 5Anthropic · 2026-07-24
  10. Terminal-Bench 2.1 leaderboardTerminal-Bench
  11. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence IndexArtificial Analysis · 2026-07-31
  12. Models leaderboardArtificial Analysis
  13. DeepSeek V4 Flash 0731: intelligence, performance and priceArtificial Analysis
  14. DeepSeek V4 Pro: intelligence, performance and priceArtificial Analysis
  15. Arena leaderboardArena
  16. DeepSeek V4 Flash providersArtificial Analysis
  17. DeepSeek V4 FlashOpenRouter
  18. Comment with 30-day usage figures on the V4 Flash release threadHacker News · 2026-07-31
  19. Comment on working practices with V4 FlashHacker News · 2026-07-31
  20. Comment on output limitsHacker News · 2026-07-31
  21. deepseek-ai/DeepSeek-V4-Flash-0731Simon Willison · 2026-07-31
  22. Distillation censorship transferCTGT · 2026-07-29