DeepSeek V4 Flash perde 9 benchmark su 9 contro Opus 4.8
V4 Flash costa 0,14 $ in ingresso e 0,28 $ in uscita per milione di token. Ho verificato se lo sconto dal 97 al 99% compensa le sconfitte nei benchmark.
In questa pagina
- Quanto è vicino DeepSeek V4 Flash a Opus 4.8?
- Che cos’è DeepSeek V4 Flash 0731?
- A quale punteggio di Opus 4.8 puoi credere?
- Cosa mostrano i primi numeri indipendenti?
- Cosa comprano 0,28 dollari per milione di token in pratica?
- A cosa rinunci in cambio dello sconto?
- Il mio verdetto: prova V4 Flash come esecutore, non come revisore
DeepSeek V4 Flash non sostituisce Opus 4.8. Nella tabella di lancio di DeepSeek, Opus vince tutti e nove i benchmark, anche se due distacchi sono piccoli [2]. Il motivo per interessarsene è il prezzo: V4 Flash costa 0,14 $ per milione di token in ingresso e 0,28 $ in uscita [3], contro 5 e 25 $ per Opus 4.8 [4].
Quanto è vicino DeepSeek V4 Flash a Opus 4.8?
DeepSeek V4 Flash è vicino a Opus 4.8 in due dei nove test di DeepSeek, ma resta molto indietro nei benchmark che richiedono più lavoro sul repository. Opus vince di 0,5 punti su Agents’ Last Exam e di 2,3 su Terminal-Bench 2.1, poi il divario sale a 15,5 punti su NL2Repo e 12,1 su DSBench-Hard [2].
| Benchmark | V4 Flash 0731 | Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 (Valore migliore della riga) | 81,0 |
| NL2Repo | 54,2 | 69,7 (Valore migliore della riga) | 48,9 |
| Cybergym | 76,7 | 83,1 (Valore migliore della riga) | - |
| DeepSWE | 54,4 | 58,0 (Valore migliore della riga) | 46,2 |
| Toolathlon Verified | 70,3 | 76,2 (Valore migliore della riga) | 59,9 |
| Agents' Last Exam | 25,2 | 25,7 (Valore migliore della riga) | 23,8 |
| AutomationBench Public | 25,1 | 27,2 (Valore migliore della riga) | 12,9 |
| DSBench FullStack | 68,7 | 71,6 (Valore migliore della riga) | 61,8 |
| DSBench Hard | 59,6 | 71,7 (Valore migliore della riga) | 54,5 |
Conta più l’andamento dei nove risultati che il singolo punteggio. V4 Flash resta vicino a Opus nei task da terminale, ma perde più terreno quando deve capire o costruire un repository. Rimane però davanti a GLM-5.2 in tutti e otto i benchmark condivisi.
DeepSeek presenta una tesi più limitata rispetto a molta copertura mediatica. La model card afferma che la nuova build supera la preview del più grande V4 Pro pur attivando molti meno parametri [2]. Pubblicare un grafico in cui il modello perde ogni confronto con Opus è anche più utile che mostrare soltanto i benchmark vinti.
Il confronto è però già datato. Opus 4.8 era il modello più potente di Anthropic quando è uscito il 28 maggio 2026 [7], ma dieci settimane dopo compare nella sezione legacy dell’elenco dei modelli [8]. Opus 5 è arrivato il 24 luglio agli stessi prezzi di 5 $ in ingresso e 25 $ in uscita, e Anthropic ora lo consiglia per i nuovi progetti, mentre Fable 5 si colloca sopra entrambi [9]. V4 Flash compete con il modello di punta di Anthropic di maggio, non con quello di agosto.
Che cos’è DeepSeek V4 Flash 0731?
DeepSeek-V4-Flash-0731 è uscito il 31 luglio 2026 come release ufficiale della preview V4 Flash, dopo un nuovo post-training [1]. La preview era pubblica dal 24 aprile e DeepSeek ne ha mantenuto architettura e dimensioni, rifacendo soltanto le fasi finali dell’addestramento.
Il risultato è un modello mixture-of-experts con 284 miliardi di parametri totali, 13 miliardi attivi per token e una finestra di contesto da un milione di token [5].
I pesi sono disponibili su Hugging Face con licenza MIT, che consente senza restrizioni l’uso commerciale e il self-hosting [2].
Per l’API, DeepSeek ha sostituito la build senza cambiare l’identificatore: il nome resta deepseek-v4-flash e le integrazioni esistenti sono passate alla nuova versione senza modifiche alla configurazione [1]. È comodo per chi usa il modello, ma rende più difficile citare i risultati, perché “V4 Flash” ora indica due build diverse a seconda della data della misurazione. Il modello offre un parametro di effort di ragionamento con tre livelli, low, high e max, invece di una variante separata dedicata al ragionamento [2].
Il prezzo ha attirato l’attenzione sulla release. Nikkei Asia lo ha descritto come parte di una guerra dei prezzi sempre più accesa tra modelli di IA e ha riportato che DeepSeek introdurrà in seguito tariffe per le ore di punta [6]. La pagina dei prezzi di DeepSeek conferma che, una volta attivata la regola, i prezzi raddoppieranno nelle ore di punta. Il 3 agosto 2026 non era ancora successo [3]. Il più grande V4 Pro resta in preview a 0,435 $ in ingresso e 0,87 $ in uscita, con la versione ufficiale annunciata come imminente [1] [3].
- prezzo di ingresso, senza cache
- 0,14 $/MTok
- Opus 4.8: 5 $
- prezzo di uscita
- 0,28 $/MTok
- Opus 4.8: 25 $
- finestra di contesto
- 1M
- uscita massima di 384K token
- parametri attivi
- 13B
- su 284B totali, licenza MIT
Per ogni milione di token in uscita, Opus 4.8 costa circa 89 volte più di V4 Flash. È una differenza che conta, ma per confrontare i prezzi serve comunque un riferimento credibile sulle capacità. I punteggi di Opus sono proprio il punto in cui il confronto si complica.
A quale punteggio di Opus 4.8 puoi credere?
Nessun punteggio di Opus 4.8 è abbastanza stabile da fare da riferimento a questo confronto. L’harness di DeepSeek riporta 85,0 su Terminal-Bench 2.1 [2], la classifica pubblica di Terminal-Bench mostra il 78,9 per cento con Claude Code [10], mentre la system card di Anthropic indica il 74,6 per cento con effort high sull’harness Terminus-2 [7].
Mostra i dati in tabella
| Fonte | Valore |
|---|---|
| DeepSeek Harness, effort max | 85,0% |
| Classifica Terminal-Bench, Claude Code | 78,9% |
| System card di Anthropic, Terminus-2, effort high | 74,6% |
L’82,7 di V4 Flash cade all’interno di questa variazione di 10,4 punti. A seconda del risultato di Opus scelto, il modello di DeepSeek è 2,3 punti indietro, 3,8 avanti oppure 8,1 avanti. I soli punteggi non permettono di stabilire quale modello sia migliore nei task da terminale.
DeepSeek ha riportato il punteggio di Opus più alto dei tre, quindi non ha penalizzato il concorrente. La variazione di 10,4 punti deriva da harness per agenti, livelli di effort e limiti di tempo diversi. La system card di Anthropic osserva inoltre che Terminal-Bench penalizza gli endpoint lenti, perché i task hanno limiti fissi di tempo reale [7]. Queste configurazioni non sono direttamente confrontabili.
Il confronto si potrebbe risolvere facendo eseguire entrambi i modelli sullo stesso harness da una terza parte. Non ho trovato una versione pubblica del DeepSeek Harness né una riproduzione indipendente di uno dei nove risultati al 3 agosto 2026. Fino ad allora, resta un risultato del fornitore e non un confronto riprodotto in modo indipendente.
Cosa mostrano i primi numeri indipendenti?
Artificial Analysis colloca V4 Flash tra i migliori modelli economici, non tra quelli di punta. Il punteggio di 50 sull’Intelligence Index supera di dieci punti la preview di aprile ed è un punto sotto GPT-5.6 Luna con effort max [11]. Opus 4.8 non compare nell’indice, quindi questo test non riproduce il confronto di DeepSeek.
Nella stessa classifica del 3 agosto 2026, Gemini 3.6 Flash ha ottenuto anch’esso 50, GLM-5.2 è arrivato a 51, GPT-5.6 Terra a 55 e Kimi K3 a 57 [12]. È l’unico posizionamento indipendente e standardizzato che ho trovato per la build 0731.
Artificial Analysis ha confermato anche la tesi centrale di DeepSeek: V4 Flash supera il più grande V4 Pro a un costo minore. L’esecuzione dell’intero indice è costata 72,02 $ con V4 Flash [13], contro 176,34 $ per V4 Pro, che ha ottenuto sei punti in meno con 44 [14]. Il risultato è migliore a circa il 40 per cento del costo.
Il consumo di token incide comunque sulla spesa totale. V4 Flash ha usato circa 206 milioni di token in uscita per completare l’indice, il 12 per cento in meno rispetto alla build di aprile [11], ma più dei 180 milioni usati da V4 Pro [14]. Il modello costa poco per token, ma ne usa molti, quindi un preventivo basato sui consumi di un altro modello rischia di essere troppo basso.
Altri due test di Artificial Analysis mostrano un forte miglioramento rispetto alla preview di aprile. In GDPval-AA v2, un confronto tra attività lavorative valutato tramite preferenze, la nuova build ha raggiunto un Elo di 1559, in crescita da 1189 [11]. Il tasso di allucinazione su AA-Omniscience è sceso di 12 punti fino all’84 per cento, che resta un cattivo risultato nonostante il progresso [11].
Anche la classifica WebDev colloca V4 Flash sotto i modelli di punta. Su Arena, dove le persone votano le applicazioni web generate, V4 Flash con effort high era settimo il 3 agosto 2026 con un Elo di 1577, contro i 1705 di Opus 5 Max in testa [15].
La velocità della build resta sconosciuta. Non ho trovato misurazioni indipendenti dei token al secondo per la versione 0731, quindi qualsiasi dato sulla velocità in circolazione il 3 agosto 2026 si riferiva a una build precedente di V4 Flash [16].
Cosa comprano 0,28 dollari per milione di token in pratica?
Le prime esperienze descrivono un esecutore economico per il codice che funziona meglio sotto attenta supervisione, non un sostituto generale di un modello più potente. La fattura può essere inferiore quando gli agenti riutilizzano il contesto in cache, mentre le future tariffe di punta e gli sconti dei rivenditori rendono 0,28 $ soltanto il punto di partenza.
L’ingresso in cache costa 0,0028 $ per milione di token, un cinquantesimo della tariffa senza cache [3], e a ogni turno i flussi di agenti inviano di nuovo un contesto quasi identico. In senso opposto, DeepSeek dice che i prezzi raddoppieranno nelle ore di punta di Pechino quando la regola entrerà in vigore [3]. Al lancio, OpenRouter applicava uno sconto del 38 per cento, con prezzi di circa 0,09 $ in ingresso e 0,17 $ in uscita [17]. I prezzi di uscita da 0,17 o 0,18 $ citati altrove si riferiscono quindi alla promozione del rivenditore, non al listino di DeepSeek.
Un limite riguarda tutti i confronti tra i prezzi per token di fornitori diversi. La documentazione dei prezzi di Anthropic indica che i modelli Claude dalla versione 4.7 usano un tokenizer che produce circa il 30 per cento di token in più per lo stesso testo [4]. I rapporti tra fornitori sono quindi approssimativi, ma una differenza di 89 volte sul prezzo di uscita resta enorme anche dopo una correzione del 30 per cento.
Un ingegnere su Hacker News ha pubblicato un pannello di controllo relativo a 30 giorni: 4,55 $ per 3.467 richieste API e 323 milioni di token. Il suo verdetto è che il modello “non ha deluso per niente nei task di programmazione o revisione. Per tutto il resto, usa un altro modello” [18]. La media è di circa 0,014 $ per milione di token, meno di qualsiasi tariffa indicata tranne quella per la cache, quindi gran parte del traffico deve essere stata composta da input memorizzati in cache. Lo stesso utente afferma che il modello è debole nella prosa, migliora con istruzioni precise e strumenti di autorevisione e che “devi comunque rivedere il 100% del codice come se cercasse di venderti un’assicurazione” [19].
Un altro commentatore ha incontrato un limite stretto per i token in uscita tramite OpenRouter. Il modello ha speso troppo spazio nel ragionamento prima di arrivare alla risposta, ma per quell’utente ha comunque “sostituito i modelli Kimi” [20]. Un test di Simon Willison pubblicato lo stesso giorno indica un’impostazione utile: il risultato con l’effort predefinito era nettamente peggiore di quello ottenuto con high [21]. Nel complesso, queste esperienze consigliano effort high, task ben delimitati e un modello più potente o un essere umano nel ruolo di revisore.
A cosa rinunci in cambio dello sconto?
V4 Flash non accetta immagini e uno studio controllato ha rilevato una censura molto più forte per le domande sensibili sulla Cina rispetto a domande di controllo equivalenti [11] [22]. Sono limiti importanti per i flussi di programmazione multimodali e per qualsiasi prodotto che risponda a domande su temi politicamente sensibili.
CTGT, una società di ricerca che analizza il comportamento dei modelli, ha misurato una differenza di 45,45 punti nella censura tra domande sensibili sulla Cina e domande di controllo con la stessa struttura. I ricercatori hanno testato i pesi in self-hosting per escludere i filtri del fornitore dell’API, mentre un modello ottenuto tramite distillazione dagli output di V4 Flash non mostrava tracce significative dello stesso comportamento [22]. Il risultato riguarda quindi i pesi, non soltanto l’endpoint ospitato da DeepSeek.
Senza input di immagini, il modello non può gestire i cicli di sviluppo frontend basati su screenshot usati dagli agenti multimodali [11]. L’API ufficiale non è obbligatoria, perché i pesi MIT [2] sono già disponibili tramite OpenRouter e altri fornitori occidentali [17]. Se scegli un altro fornitore, puoi cambiare endpoint, giurisdizione dei dati e prezzo, ma non eliminare un comportamento incorporato nei pesi.
Il mio verdetto: prova V4 Flash come esecutore, non come revisore
Vale la pena provare V4 Flash perché offre un modello di questa categoria a un prezzo compreso tra l’uno e il tre per cento delle tariffe di Opus, non perché batta Claude. La tabella di DeepSeek mostra che perde, mentre i dati indipendenti lo collocano tra i migliori modelli economici e non tra quelli di punta.
Il mio prossimo passo è assegnare a V4 Flash il mio solito repository di prova con effort high e lasciare la revisione a un modello più potente. Se un harness indipendente lo confronterà con Opus nelle stesse condizioni, tornerò sui risultati. Fino ad allora, lo sconto aumenta il numero di task che posso permettermi di automatizzare, ma non elimina la necessità di controllarne il lavoro.
Fonti
- Change log
- DeepSeek-V4-Flash-0731 model card
- Models & Pricing
- Pricing
- DeepSeek-V4 model card
- DeepSeek releases beta version of V4 models as AI price war heats up
- System Card: Claude Opus 4.8
- Models overview
- Introducing Claude Opus 5
- Terminal-Bench 2.1 leaderboard
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index
- Models leaderboard
- DeepSeek V4 Flash 0731: intelligence, performance and price
- DeepSeek V4 Pro: intelligence, performance and price
- Arena leaderboard
- DeepSeek V4 Flash providers
- DeepSeek V4 Flash
- Comment with 30-day usage figures on the V4 Flash release thread
- Comment on working practices with V4 Flash
- Comment on output limits
- deepseek-ai/DeepSeek-V4-Flash-0731
- Distillation censorship transfer