Release

DeepSeek confronta V4 Flash e Opus 4.8: perde tutte le righe

La tabella di lancio di V4 Flash mostra Claude Opus 4.8 davanti in tutti e nove i benchmark. Verifico cosa comprano 0,14 e 0,28 dollari per milione di token.

In questa pagina
  1. Cosa è uscito esattamente il 31 luglio?
  2. Quanto è vicino a Opus 4.8?
  3. A quale punteggio di Opus 4.8 credere?
  4. Cosa mostrano i primi numeri indipendenti?
  5. Cosa comprano 0,28 dollari per milione di token in pratica?
  6. Le clausole in piccolo dello sconto

DeepSeek ha pubblicato la versione ufficiale di V4 Flash il 31 luglio 2026 [1], e il grafico di lancio fa una cosa insolita: confronta il modello con Claude Opus 4.8 su nove benchmark e perde tutte le righe [2]. L’entusiasmo arriva lo stesso, e arriva dal prezzo: 0,14 dollari per milione di token in ingresso e 0,28 per milione in uscita [3], contro i 5 e 25 dollari di Opus 4.8 [4].

Il modello ha tre giorni mentre scrivo, quindi niente di quanto segue è un verdetto sul campo. Ho invece esaminato il materiale di lancio di DeepSeek, i numeri ufficiali di Anthropic per Opus 4.8, le classifiche pubbliche e le prime misurazioni indipendenti, con due domande in testa. Quanto vale “vicino a Opus 4.8” una volta lette le note a piè di pagina? E quanto ti costa davvero uno sconto tra il 97 e il 99 per cento?

Cosa è uscito esattamente il 31 luglio?

DeepSeek-V4-Flash-0731 è la versione ufficiale di un modello in preview pubblica dal 24 aprile 2026 [1]. DeepSeek spiega che la nuova build mantiene architettura e dimensioni della preview ed è stata solo sottoposta di nuovo al post-training, cioè il modello di base non è cambiato e sono state rifatte soltanto le ultime fasi di addestramento [1]. Sotto il cofano, V4 Flash è un modello mixture-of-experts da 284 miliardi di parametri totali, di cui 13 miliardi attivi per token, e accetta un contesto da un milione di token [5].

I pesi sono su Hugging Face con licenza MIT, quindi uso commerciale e self-hosting non hanno restrizioni [2]. Sul lato API, DeepSeek ha sostituito la build senza cambiare nome: l’identificatore resta deepseek-v4-flash, e le integrazioni esistenti sono passate alla nuova versione senza toccare la configurazione [1]. Comodo per chi usa il modello, scomodo per chi cita risultati, perché “V4 Flash” ora indica due build diverse a seconda della data in cui un numero è stato misurato. Il modello espone un parametro di effort di ragionamento con tre livelli, low, high e max, invece di pubblicare una variante di ragionamento separata [2].

Poi c’è il listino, il motivo per cui questa uscita ha fatto rumore ben oltre la cerchia di chi segue i modelli. Nikkei Asia l’ha inquadrata in una guerra dei prezzi sempre più accesa sui modelli di IA, e riferisce che DeepSeek prevede di introdurre più avanti tariffe per le ore di punta [6]. La pagina dei prezzi di DeepSeek conferma il piano: quando la politica entrerà in vigore, i prezzi raddoppieranno nelle ore di punta, cosa che per ora non è successa [3]. Il fratello maggiore, V4 Pro, resta in preview a 0,435 dollari in ingresso e 0,87 in uscita, con la versione ufficiale annunciata come imminente [1] [3].

prezzo di ingresso, senza cache
0,14 $/MTok
Opus 4.8: 5 $
prezzo di uscita
0,28 $/MTok
Opus 4.8: 25 $
finestra di contesto
1M
uscita massima 384K token
parametri attivi
13B
su 284B totali, licenza MIT

Per milione di token in uscita, Opus 4.8 costa 89 volte più di V4 Flash. Che quel rapporto conti o meno dipende interamente da quanta capacità c’è dall’altra parte, ed è proprio quello che la tabella di lancio dovrebbe stabilire.

Quanto è vicino a Opus 4.8?

Non quanto suggeriscono i riassunti in circolazione. La model card su Hugging Face confronta V4-Flash-0731 con Claude Opus 4.8 su nove benchmark di agenti e programmazione, e Opus 4.8 guida ogni riga [2]. Due distacchi sono davvero piccoli: mezzo punto su Agents’ Last Exam e 2,3 punti su Terminal-Bench 2.1. Altri sono ampi: 15,5 punti su NL2Repo e 12,1 su DSBench-Hard.

Benchmark V4 Flash 0731Opus 4.8GLM-5.2
Terminal-Bench 2.1 82,7 85,0 (Valore migliore della riga) 81,0
NL2Repo 54,2 69,7 (Valore migliore della riga) 48,9
Cybergym 76,7 83,1 (Valore migliore della riga) -
DeepSWE 54,4 58,0 (Valore migliore della riga) 46,2
Toolathlon Verified 70,3 76,2 (Valore migliore della riga) 59,9
Agents' Last Exam 25,2 25,7 (Valore migliore della riga) 23,8
AutomationBench Public 25,1 27,2 (Valore migliore della riga) 12,9
DSBench FullStack 68,7 71,6 (Valore migliore della riga) 61,8
DSBench Hard 59,6 71,7 (Valore migliore della riga) 54,5
Figura 1. Il confronto di lancio di DeepSeek per V4-Flash-0731. Tutti i numeri sono misurati da DeepSeek sul proprio harness, con effort di ragionamento max.

La tabella segue uno schema coerente: V4 Flash sta vicino a Opus 4.8 sui benchmark di attività da terminale e resta chiaramente indietro dove il lavoro richiede di capire o far crescere un repository. Contro GLM-5.2, l’altro modello cinese del grafico, V4 Flash vince tutte e otto le righe che condividono.

Per essere onesti con DeepSeek, la sua cornice è più modesta della copertura mediatica. L’affermazione centrale della card è che la nuova build supera la preview del più grande V4 Pro attivando molti meno parametri [2], e stampare un confronto che perdi su tutte le righe è più onesto della prassi consueta dei lanci, che mostra solo le vittorie.

La scelta dell’avversario ha però un problema silenzioso. Opus 4.8 era il miglior modello disponibile di Anthropic quando è uscito il 28 maggio 2026 [7], ma dieci settimane dopo compare nella sezione legacy dell’elenco modelli di Anthropic [8]. Opus 5 è arrivato il 24 luglio allo stesso prezzo di 5 e 25 dollari, Anthropic ormai indirizza lì il lavoro nuovo, e Fable 5 sta sopra entrambi [9]. Avvicinarsi a Opus 4.8 nell’agosto 2026 significa avvicinarsi alla frontiera di maggio, e gli stessi soldi oggi comprano un Claude più forte.

A quale punteggio di Opus 4.8 credere?

Dipende da chi ha eseguito il benchmark, e la dispersione è abbastanza ampia da inghiottire l’intero confronto. L’harness di DeepSeek assegna a Opus 4.8 un punteggio di 85,0 su Terminal-Bench 2.1 [2]. La classifica pubblica di Terminal-Bench elenca Opus 4.8 in esecuzione dentro Claude Code al 78,9% [10]. La system card di Anthropic riporta il 74,6%, misurato a effort high sull’harness Terminus-2 [7].

Claude Opus 4.8 su Terminal-Bench 2.1, tre misurazioni L'harness di DeepSeek riporta 85,0, la classifica pubblica 78,9 e la system card di Anthropic 74,6 per lo stesso modello sullo stesso benchmark. DeepSeek Harness, effort max 85,0% Classifica Terminal-Bench, Claude Code 78,9% System card di Anthropic, Terminus-2, effort high 74,6%
Mostra i dati in tabella
Fonte Valore
DeepSeek Harness, effort max 85,0%
Classifica Terminal-Bench, Claude Code 78,9%
System card di Anthropic, Terminus-2, effort high 74,6%
Figura 2. Un modello, un benchmark, tre misurazioni. I punteggi di Claude Opus 4.8 su Terminal-Bench 2.1 secondo tre fonti diverse.

È una dispersione di 10,4 punti per un solo modello su un solo benchmark, e l’82,7 di V4 Flash ci cade dentro. A seconda del numero di Opus che ci metti accanto, il modello di DeepSeek è 2,3 punti dietro, 3,8 avanti o 8,1 avanti. Un confronto capace di produrre tutte e tre le conclusioni insieme non è davvero un confronto.

La dispersione non è indizio di imbroglio. Ogni fonte ha usato un allestimento diverso: un altro harness per l’agente, un altro livello di effort, altri limiti di tempo. La system card di Anthropic osserva perfino che Terminal-Bench penalizza gli endpoint lenti, perché i task corrono contro limiti fissi di orologio [7]. E nota che l’harness di DeepSeek ha dato a Opus 4.8 un punteggio più alto della misurazione della stessa Anthropic, quindi DeepSeek non ha sottostimato il concorrente. Semplicemente, i numeri escono da allestimenti che non si possono confrontare direttamente.

A chiudere la questione sarebbe un terzo che facesse girare entrambi i modelli su un unico harness. I numeri di DeepSeek vengono dal suo DeepSeek Harness, di cui non ho trovato alcuna versione pubblica, e al 3 agosto 2026 non ho individuato nessuna riproduzione indipendente di una sola delle nove righe. Finché non ne esiste una, la tabella di lancio è un’affermazione, non una misurazione.

Cosa mostrano i primi numeri indipendenti?

Per ora esiste una sola valutazione standardizzata di terze parti. Artificial Analysis ha misurato V4-Flash-0731 a 50 sul suo Intelligence Index il 31 luglio, dieci punti sopra la preview di aprile e un punto dietro GPT-5.6 Luna a effort max [11]. Nella stessa classifica, al 3 agosto, Gemini 3.6 Flash è anch’esso a 50, GLM-5.2 a 51, GPT-5.6 Terra a 55 e Kimi K3 a 57 [12]. La collocazione indipendente è quindi il vertice della fascia economica, non la frontiera, e siccome Opus 4.8 non compare in quell’indice, per il confronto con Opus non esiste alcun numero indipendente.

È sul lato dei costi che i dati indipendenti diventano interessanti. Far girare l’indice completo è costato ad Artificial Analysis 72,02 dollari con V4 Flash [13], contro 176,34 dollari con il V4 Pro di DeepSeek, più grande, che ha segnato sei punti in meno, 44 [14]. Il modello piccolo che batte il fratello grande era l’affermazione centrale del lancio di DeepSeek, e qui viene confermata su un harness indipendente: risultati migliori al 40 per cento del costo.

Il consumo di token merita una frase a parte, perché la tariffa bassa lo nasconde. V4 Flash ha avuto bisogno di circa 206 milioni di token in uscita per completare l’indice, il 12 per cento in meno della build di aprile [11], ma comunque più dei 180 milioni usati da V4 Pro [14]. Il modello è economico per token, non parsimonioso di token, quindi un budget stimato sui consumi di un altro modello risulterà troppo basso.

Altre due letture indipendenti completano il quadro. Su GDPval-AA v2, un confronto di compiti lavorativi valutato con voti di preferenza, la nuova build ha raggiunto un Elo di 1559, dai 1189 della preview di aprile [11], e il suo tasso di allucinazione nel test AA-Omniscience è migliorato di 12 punti fino all’84 per cento, che è un progresso da un punto di partenza pessimo, non un buon risultato [11]. Nella classifica WebDev di Arena, dove persone votano tra applicazioni web generate, V4 Flash a effort high teneva il settimo posto con un Elo di 1577 al 3 agosto, contro il 1705 di Opus 5 Max in testa [15]. E un numero manca del tutto: quando ho controllato non esisteva alcuna misurazione indipendente di velocità della build 0731, quindi tratta qualunque cifra di token al secondo in circolazione come appartenente a una build precedente [16].

Cosa comprano 0,28 dollari per milione di token in pratica?

Il prezzo di listino è solo l’inizio del modello di costo. L’ingresso in cache costa 0,0028 dollari per milione di token, un cinquantesimo della tariffa senza cache [3], e i flussi degli agenti rimandano a ogni turno un contesto quasi identico, quindi è la tariffa della cache a dominare la bolletta reale. Nella direzione opposta agisce la politica delle ore di punta annunciata: quando si attiverà, i prezzi raddoppieranno durante l’orario d’ufficio di Pechino [3]. I rivenditori complicano ulteriormente il quadro: al lancio OpenRouter elencava V4 Flash con uno sconto del 38 per cento, circa 0,09 dollari in ingresso e 0,17 in uscita [17]. Se hai visto citare 0,17 o 0,18 dollari come prezzo di uscita del modello, quella è la promozione del rivenditore, non il listino di DeepSeek.

Un avvertimento vale per tutti i prezzi per token tra fornitori in questo articolo. La documentazione dei prezzi di Anthropic indica che i modelli Claude dal 4.7 in poi usano un tokenizer che produce circa il 30 per cento di token in più per lo stesso testo [4], quindi i rapporti di prezzo per token tra fornitori sono approssimazioni. Un fattore 89 sull’uscita sopravvive con ampio margine a una correzione del 30 per cento.

I primi resoconti dal campo tornano con i conti. Su Hacker News un ingegnere ha pubblicato il suo pannello di controllo di 30 giorni: 4,55 dollari per 3.467 richieste API con 323 milioni di token, con il verdetto che il modello “non ha deluso per niente sui compiti di programmazione o di revisione. Per tutto il resto, usa un altro modello” [18]. Fa in media circa 0,014 dollari per milione di token, sotto ogni tariffa di listino tranne quella della cache, quindi la maggior parte di quel traffico deve essere stata ingresso in cache. Lo stesso utente descrive il metodo di lavoro che rende tutto questo sostenibile: il modello è debole in prosa, migliora molto con istruzioni precise e strumenti di autorevisione, e “devi comunque rivedere il 100% del codice come se cercasse di venderti un’assicurazione” [19].

Anche gli attriti segnalati coincidono. Un altro commentatore ha incontrato un limite stretto di token in uscita tramite OpenRouter, dove un modello che si perde in una lunga deviazione di ragionamento finisce lo spazio prima di concludere, e ha comunque concluso che “ha sostituito i modelli Kimi” per lui [20]. Il test dello stesso giorno di Simon Willison indica l’impostazione dietro quel comportamento: con l’effort di ragionamento predefinito il suo risultato era nettamente peggiore che con high [21]. La configurazione pratica che emerge da tre giorni di resoconti: eseguilo a effort high, tieni i compiti ben delimitati e lascia un modello più forte o un umano al posto di revisione.

Le clausole in piccolo dello sconto

L’avvertimento sui benchmark attraversa tutto quanto sopra: le nove righe della tabella di lancio sono misurate dal fornitore stesso su un harness non pubblicato, e due dei nove benchmark sono set di test interni di DeepSeek. È un motivo per aspettare valutazioni indipendenti degli agenti, non per scartare il modello.

Un avvertimento di altro tipo è misurato, non sospettato. CTGT, una società di ricerca che analizza il comportamento dei modelli, ha rilevato che V4 Flash risponde in modo più censurato di 45,45 punti alle domande sensibili sulla Cina rispetto a domande di controllo strutturalmente identiche, testando pesi self-hosted per escludere filtri del fornitore dell’API [22]. Lo stesso studio ha trovato che un modello distillato dalle uscite di V4 Flash non mostrava tracce significative di quel comportamento [22]. Se il tuo prodotto risponde a domande anche solo vicine a terreni politicamente sensibili, quella misurazione appartiene alla tua valutazione, ed è una proprietà dei pesi, non dell’hosting di DeepSeek.

Due limiti pratici chiudono l’elenco. Il modello riceve testo e produce testo, senza input di immagini [11], il che esclude i cicli di frontend guidati da screenshot su cui si appoggiano gli allestimenti di agenti multimodali. E l’API ufficiale è solo uno dei modi per eseguirlo: grazie ai pesi MIT [2], OpenRouter e altri fornitori occidentali servono già il modello [17], quindi l’endpoint di DeepSeek, la sua giurisdizione sui dati e le future tariffe delle ore di punta sono opzionali, non parte dell’accordo.

L’informazione davvero nuova del 31 luglio non è che V4 Flash batta Claude; la stessa tabella di DeepSeek dice il contrario. È il prezzo a cui il modello perde. Pagare circa l’uno per cento delle tariffe di Opus per un modello di questa classe cambia quali compiti vale la pena automatizzare, ancora prima che le dispute sui benchmark si risolvano. Il mio prossimo passo è puntarlo sul mio solito repository di prova con l’effort di ragionamento a high e un modello più forte al posto di revisione, e tornare al grafico del fornitore se un giorno un harness indipendente farà girare tutti questi modelli alle stesse condizioni.

Fonti

  1. Change logDeepSeek API Docs · 2026-07-31
  2. DeepSeek-V4-Flash-0731 model cardDeepSeek on Hugging Face · 2026-07-31
  3. Models & PricingDeepSeek API Docs
  4. PricingClaude Platform Docs
  5. DeepSeek-V4 model cardDeepSeek on Hugging Face
  6. DeepSeek releases beta version of V4 models as AI price war heats upNikkei Asia · 2026-07-31
  7. System Card: Claude Opus 4.8Anthropic · 2026-05-28
  8. Models overviewClaude Platform Docs
  9. Introducing Claude Opus 5Anthropic · 2026-07-24
  10. Terminal-Bench 2.1 leaderboardTerminal-Bench
  11. DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence IndexArtificial Analysis · 2026-07-31
  12. Models leaderboardArtificial Analysis
  13. DeepSeek V4 Flash 0731: intelligence, performance and priceArtificial Analysis
  14. DeepSeek V4 Pro: intelligence, performance and priceArtificial Analysis
  15. Arena leaderboardArena
  16. DeepSeek V4 Flash providersArtificial Analysis
  17. DeepSeek V4 FlashOpenRouter
  18. Comment with 30-day usage figures on the V4 Flash release threadHacker News · 2026-07-31
  19. Comment on working practices with V4 FlashHacker News · 2026-07-31
  20. Comment on output limitsHacker News · 2026-07-31
  21. deepseek-ai/DeepSeek-V4-Flash-0731Simon Willison · 2026-07-31
  22. Distillation censorship transferCTGT · 2026-07-29