DeepSeek compara o V4 Flash com o Opus 4.8 e perde as nove linhas
A tabela de lançamento do V4 Flash mostra o Claude Opus 4.8 à frente nos nove benchmarks. Verifico o que compram de facto 0,14 e 0,28 dólares por milhão.
A DeepSeek publicou a versão oficial do V4 Flash a 31 de julho de 2026 [1], e o gráfico de lançamento faz algo invulgar: compara o modelo com o Claude Opus 4.8 em nove benchmarks e perde todas as linhas [2]. O entusiasmo aparece na mesma, e vem do preço: 0,14 dólares por milhão de tokens de entrada e 0,28 por milhão de saída [3], contra os 5 e 25 dólares do Opus 4.8 [4].
O modelo tem três dias enquanto escrevo isto, por isso nada do que se segue é um veredicto de primeira mão. O que fiz foi rever o material de lançamento da DeepSeek, os números oficiais da Anthropic para o Opus 4.8, as tabelas públicas e as primeiras medições independentes, com duas perguntas em mente. O que vale “perto do Opus 4.8” depois de ler as notas de rodapé? E o que custa de facto um desconto de 97 a 99 por cento?
O que saiu exatamente a 31 de julho?
O DeepSeek-V4-Flash-0731 é a versão oficial de um modelo que estava em preview pública desde 24 de abril de 2026 [1]. A DeepSeek explica que a nova versão mantém a arquitetura e o tamanho da preview e apenas repetiu o pós-treino, ou seja, o modelo base não mudou e só as últimas fases de treino foram refeitas [1]. Por dentro, o V4 Flash é um modelo de mistura de especialistas com 284 mil milhões de parâmetros no total, dos quais 13 mil milhões ficam ativos por token, e aceita um contexto de um milhão de tokens [5].
Os pesos estão no Hugging Face sob licença MIT, pelo que o uso comercial e o alojamento próprio não têm restrições [2]. Do lado da API, a DeepSeek trocou a versão sem mudar o nome: o identificador continua a ser deepseek-v4-flash, e as integrações existentes passaram para a nova versão sem tocar na configuração [1]. Isso é cómodo para o utilizador e incómodo para quem cita resultados, porque “V4 Flash” designa agora duas versões diferentes consoante a data em que cada número foi medido. O modelo expõe um parâmetro de esforço de raciocínio com três níveis, low, high e max, em vez de lançar uma variante de raciocínio separada [2].
Depois há a lista de preços, a razão por que este lançamento fez barulho muito para lá do círculo de quem segue modelos. A Nikkei Asia enquadrou-o numa guerra de preços cada vez mais intensa nos modelos de IA, e relata que a DeepSeek planeia introduzir mais tarde tarifas de hora de ponta [6]. A página de preços da DeepSeek confirma esse plano: quando a política entrar em vigor, os preços duplicam nas horas de ponta, o que ainda não aconteceu [3]. O irmão maior, V4 Pro, continua em preview a 0,435 dólares de entrada e 0,87 de saída, com a versão oficial anunciada como próxima [1] [3].
- preço de entrada, sem cache
- 0,14 $/MTok
- Opus 4.8: 5 $
- preço de saída
- 0,28 $/MTok
- Opus 4.8: 25 $
- janela de contexto
- 1M
- saída máxima de 384K tokens
- parâmetros ativos
- 13B
- de 284B no total, licença MIT
Por milhão de tokens de saída, o Opus 4.8 custa 89 vezes mais do que o V4 Flash. Se essa proporção importa ou não depende inteiramente da capacidade que está do outro lado, que é justamente o que a tabela de lançamento devia estabelecer.
Está mesmo perto do Opus 4.8?
Não tão perto como sugerem os resumos em circulação. A model card no Hugging Face compara o V4-Flash-0731 com o Claude Opus 4.8 em nove benchmarks de agentes e programação, e o Opus 4.8 lidera todas as linhas [2]. Duas das distâncias são genuinamente pequenas: meio ponto no Agents’ Last Exam e 2,3 pontos no Terminal-Bench 2.1. Outras são largas: 15,5 pontos no NL2Repo e 12,1 no DSBench-Hard.
| Benchmark | V4 Flash 0731 | Opus 4.8 | GLM-5.2 |
|---|---|---|---|
| Terminal-Bench 2.1 | 82,7 | 85,0 (Melhor valor da linha) | 81,0 |
| NL2Repo | 54,2 | 69,7 (Melhor valor da linha) | 48,9 |
| Cybergym | 76,7 | 83,1 (Melhor valor da linha) | - |
| DeepSWE | 54,4 | 58,0 (Melhor valor da linha) | 46,2 |
| Toolathlon Verified | 70,3 | 76,2 (Melhor valor da linha) | 59,9 |
| Agents' Last Exam | 25,2 | 25,7 (Melhor valor da linha) | 23,8 |
| AutomationBench Public | 25,1 | 27,2 (Melhor valor da linha) | 12,9 |
| DSBench FullStack | 68,7 | 71,6 (Melhor valor da linha) | 61,8 |
| DSBench Hard | 59,6 | 71,7 (Melhor valor da linha) | 54,5 |
A tabela segue um padrão consistente: o V4 Flash fica perto do Opus 4.8 nos benchmarks de tarefas de terminal e claramente atrás sempre que o trabalho exige compreender ou fazer crescer um repositório. Frente ao GLM-5.2, o outro modelo chinês do gráfico, o V4 Flash vence as oito linhas que partilham.
Para ser justo com a DeepSeek, o enquadramento dela é mais modesto do que a cobertura. A afirmação central da card é que a nova versão supera a preview do V4 Pro, maior, ativando muito menos parâmetros [2], e imprimir uma comparação que se perde em todas as linhas é mais honesto do que a prática habitual dos lançamentos, que só mostra as vitórias.
O adversário escolhido tem, ainda assim, um problema discreto. O Opus 4.8 era o melhor modelo disponível da Anthropic quando saiu a 28 de maio de 2026 [7], mas dez semanas depois figura na secção de modelos legacy da lista da Anthropic [8]. O Opus 5 chegou a 24 de julho ao mesmo preço de 5 e 25 dólares, a Anthropic encaminha agora o trabalho novo para ele, e o Fable 5 está acima de ambos [9]. Aproximar-se do Opus 4.8 em agosto de 2026 é aproximar-se da fronteira de maio, e o mesmo dinheiro compra hoje um Claude mais forte.
Em que pontuação do Opus 4.8 se deve acreditar?
Depende de quem correu o benchmark, e a dispersão é larga o suficiente para engolir a comparação inteira. O harness da DeepSeek dá ao Opus 4.8 uma pontuação de 85,0 no Terminal-Bench 2.1 [2]. A tabela pública do Terminal-Bench lista o Opus 4.8 a correr no Claude Code com 78,9% [10]. E a system card da Anthropic reporta 74,6%, medidos com esforço high no harness Terminus-2 [7].
Ver os dados em tabela
| Fonte | Valor |
|---|---|
| DeepSeek Harness, esforço max | 85,0% |
| Tabela do Terminal-Bench, Claude Code | 78,9% |
| System card da Anthropic, Terminus-2, esforço high | 74,6% |
É uma dispersão de 10,4 pontos para um único modelo num único benchmark, e os 82,7 do V4 Flash caem lá dentro. Conforme o número do Opus que puser ao lado, o modelo da DeepSeek está 2,3 pontos atrás, 3,8 à frente ou 8,1 à frente. Uma comparação capaz de produzir as três conclusões ao mesmo tempo não é bem uma comparação.
A dispersão não é sinal de batota. Cada fonte usou uma montagem diferente: outro harness de agente, outro nível de esforço, outros limites de tempo. A system card da Anthropic até assinala que o Terminal-Bench penaliza endpoints lentos, porque as tarefas correm contra limites fixos de relógio [7]. Repare que o harness da DeepSeek deu ao Opus 4.8 um valor mais alto do que a medição da própria Anthropic, portanto a DeepSeek não rebaixou o concorrente. Os números vêm simplesmente de montagens que não se comparam diretamente.
O que resolveria a questão era um terceiro passar os dois modelos pelo mesmo harness. Os números da DeepSeek saem do seu próprio DeepSeek Harness, do qual não encontrei nenhuma versão publicada, e a 3 de agosto de 2026 não localizei nenhuma reprodução independente de uma única das nove linhas. Enquanto não existir uma, a tabela de lançamento é uma afirmação, não uma medição.
O que mostram os primeiros números independentes?
Por agora existe uma única avaliação padronizada de terceiros. A Artificial Analysis mediu o V4-Flash-0731 com 50 no seu Intelligence Index a 31 de julho, dez pontos acima da preview de abril e um ponto atrás do GPT-5.6 Luna com esforço max [11]. Na mesma tabela, a 3 de agosto, o Gemini 3.6 Flash também está nos 50, o GLM-5.2 nos 51, o GPT-5.6 Terra nos 55 e o Kimi K3 nos 57 [12]. A posição independente é, portanto, o topo da classe económica e não a fronteira, e como o Opus 4.8 não aparece nesse índice, não existe nenhum número independente para a comparação com o Opus.
O lado dos custos é onde os dados independentes ficam interessantes. Correr o índice completo custou 72,02 dólares à Artificial Analysis com o V4 Flash [13], contra 176,34 dólares com o V4 Pro da própria DeepSeek, que pontuou seis pontos menos, 44 [14]. O modelo pequeno a bater o irmão grande era a afirmação central do lançamento da DeepSeek, e aqui fica confirmada num harness independente: melhores resultados a 40 por cento do custo.
O consumo de tokens merece a sua própria frase, porque a tarifa barata esconde-o. O V4 Flash precisou de cerca de 206 milhões de tokens de saída para completar o índice, menos 12 por cento do que a versão de abril [11], mas ainda mais do que os 180 milhões que o V4 Pro usou [14]. O modelo é barato por token, não poupado em tokens, por isso um orçamento baseado nos consumos de outro modelo vai ficar curto.
Duas leituras independentes adicionais completam o quadro. No GDPval-AA v2, uma comparação de tarefas de trabalho pontuada por votos de preferência, a nova versão chegou a um Elo de 1559, vindo dos 1189 da preview de abril [11], e a taxa de alucinação no teste AA-Omniscience melhorou 12 pontos para 84 por cento, o que é um progresso a partir de um mau ponto de partida e não um bom resultado [11]. Na tabela WebDev da Arena, onde pessoas votam entre aplicações web geradas, o V4 Flash com esforço high segurava o sétimo lugar com um Elo de 1577 a 3 de agosto, contra 1705 do Opus 5 Max no topo [15]. E um número falta pura e simplesmente: quando verifiquei, não existia nenhuma medição independente de velocidade da versão 0731, por isso trate qualquer valor de tokens por segundo em circulação como pertencendo a uma versão anterior [16].
O que compram 0,28 dólares por milhão de tokens na prática?
O preço de tabela é só o início do modelo de custos. A entrada em cache custa 0,0028 dólares por milhão de tokens, um cinquenta avos da tarifa sem cache [3], e os fluxos de agentes reenviam em cada turno um contexto quase igual, pelo que a tarifa de cache domina a fatura real. No sentido contrário atua a política de horas de ponta anunciada: quando ativar, os preços duplicam durante o horário de expediente de Pequim [3]. Os revendedores complicam ainda mais o quadro: no lançamento, a OpenRouter listava o V4 Flash com 38 por cento de desconto, cerca de 0,09 dólares de entrada e 0,17 de saída [17]. Se viu 0,17 ou 0,18 dólares citados como o preço de saída do modelo, isso é a promoção do revendedor, não a tabela da DeepSeek.
Uma ressalva aplica-se a todos os preços por token entre fornecedores neste artigo. A documentação de preços da Anthropic indica que os modelos Claude a partir do 4.7 usam um tokenizador que produz cerca de 30 por cento mais tokens para o mesmo texto [4], pelo que os rácios de preço por token entre fornecedores são aproximações. Um fator de 89 na saída sobrevive com folga a uma correção de 30 por cento.
Os primeiros relatos reais batem certo com as contas. No Hacker News, um engenheiro publicou o seu painel de 30 dias: 4,55 dólares por 3.467 pedidos à API com 323 milhões de tokens, com o veredicto de que o modelo “não desiludiu nada em tarefas de programação ou de revisão. Para tudo o resto, use outro modelo” [18]. Isso dá em média cerca de 0,014 dólares por milhão de tokens, abaixo de todas as tarifas de tabela exceto a de cache, pelo que a maior parte desse tráfego terá sido entrada em cache. O mesmo utilizador descreve o método de trabalho que torna isto sustentável: o modelo é fraco em prosa, melhora bastante com instruções precisas e ferramentas de autorrevisão, e “mesmo assim tem de rever 100% do código como se ele estivesse a tentar vender-lhe um seguro” [19].
Os relatos de fricção também coincidem. Outro comentador esbarrou num limite apertado de tokens de saída através da OpenRouter, onde um modelo que se perde num longo desvio de raciocínio fica sem espaço antes de terminar, e mesmo assim concluiu que “substituiu os modelos Kimi” para ele [20]. O teste do próprio dia de Simon Willison aponta para a definição por trás desse comportamento: com o esforço de raciocínio por omissão, o resultado dele foi claramente pior do que com high [21]. A configuração prática que emerge de três dias de relatos: corra-o com esforço high, mantenha as tarefas bem delimitadas e deixe um modelo mais forte ou um humano no lugar de revisão.
As letras pequenas do desconto
A ressalva sobre benchmarks atravessa tudo o que está acima: as nove linhas da tabela de lançamento foram medidas pelo próprio fornecedor num harness não publicado, e dois dos nove benchmarks são conjuntos internos da DeepSeek. Isso é motivo para esperar por avaliações de agentes independentes, não para descartar o modelo.
Há outra ressalva que está medida, não suspeitada. A CTGT, uma firma de investigação que testa o comportamento de modelos, verificou que o V4 Flash responde de forma 45,45 pontos mais censurada a perguntas sensíveis sobre a China do que a perguntas de controlo estruturalmente idênticas, testando pesos alojados pela própria firma para excluir filtros do fornecedor da API [22]. O mesmo estudo verificou que um modelo destilado a partir de saídas do V4 Flash não mostrava vestígios significativos desse comportamento [22]. Se o seu produto responde a perguntas perto de terreno politicamente sensível, essa medição pertence à sua avaliação, e é uma propriedade dos pesos, não do alojamento da DeepSeek.
Dois limites práticos fecham a lista. O modelo recebe texto e produz texto, sem entrada de imagens [11], o que exclui os ciclos de frontend guiados por capturas de ecrã em que os arranjos de agentes multimodais se apoiam. E a API oficial é apenas uma das formas de o correr: graças aos pesos MIT [2], a OpenRouter e outros fornecedores ocidentais já servem o modelo [17], pelo que o endpoint da DeepSeek, a sua jurisdição de dados e as futuras tarifas de hora de ponta são opcionais e não parte do negócio.
A informação de facto nova de 31 de julho não é que o V4 Flash bata o Claude; a própria tabela da DeepSeek diz que não bate. É o preço a que o modelo perde. Pagar cerca de um por cento das tarifas do Opus por um modelo desta classe muda que tarefas vale a pena automatizar, ainda antes de as disputas sobre benchmarks ficarem resolvidas. O meu próximo passo é apontá-lo ao meu repositório de testes habitual com o esforço de raciocínio em high e um modelo mais forte no lugar de revisão, e voltar ao gráfico do fornecedor se um dia um harness independente correr todos estes modelos nas mesmas condições.
Fontes
- Change log
- DeepSeek-V4-Flash-0731 model card
- Models & Pricing
- Pricing
- DeepSeek-V4 model card
- DeepSeek releases beta version of V4 models as AI price war heats up
- System Card: Claude Opus 4.8
- Models overview
- Introducing Claude Opus 5
- Terminal-Bench 2.1 leaderboard
- DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index
- Models leaderboard
- DeepSeek V4 Flash 0731: intelligence, performance and price
- DeepSeek V4 Pro: intelligence, performance and price
- Arena leaderboard
- DeepSeek V4 Flash providers
- DeepSeek V4 Flash
- Comment with 30-day usage figures on the V4 Flash release thread
- Comment on working practices with V4 Flash
- Comment on output limits
- deepseek-ai/DeepSeek-V4-Flash-0731
- Distillation censorship transfer