DeepSeek V4.1 Flash: API barata, pesos abertos enormes
O DeepSeek V4.1 Flash ativa 8B parâmetros na entrada, mas os pesos são enormes. Explico preços da API, resultados de programação e requisitos de hardware.
Tema
Todos os artigos com a tag coding-agents, do mais recente para o mais antigo.
O DeepSeek V4.1 Flash ativa 8B parâmetros na entrada, mas os pesos são enormes. Explico preços da API, resultados de programação e requisitos de hardware.
Fable 5.1 supera o antecessor em tarefas longas de agentes, mas o Opus 5 mantém-se próximo e custa metade do preço base. Analisei benchmarks e relatos iniciais.
O Codex dá-me mais utilização, melhor frontend e uma aplicação mais simples. Mas o Claude conclui grandes funcionalidades multiagente muito mais depressa.
Após cinco semanas de uso diário, acho o Opus 5 muito melhor do que a reputação online sugere. Planos claros e tarefas menores revelam um excelente modelo.
Agents Window pode abrir primeiro no Cursor, mas Editor Window continua disponível. Reúno os comandos e a definição que voltam a pôr o código à sua frente.
O DeepSWE põe Luna Max 2,2 pontos atrás de Sol High por cerca de um sexto do custo. Explico porque podem funcionar de forma tão diferente num repositório.
Um sistema de gestão de contexto em quatro camadas orienta os meus agentes de programação para os factos atuais, mas manter o mapa certo ainda é difícil.
Comparei Sol, Terra, Opus 5 e Fable 5 em benchmarks de programação. O vencedor muda conforme a tarefa, o esforço, a configuração do agente e o orçamento.
O Kimi K3 empata com o GPT-5.6 medium, mas demora 4,6 vezes mais. O GLM-5.2 é barato por token e caro por tarefa. Verifiquei onde ambos vencem.