Opus 5.5 programa melhor. O custo por tarefa varia
Opus 5.5 melhora nos testes independentes e reduz os preços dos tokens. Comparo custos por tarefa, níveis de raciocínio e os primeiros relatos no Reddit.

O Claude Opus 5.5 foi lançado a 22 de setembro de 2026 com tokens mais baratos e uma melhoria clara nos testes independentes de programação. Vale a pena experimentá-lo, mas o custo por tarefa concluída exige atenção: as poupanças da Anthropic e as medições da Artificial Analysis com esforço máximo usam tarefas e definições diferentes. Eu começaria pelo nível médio. [1] [2] [3]
Quanto melhora o Opus 5.5 na programação?
O teste independente mostra um avanço significativo face ao Opus 5: a Artificial Analysis regista uma subida de 10,6 pontos percentuais no Terminal-Bench 4.0. O teste atribui tarefas práticas de terminal a um agente, aproximando-se mais do trabalho num repositório do que uma pergunta curta de programação. [2]
Ver os dados em tabela
| Teste | Opus 5.5 | Opus 5 |
|---|---|---|
| Terminal-Bench 4.0 | 59,6% | 49,0% |
A Artificial Analysis executa as 66 tarefas com mini-swe-agent e calcula a média do sucesso numa única tentativa ao longo de três repetições. Manter o mesmo software do agente torna a comparação útil. Ainda assim, mede aquela configuração específica, não todas as formas de usar o Claude Code. [2]
Os resultados do CursorBench publicados pela Anthropic apontam na mesma direção: 57,8% com esforço máximo, contra 46,6% do Opus 5. Mesmo os 52,5% do Opus 5.5 com esforço médio superam o máximo anterior. Segundo a ficha do sistema da Anthropic, a Cursor realizou a avaliação com o seu próprio software de agente. É mais um elemento de comparação, mas usa uma configuração diferente da Artificial Analysis. [10]
O resultado no nível médio interessa-me mais do que outra vitória no máximo. Na minha análise do Opus 5 como programador executor, o problema era a supervisão que um bom código ainda podia exigir. Um resultado melhor com menos raciocínio seria útil; obtê-lo após uma execução muito mais longa representa um compromisso diferente.
O Opus 5.5 fica realmente mais barato por tarefa?
O Opus 5.5 custa menos por token de entrada e saída, mas a fatura depende da quantidade de trabalho que faz. A Claude Platform Docs indica 4 dólares por milhão de tokens de entrada e 20 por milhão de saída, face aos 5 e 25 dólares do Opus 5. A Anthropic anuncia um custo típico por tarefa cerca de 40% inferior, porque o novo modelo também usa menos tokens nas suas avaliações. [5] [1]
A Artificial Analysis oferece um contraponto útil. O seu Intelligence Index atual sobe de 51 para 58, enquanto o custo medido por tarefa do índice aumenta ligeiramente de 5,86 para 5,98 dólares com esforço máximo. São tarefas da sua bateria de avaliação, não uma previsão da sua fatura média de programação. [3] [4]
Artificial Analysis, esforço máximo, consulta de 22 de setembro de 2026. Os pontos do índice não são percentagens. [3][4]
| Medição independente | Opus 5 | Opus 5.5 |
|---|---|---|
| AA Intelligence Index v4.3.2 | 51 | 58 (Melhor valor da linha) |
| Custo por tarefa do índice, USD | 5,86 | 5,98 |
Nesta configuração, obtém-se mais capacidade medida por praticamente o mesmo valor. Isso não contradiz as poupanças da Anthropic noutros trabalhos, mas eu não colocaria uma redução universal de 40% num orçamento. A versão do índice também conta: ambos os resultados são da v4.3.2. Um resultado antigo do Opus 5 calculado com outra versão não pode ser comparado diretamente com 58.
O guia de prompting da Anthropic explica por que motivo convém rever o esforço. Com uma definição do mesmo nome, o Opus 5.5 pode raciocinar mais por turno do que o Opus 5, sobretudo em xhigh e max. O guia recomenda voltar a testar os níveis em vez de manter a escolha anterior. Refere ainda que o nível médio pode igualar ou superar o Opus 5 no nível alto em programação e trabalho intelectual. [6]
Na prática, pagaria pelo raciocínio de que a tarefa precisa. Usar sempre o máximo impediria perceber se o novo modelo consegue concluir o mesmo trabalho com menos esforço.
O que diz o Reddit sobre usar o Opus 5.5?
Os relatos mais úteis do dia de lançamento referem respostas mais curtas e uma interação mais simples, com opiniões divididas sobre os erros de programação. São contribuições espontâneas de 22 de setembro, não uma taxa de falhas medida. Não realizei uma comparação prática controlada para este artigo.
No r/ClaudeCode, um utilizador publicou respostas de várias gerações do Opus ao mesmo prompt e considerou as do 5.5 mais legíveis do que as do 5. É um exemplo limitado, mas dá ao leitor algo concreto para examinar em vez de uma mera impressão de maior inteligência. [7]
Outro tópico no r/ClaudeAI elogia a velocidade e a deteção de problemas de interface. Nos comentários surge também um relato de alterações repetidas sem saída. Um terceiro tópico reúne experiências de respostas mais rápidas e uma queixa sobre implementações incompletas e instruções do projeto ignoradas. [8] [9]
Vejo nisso uma razão para testar a comunicação e o cumprimento de instruções separadamente da qualidade do código. Um modelo pode produzir uma alteração melhor e tornar a sessão cansativa na mesma. É também por isso que a minha avaliação do fluxo de trabalho com o Opus 5 dedica tanto espaço ao âmbito da tarefa e às instruções existentes.
O que devem os programadores verificar antes da mudança?
Uma migração da API exige um pouco mais do que substituir o nome do modelo. O Opus 5.5 usa claude-opus-5-5, começa no nível médio e mantém sempre ativo o raciocínio adaptativo. A documentação também descreve alterações nas chamadas de ferramentas, incluindo erros quando a utilização é forçada. As integrações de agentes existentes devem consultar estas notas antes da migração. [5]
Para a utilização normal do Claude Code, começaria com um erro existente e um teste de aceitação conhecido. Depois registaria se o nível médio produz uma alteração aceitável. Contaria também as correções: repetir a mesma instrução tem um custo, mesmo quando esse tempo não aparece na fatura da API.
A alternativa também mudou nesse dia. As reduções de preço e os benchmarks do GPT-6 Sol e Luna apresentam outro argumento para o trabalho diário, com aumentos menores no índice de inteligência e tokens muito mais baratos. Compararia os modelos numa tarefa que conheça suficientemente bem para rever o resultado e escolheria aquele que chega a uma entrega aceitável com menos intervenções.
Fontes
- Introducing Claude Opus 5.5
- Terminal-Bench 4.0
- Claude Opus 5.5 model analysis
- Claude Opus 5 model analysis
- Claude Opus 5.5 overview
- Prompting Claude Opus 5.5
- Proof that Opus 5.5 is easier to talk to/deal with
- Opus 5.5 in Claude Code is crazy fast especially
- Opus 5.5 in the release notes
- Claude Opus 5.5 System Card





