GPT-6 Astra custa 2,5x o Sol por token. Fala como uma pessoa
O GPT-6 Astra da OpenAI consome créditos a 2,5 vezes a tarifa do Sol e conversa de forma mais humana. Analisei os limites, os benchmarks e os relatos iniciais.
Tema
Todos os artigos com a tag benchmarks, do mais recente para o mais antigo.
O GPT-6 Astra da OpenAI consome créditos a 2,5 vezes a tarifa do Sol e conversa de forma mais humana. Analisei os limites, os benchmarks e os relatos iniciais.
O Muse Spark 1.3 marcou 62 na Artificial Analysis, à frente do GPT-6 Astra, e caiu para nono numa reavaliação. Segui o rasto da pontuação e do preço.
Fable 5.1 supera o antecessor em tarefas longas de agentes, mas o Opus 5 mantém-se próximo e custa metade do preço base. Analisei benchmarks e relatos iniciais.
O V4 Flash custa 0,14 dólares à entrada e 0,28 à saída por milhão de tokens. Verifiquei se o desconto de 97 a 99% compensa perder os benchmarks.
O DeepSWE põe Luna Max 2,2 pontos atrás de Sol High por cerca de um sexto do custo. Explico porque podem funcionar de forma tão diferente num repositório.
Comparei Sol, Terra, Opus 5 e Fable 5 em benchmarks de programação. O vencedor muda conforme a tarefa, o esforço, a configuração do agente e o orçamento.
O Kimi K3 empata com o GPT-5.6 medium, mas demora 4,6 vezes mais. O GLM-5.2 é barato por token e caro por tarefa. Verifiquei onde ambos vencem.
O Opus 5 iguala o Fable 5 nos benchmarks por metade do preço por token, mas é difícil de supervisionar. Explico quando cada modelo compensa.