O Muse Spark 1.3 esteve acima do GPT-6 dois dias. Eis porquê
O Muse Spark 1.3 marcou 62 na Artificial Analysis, à frente do GPT-6 Astra, e caiu para nono numa reavaliação. Segui o rasto da pontuação e do preço.
benchmarks
Novos benchmarks lidos à luz da experiência prática: onde se aguentam e onde falham.
O Muse Spark 1.3 marcou 62 na Artificial Analysis, à frente do GPT-6 Astra, e caiu para nono numa reavaliação. Segui o rasto da pontuação e do preço.
O DeepSWE põe Luna Max 2,2 pontos atrás de Sol High por cerca de um sexto do custo. Explico porque podem funcionar de forma tão diferente num repositório.
Comparei Sol, Terra, Opus 5 e Fable 5 em benchmarks de programação. O vencedor muda conforme a tarefa, o esforço, a configuração do agente e o orçamento.
O Kimi K3 empata com o GPT-5.6 medium, mas demora 4,6 vezes mais. O GLM-5.2 é barato por token e caro por tarefa. Verifiquei onde ambos vencem.