Muse Spark 1.3 a devancé GPT-6 deux jours. Voici pourquoi
Muse Spark 1.3 a obtenu 62 sur Artificial Analysis, devant GPT-6 Astra, puis il est tombé neuvième après un recalcul. J’ai cherché d’où venait ce score.
benchmarks
Les nouveaux benchmarks confrontés à la pratique : là où ils tiennent, et là où ils craquent.
Muse Spark 1.3 a obtenu 62 sur Artificial Analysis, devant GPT-6 Astra, puis il est tombé neuvième après un recalcul. J’ai cherché d’où venait ce score.
DeepSWE place Luna Max à 2,2 points de Sol High pour près d’un sixième du coût. J’explique pourquoi leur façon de travailler reste très différente.
J'ai comparé Sol, Terra, Opus 5 et Fable 5 sur des benchmarks de code. Le gagnant change selon la tâche, le niveau d'effort, l'agent et le budget.
Kimi K3 égale GPT-5.6 medium, mais prend 4,6 fois plus de temps. GLM-5.2 coûte peu par token, mais cher par tâche. J’ai vérifié où chacun excelle.