Muse Spark 1.3 ha superato GPT-6 per due giorni. Ecco perché
Muse Spark 1.3 ha segnato 62 su Artificial Analysis, sopra GPT-6 Astra, poi è finito nono. Ho ricostruito da dove veniva il punteggio e quanto costa.
benchmarks
I nuovi benchmark letti alla prova dei fatti: dove reggono e dove no.
Muse Spark 1.3 ha segnato 62 su Artificial Analysis, sopra GPT-6 Astra, poi è finito nono. Ho ricostruito da dove veniva il punteggio e quanto costa.
DeepSWE mette Luna Max 2,2 punti dietro Sol High a circa un sesto del costo per tentativo. Spiego perché nei repository i due modelli restano molto diversi.
Ho confrontato Sol, Terra, Opus 5 e Fable 5 nei benchmark di coding. Il vincitore cambia a seconda del task, dell'effort, dell'agente e del budget.
Kimi K3 pareggia GPT-5.6 medium, ma richiede 4,6 volte il tempo. GLM-5.2 costa poco per token e molto per task. Verifico dove entrambi hanno ancora senso.