Muse Spark 1.3 lag zwei Tage vor GPT-6. Das steckt dahinter
Muse Spark 1.3 erreichte bei Artificial Analysis 62 Punkte, mehr als GPT-6 Astra, und fiel nach der Neuwertung auf Platz neun. Ich zeige, woher die Zahl kam.
benchmarks
Neue Benchmark-Zahlen im Abgleich mit der Praxis: wo sie halten und wo nicht.
Muse Spark 1.3 erreichte bei Artificial Analysis 62 Punkte, mehr als GPT-6 Astra, und fiel nach der Neuwertung auf Platz neun. Ich zeige, woher die Zahl kam.
Bei DeepSWE liegt Luna Max 2,2 Punkte hinter Sol High, doch Luna braucht fast dreimal so viele Schritte. Ich zeige, warum das in Repositorys zählt.
Ich vergleiche Sol, Terra, Opus 5 und Fable 5 in Coding-Benchmarks. Je nach Aufgabe, Effort, Agenten-Setup und Budget gewinnt ein anderes Modell.
Kimi K3 erreicht GPT-5.6 medium, braucht aber 4,6-mal so lange. GLM-5.2 ist pro Token billig, doch pro Aufgabe teuer. Ich prüfe, wo beide gewinnen.