
Ähnliche KI-Benchmark-Werte verbergen große Unterschiede
Bei DeepSWE liegt Luna Max 2,2 Punkte hinter Sol High, doch Luna braucht fast dreimal so viele Schritte. Ich zeige, warum das in Repositorys zählt.
Seite 3 von 3

Bei DeepSWE liegt Luna Max 2,2 Punkte hinter Sol High, doch Luna braucht fast dreimal so viele Schritte. Ich zeige, warum das in Repositorys zählt.

Ich führe Coding-Agents mit vier Ebenen zu aktuellen Fakten im Repo. Das spart Kontext, doch veraltete Dokumentation bleibt das eigentliche Problem.

Ich vergleiche Sol, Terra, Opus 5 und Fable 5 in Coding-Benchmarks. Je nach Aufgabe, Effort, Agenten-Setup und Budget gewinnt ein anderes Modell.

Kimi K3 erreicht GPT-5.6 medium, braucht aber 4,6-mal so lange. GLM-5.2 ist pro Token billig, doch pro Aufgabe teuer. Ich prüfe, wo beide gewinnen.

Appwrite und InsForge kamen am nächsten. Doch ein TypeScript-Backend macht Convex für meine KI-Agenten weiter einfacher. EU-Hosting ist der teure Haken.

GPT-5.6 Sol fand in meinem Audit fast sechsmal so viele mögliche Probleme wie Fable 5. Die meisten fielen bei der Triage durch. Heute setze ich Sol anders ein.

Opus 5 erreicht Fable 5 in Benchmarks zum halben Tokenpreis, ist aber mühsam zu führen. Ich zeige, warum Fable trotzdem seinen Platz verdient.