Muse Spark 1.3 superó a GPT-6 durante dos días. Por qué
Muse Spark 1.3 sacó 62 en Artificial Analysis, por encima de GPT-6 Astra, y cayó al noveno puesto al recalcular el índice. Revisé de dónde salía y qué cuesta.
benchmarks
Nuevos benchmarks leídos desde la experiencia práctica: dónde se sostienen y dónde no.
Muse Spark 1.3 sacó 62 en Artificial Analysis, por encima de GPT-6 Astra, y cayó al noveno puesto al recalcular el índice. Revisé de dónde salía y qué cuesta.
DeepSWE sitúa a Luna Max 2,2 puntos por detrás de Sol High con casi una sexta parte del coste. Explico por qué se sienten distintos en un repositorio.
Comparé Sol, Terra, Opus 5 y Fable 5 en benchmarks de código. El ganador cambia según la tarea, el nivel de esfuerzo, el agente y el presupuesto.
Kimi K3 iguala a GPT-5.6 medium, pero tarda 4,6 veces más. GLM-5.2 es barato por token y caro por tarea. Compruebo en qué sigue destacando cada uno.