Kimi K3 es real, GLM-5.2 es una apuesta, ninguno es ganga
Kimi K3 empata con GPT-5.6 en el índice independiente de código y tarda 4,6 veces más. Los tokens de GLM-5.2 a 1,40 $ salen a 6,51 $ por tarea. El hype, medido.
Tema
Todos los artículos con la etiqueta benchmarks, del más reciente al más antiguo.
Kimi K3 empata con GPT-5.6 en el índice independiente de código y tarda 4,6 veces más. Los tokens de GLM-5.2 a 1,40 $ salen a 6,51 $ por tarea. El hype, medido.
Sol, Terra, Opus 5 y Fable 5 sobre el mismo agente: empate técnico arriba, la misma puntuación a un cuarto del coste y niveles de esfuerzo que restan.
Opus 5 iguala a Fable 5 en los benchmarks a mitad de precio por token, pero las quejas de la primera semana son reales. Dónde brilla y dónde necesita un jefe.