Benchmarks

Muse Spark 1.3 superó a GPT-6 durante dos días. Por qué

Muse Spark 1.3 sacó 62 en Artificial Analysis, por encima de GPT-6 Astra, y cayó al noveno puesto al recalcular el índice. Revisé de dónde salía y qué cuesta.

En esta página
  1. Qué pasó entre el 2 y el 4 de septiembre de 2026
  2. Qué lanzó Meta y qué afirmó
  3. ¿Por qué el índice puso a Muse Spark junto a Fable y Astra? Cuatro efectos
  4. Qué cambió en la versión 4.2 y qué no cambió
  5. La cifra que sobrevivió: precio y velocidad
  6. Qué dicen los desarrolladores que ya lo han usado
  7. Dónde lo usaría yo

Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026, y Artificial Analysis puntuó su ajuste más alto con un 62 en el Intelligence Index: tercero por detrás de Claude Fable 5.1 y Opus 5, y un punto por encima del GPT-6 Astra que OpenAI presentó al día siguiente. [1] [4] El 4 de septiembre el índice pasó a la versión 4.2 y Muse Spark bajó a 53 y al noveno puesto. [2] [3] La puntuación era real y la caída también. Hay cuatro cosas que explican las dos, y ninguna consiste en hacer trampas.

Qué pasó entre el 2 y el 4 de septiembre de 2026

Muse Spark 1.3 se mantuvo unas 48 horas entre los tres primeros del índice independiente más citado, y entonces cambió el índice. La secuencia importa más que cualquier cifra suelta, así que la pongo en orden.

  1. Muse Spark 1.0

    Primer modelo de Meta Superintelligence Labs, con pesos cerrados.

  2. Muse Spark 1.2 y Muse Code

    El agente de programación de la propia Meta se lanza junto al modelo.

  3. Muse Spark 1.3

    Artificial Analysis puntúa el ajuste max con un 62, tercero entre todos los modelos.

  4. GPT-6 Astra

    El modelo insignia de OpenAI entra en el mismo índice con 61.

  5. Índice v4.2

    Recálculo: Muse Spark 1.3 queda en 53 y noveno. El ajuste max se abre al público ese mismo día.

Figura 1. Los lanzamientos de Muse Spark y los dos días que generaron la confusión.

La figura 1 explica por qué tanta gente vio cifras contradictorias en la misma semana. El 2 de septiembre, Artificial Analysis escribió que Muse Spark 1.3 con max “obtiene 62 en el Artificial Analysis Intelligence Index, solo por detrás de Claude Fable 5.1 y Claude Opus 5”, y situó en 61 el ajuste xhigh que estaba disponible para todo el mundo. [1] Cuando GPT-6 Astra llegó el 3 de septiembre, ese mismo índice le dio 61, y en cuestión de horas circulaban capturas con Meta por encima de OpenAI. [4] El 4 de septiembre Artificial Analysis publicó la versión 4.2 del índice, y ahí Muse Spark 1.3 con max saca 53 y queda noveno de 202 modelos, mientras que Fable 5.1 obtiene 57, Astra 55, Opus 5 54 y GPT-5.6 Sol 51. [2] [3] Los dos conjuntos de cifras son correctos para la versión a la que pertenecen, y citar uno sin decir la versión es justo lo que encendió la discusión.

Qué lanzó Meta y qué afirmó

Muse Spark 1.3 es un modelo de pesos cerrados de Meta Superintelligence Labs, que se vende a través de la API de la propia Meta y de su agente Muse Code a 1,25 $ por millón de tokens de entrada y 4,25 $ por millón de tokens de salida, con un nivel colaborador (contributor tier) a 0,10 $ y 0,20 $ para quien deje que Meta entrene con sus prompts. [5] [7] Meta afirmó que ofrecía rendimiento de frontera por una fracción del precio. Su propia tabla comparativa respalda una parte de eso y contradice el resto sin decirlo.

El contexto importa para entender cómo se leyeron esas cifras. Meta presentó Muse Spark en abril de 2026 como el primer modelo de una serie nueva de Meta Superintelligence Labs, el laboratorio que formó a mediados de 2025 alrededor de Alexandr Wang después de que la generación Llama 4 decepcionara. [8] [27] Llama no se ha descontinuado formalmente, pero no hay forma de migrar de un modelo al otro, porque Muse Spark es propietario y solo lo sirve Meta. [9] Mark Zuckerberg ha prometido pesos abiertos para Muse Spark 1.2, y en agosto Meta publicó con licencia abierta un modelo aparte de 30.000 millones de parámetros, Muse Glimmer, pero a 5 de septiembre no hay pesos públicos de ninguna versión de Muse Spark. [10] [11]

Las afirmaciones del lanzamiento fueron grandes. Zuckerberg dijo que Muse Spark 1.3 “sale hoy con rendimiento de frontera casi demasiado barato como para medirlo”, y la tabla de Meta lo compara con GPT-5.6 Sol y Claude Opus 5, los dos en su ajuste máximo de razonamiento. [6] [11] En esa tabla Muse Spark gana en DeepSWE con un 75,4 % frente al 73,0 % de Sol y el 74,0 % de Opus, empata con Sol en Terminal-Bench 2.1 con un 88,8 % y saca un 98,1 % en una prueba de recuperación en contexto largo de entre 512K y 1M de tokens donde Sol se queda en el 73,8 %. Opus 5 gana casi todas las filas de agentes, incluidas GDPval-AA con 1824 Elo frente a 1754, el uso del ordenador de OSWorld y AutomationBench. [6] Así que las propias cifras de Meta describen un modelo que va por delante en programación y contexto largo y por detrás de Anthropic en trabajo de agente, que es una afirmación bastante más estrecha que la del anuncio.

Hay dos decisiones de la metodología de Meta que merecen mención, porque afectan a todas las filas. Meta mide su modelo actual con max, pero la versión anterior, Muse Spark 1.2, con xhigh, así que parte de la mejora entre versiones es un cambio de ajustes. Y para los competidores usa “el valor más alto disponible de la métrica principal que sea comparable”, ya venga de sus propias ejecuciones, de la clasificación oficial o de la cifra que declara el fabricante, lo que salga mejor. [12] La tabla tampoco compara con ningún modelo posterior a finales de julio: no aparecen ni Claude Fable 5.1, publicado el 1 de septiembre, ni GPT-6 Astra. [6]

¿Por qué el índice puso a Muse Spark junto a Fable y Astra? Cuatro efectos

El 62 salió de una evaluación real, hecha por un tercero, sobre un modelo que es genuinamente bueno en algunas cosas. También salió de una versión concreta del índice, de un ajuste de esfuerzo concreto, de un harness concreto y de un conjunto de comparaciones que eligió Meta. Cada una de esas cuatro cosas empujó la cifra hacia arriba, y todas están documentadas.

Medida Muse Spark 1.3Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Intelligence Index v4.1.1, 2 sep 62 66 (El mejor valor de la fila) 63 61 61
Intelligence Index v4.2, 5 sep 53 57 (El mejor valor de la fila) 54 55 51
Coste por tarea del índice, $ 0,95 (El mejor valor de la fila) 6,12 4,21 2,57 1,25
Tiempo hasta el primer token, s 18,7 (El mejor valor de la fila) 266,5 91,2 463,7 163,0
Velocidad de salida, tokens/s 190,1 (El mejor valor de la fila) 68,7 59,1 87,5 85,4
Figura 2. Los mismos cinco modelos en las dos versiones del índice, con las cifras de coste y velocidad que no cambiaron. Artificial Analysis, del 2 al 5 de septiembre de 2026.

La figura 2 resume el resto de esta sección. Las dos filas del índice muestran la caída, y las tres de debajo muestran lo que se mantuvo pese a ella. Los cinco modelos están en su ajuste máximo de esfuerzo, y la columna de Muse Spark corresponde a la variante max. [1] [3] [4]

El índice premia las tareas de agente, y ahí es justo donde Meta mejoró. Artificial Analysis construye el Intelligence Index con cuatro categorías: agentes con un 30 %, razonamiento general con otro 30 %, y programación y ciencia con un 20 % cada una. Lo dice sin rodeos: “la ponderación da más peso a las tareas de agente”. [13] La ganancia de Muse Spark 1.3 sobre la 1.2 está casi toda en esa porción de agentes, porque su resultado en un benchmark de atención al cliente bancaria pasó del 35 % al 52 %, lo que lo dejó primero entre todos los modelos, y su valoración en la prueba de trabajo profesional GDPval subió unos 139 Elo. Mientras tanto perdió cuatro puntos en razonamiento con contexto largo y entre uno y tres en la prueba de conocimientos. [1] Artificial Analysis explica además cómo consigue el ajuste max esos puntos de más: “usando más turnos y más tokens de razonamiento en total, con un 62 % más de razonamiento en GDPval-AA v2 y un 28 % más en Tau3-Bench Banking” que xhigh. [1] Un índice compuesto puede subir gracias a dos filas mientras bajan las que de verdad le importan a un desarrollador.

El 62 se midió en un ajuste que nadie podía comprar. La variante max estaba en preview limitada para los socios de Meta el día del lanzamiento, y VentureBeat contó que Meta decía estar “todavía completando pruebas de seguridad adicionales” y que llegaría en breve. Se abrió al público el 4 de septiembre. [11] El ajuste que los desarrolladores sí podían llamar, xhigh, sacó 61 en el índice antiguo y 52 en el nuevo. [1] [3] Nada de esto es raro, porque Anthropic y OpenAI también publican su mejor cifra con cualquier nivel de esfuerzo, pero significa que “Muse Spark supera a Astra” describía una comparación entre una build en preview y un producto ya en producción.

Las puntuaciones de programación salen del harness de la propia Meta. Artificial Analysis ejecuta las pruebas de agentes de programación dentro del agente de cada fabricante cuando existe, así que Muse Spark corre dentro de Muse Code, y Meta dice que el modelo se entrenó con sus propios harnesses. [5] [18] Vals AI, en cambio, ejecuta todos los modelos sobre el mismo harness de Terminal-Bench 2.1, y ahí Muse Spark 1.3 saca un 72,28 % y queda decimosexto de 62, mientras que Astra, Sol, Fable 5.1 y Opus 5 se sitúan todos entre el 85 % y el 87 %. [14] La tabla de Meta declara un 88,8 % en ese mismo benchmark. [6] La diferencia es un efecto del harness, y Cline lo demostró en agosto: el equipo copió las instrucciones del system prompt de Muse Code a su propio agente y ejecutó el mismo modelo Muse Spark 1.2 sobre la misma tarea. Los tokens bajaron de 19,7 millones a 7,2 millones, la ejecución terminó en 24 minutos en lugar de 49, y el coste cayó de 7,69 $ a 3,25 $ sin cambiar nada más que el prompting. [15]

Las comparaciones de Meta estaban elegidas para favorecerla. El desajuste entre max y xhigh y la regla del mejor valor disponible ya están descritos arriba. Hay una fila que muestra qué efecto tienen en la práctica. La tabla de Meta da a Muse Spark un 59,4 en el benchmark de preguntas sobre bases de código de Scale, por delante del 52,7 de Opus 5 y del 53,5 de Sol. La clasificación de la propia Scale, medida con otra métrica, pone a Opus 5 en 63,17 y a Sol en 46,00, y no incluye a Muse Spark 1.3 en absoluto. [6] [16] Nadie falsificó nada, pero la tabla compara la ejecución propia de Meta con cifras sacadas de los documentos de otros fabricantes, y presenta el resultado como una victoria.

Qué cambió en la versión 4.2 y qué no cambió

El recálculo del 4 de septiembre duplicó el peso de los conjuntos de prueba privados hasta el 40 % “para evitar que se manipule”, eliminó GPQA Diamond porque “ya está saturado” y añadió dos evaluaciones nuevas. [2] Muse Spark 1.3 había sacado un 94 % en GPQA. Con la ponderación nueva pasó del tercer puesto al noveno, y la puntuación de todos los modelos se comprimió, así que la distancia con Opus 5 se redujo a un punto aunque Astra se pusiera por delante. [2] [3]

Artificial Analysis no nombra a ningún laboratorio en ese anuncio, y yo tampoco voy a nombrar a ninguno por él. Parte del cambio de posición se explica sin más porque GPT-6 Astra entró en la tabla el 3 de septiembre. Pero el calendario es el que es: un modelo que se apoyaba en un benchmark público saturado y en filas de agentes que eran en parte públicas perdió terreno justo cuando el índice se apoyó en datos privados. El nuevo benchmark privado, una prueba de documentos de empresa llamada AA-Briefcase, coloca a Muse Spark en cuarto lugar, por detrás de Fable 5.1, Opus 5 y Astra, así que tampoco se hundió con datos que nadie había visto antes. [3] Simplemente dejó de ser tercero.

Un segundo evaluador dice más o menos lo mismo sin ningún cambio de versión de por medio. El índice propio de Vals AI, que pondera las tareas por su valor económico y lo ejecuta todo sobre un solo harness, sitúa a Muse Spark 1.3 octavo de 54 a 2,90 $ por prueba, con Fable 5.1 primero a 28,92 $. [17] Dos métodos independientes coinciden ahora en algo parecido al noveno puesto. Mi lectura es que ahí es donde estuvo el modelo todo el tiempo, y que el resultado de la versión 4.1.1 fue un artefacto de dos días de ponderación y ajustes de esfuerzo, no dos días en los que Meta fuera por delante de OpenAI.

La cifra que sobrevivió: precio y velocidad

Ningún recálculo tocó una de las afirmaciones del lanzamiento. Muse Spark 1.3 es, por bastante margen, el modelo más barato de la parte alta de la tabla, y es el más rápido en empezar a responder. Esa es la versión honesta de “rendimiento de frontera casi demasiado barato como para medirlo”.

por tarea del Intelligence Index
0,95 $
Fable 5.1 cuesta 6,12 $; Astra, 2,57 $
hasta el primer token
18,7 s
Astra espera 464 s; Fable 5.1, 267 s
velocidad de salida
190 tok/s
unas dos veces la de Astra y tres veces la de Opus 5
Figura 3. Coste y velocidad con el esfuerzo máximo. Páginas de modelo de Artificial Analysis, 5 de septiembre de 2026.

La figura 3 pone la ventaja de precio en las mismas unidades que la puntuación de inteligencia. En el índice actual Muse Spark 1.3 saca cuatro puntos menos que Fable 5.1 por alrededor de la sexta parte del coste por tarea, y dos puntos menos que Astra por poco más de un tercio. [3] Las cifras de velocidad son las que un usuario nota primero: el primer token en menos de 19 segundos, cuando Astra con el esfuerzo máximo tarda casi ocho minutos. [3] [4] Artificial Analysis dijo el día del lanzamiento que ningún modelo con 59 puntos o más costaba menos por tarea, y el anuncio de la versión 4.2 sigue incluyendo a Meta entre los cuatro laboratorios que marcan su frontera de coste por tarea. [1] [2]

La comparación en programación sigue el mismo patrón. En el Coding Agent Index, Muse Spark 1.3 dentro de Muse Code saca 64 a 1,62 $ por tarea y unos 13 minutos, frente a Fable 5.1 dentro de Claude Code con 70 por 9,18 $ y 24 minutos, y a Astra dentro de Codex con 67 por 4,72 $. [18] Quedarse seis puntos por detrás del líder por menos de una quinta parte del dinero es una posición real, incluso arrastrando la advertencia sobre el harness que he puesto arriba.

El nivel colaborador es la parte que yo leería dos veces. A 0,10 $ de entrada y 0,20 $ de salida sale unas doce veces más barato que el nivel estándar, y la condición es que Meta puede usar tus prompts y las respuestas del modelo para entrenar modelos futuros. [7] OpenCode ofreció gratis ese modelo durante un tiempo después del lanzamiento, y el hilo de r/opencode que lo anunciaba lo llamaba el modelo gratuito más capaz disponible. [22] Para un proyecto personal es una ganga. Para un repositorio con código de un cliente es una decisión sobre tratamiento de datos, no sobre precio.

Qué dicen los desarrolladores que ya lo han usado

Quienes de verdad han ejecutado Muse Spark 1.3 lo describen como un modelo de trabajo rápido, barato y obediente que no da la sensación de estar en lo más alto, y esa descripción encaja con el índice mucho mejor que las afirmaciones del lanzamiento o los desprecios. Los desprecios, eso sí, se oyeron más.

El veredicto más votado llegó en r/codex el 3 de septiembre, en un hilo que señalaba que Artificial Analysis ponía a Astra a la altura de Sol y por debajo de Muse Spark. La respuesta, con 204 puntos, fue directa: “Esta puntuación ya no significa gran cosa. Si has usado Muse Spark 1.3, sabrías que no está ni cerca de ser un modelo del top 10”. [20] El mejor relato de uso real vino de r/singularity, donde un usuario publicó cuatro veces a lo largo de una tarde. Antes de probarlo decía que “me está costando creerlo”. Una hora después: “se siente mecánico (excelente para trabajar, ni idea para estrategia) y muy capaz. Parece muy rápido”. Su lectura final fue que “sube el listón frente a Grok 4.6; muy listo, pero no parece profundo. Muy muy capaz de trabajar”. [21] En Hacker News, un desarrollador que llevaba tiempo usando el nivel colaborador de la 1.2 para desarrollar escribió que no era “ni de lejos un modelo de frontera”, pero que “parecía saber cuáles eran sus debilidades y no intentaba imponerme sus opiniones”. Otro resumió el lanzamiento mejor que buena parte de la prensa: “No deberías pensar ‘vaya, Facebook ha alcanzado a los demás’. Deberías pensar ‘vaya, Facebook está a menos de seis meses de la frontera’”. [19]

Las acusaciones de hacer trampas son otra cosa, porque no encontré ninguna prueba detrás. El comentario más votado de uno de los hilos de Reddit era un enlace titulado “Pretraining on the Test Set Is All You Need”, y “benchmaxxed” aparece en casi todos los hilos, pero nadie presentó un hallazgo de contaminación contra ningún modelo Muse, y Artificial Analysis añadió detección de reward hacking a su índice de programación sin marcar ninguno. [29] La única queja concreta sobre metodología es más estrecha. En julio, un comentarista de Hacker News que se presentaba como antiguo empleado de Meta señaló que el informe de evaluación de Muse Spark 1.1 ejecutaba las tareas de Terminal-Bench con 6 núcleos de CPU y 8 GB de RAM, por encima de los topes que especifica la mayoría de esas tareas, y sostenía que eso explicaba por qué el modelo no aparecía en la clasificación oficial. El informe de Meta dice exactamente eso, y en el mismo hilo otra persona discutió la queja alegando que esos límites son recomendaciones que no cambian los resultados. [25] [26] Yo lo leo como una duda legítima sobre un benchmark, no como prueba de nada más amplio.

La desconfianza tiene un origen, y no está en 2026. En abril de 2025 Meta envió a la clasificación de LMArena una versión experimental de Llama 4 Maverick ajustada para chat, que quedó segunda, mientras que la versión que entregó a los desarrolladores acabó después en el puesto trigésimo segundo. LMArena dijo que la interpretación que Meta hizo de su política “no coincidió con lo que esperamos de los proveedores de modelos”, y un artículo posterior contó 27 variantes privadas de Meta probadas en la arena antes del lanzamiento de Llama 4. [23] [24] Con Muse Spark no ha salido nada parecido, y Meta publica ahora un documento de metodología con cada lanzamiento. [12] Pero cuando un laboratorio con ese historial publica una cifra por encima del nuevo modelo insignia de OpenAI, internet recurre primero a la explicación antigua. Mi lectura es que el episodio de 2025 explica que el escepticismo de 2026 fuera inmediato, y que los cuatro efectos de arriba explican que acertara en parte por los motivos equivocados.

Dónde lo usaría yo

Yo usaría Muse Spark 1.3 para trabajo de agente de mucho volumen, donde la velocidad y el precio importan más que los últimos puntos de criterio, y me quedaría con Fable 5.1, Opus 5 o Astra para cualquier cosa de horizonte largo o que no me pueda permitir repetir. Las puntuaciones respaldan ese reparto mucho mejor de lo que respaldan “Meta ha alcanzado a los demás” o “Meta ha manipulado el índice”.

TareaEncajePor qué
Ejecuciones de agente en volumen: clasificación, extracción, tickets rutinariosBuenoUnos 0,95 $ por tarea del índice y el primer token en 19 segundos
Iterar rápido dentro de Muse CodeBuenoEs el harness con el que se entrenó, y donde se miden sus puntuaciones de programación
Programación de horizonte largo en un repositorio grandeFlojoDecimosexto en un harness de terminal neutral, y por detrás en la prueba de agentes privada
Cualquier cosa con código de un cliente o datos sensiblesSolo nivel estándarEl descuento del nivel colaborador se paga con derechos de entrenamiento
Sustituir un modelo de frontera por lo que dice el índiceTodavía noNoveno en dos índices independientes cuando se fijan el esfuerzo y la versión

Dos notas prácticas. Pregunta con qué ajuste de esfuerzo se midió una cifra antes de fiarte de ella, porque en este modelo max y xhigh se separan entre uno y diez puntos según la prueba. [3] [11] Y trata cada puntuación del índice como si llevara pegado un número de versión, porque la que has leído en una captura puede haber sido ya sustituida. Zvi Mowshowitz comentó en la semana del lanzamiento que Grok 4.6 también sacó 61 en su momento y luego casi no se volvió a saber de él, y que lo sensato por defecto era vigilar Muse Spark dando por hecho que todavía no era lo bastante bueno. [28] Después de tres días leyendo las cifras que hay detrás de las cifras, yo he acabado más o menos ahí, con un añadido: a este precio, “todavía no es lo bastante bueno” sigue mereciendo un hueco en la caja de herramientas.

Fuentes

  1. Muse Spark 1.3: Meta reaches the frontierArtificial Analysis · 2026-09-02
  2. Announcing Artificial Analysis Intelligence Index v4.2Artificial Analysis · 2026-09-04
  3. Muse Spark 1.3 (max) model analysisArtificial Analysis · 2026-09-05
  4. Benchmarking GPT-6 AstraArtificial Analysis · 2026-09-03
  5. Introducing Muse Spark 1.3Meta · 2026-09-02
  6. Muse Spark model pageMeta Developers · 2026-09-05
  7. Pricing and rate limitsMeta Developers · 2026-09-05
  8. Introducing Muse Spark: Scaling towards personal superintelligenceMeta · 2026-04-08
  9. Meta abandons open-source Llama for proprietary Muse SparkThe New Stack · 2026-04-30
  10. Meta to open source its most powerful AI model as it takes swipe at OpenAI, AnthropicCNBC · 2026-08-10
  11. Meta says Muse Spark 1.3 has frontier performance, but its best results come from a model developers can't broadly use yetVentureBeat · 2026-09-03
  12. Muse Spark 1.3 evaluation methodologyMeta · 2026-09-02
  13. Intelligence benchmarking methodologyArtificial Analysis · 2026-09-04
  14. Terminal-Bench 2.1 leaderboardVals AI · 2026-09-04
  15. On running Muse Spark 1.2 with Muse Code prompts inside ClineX, Cline · 2026-08-06
  16. SWE Atlas: Codebase QnAScale Labs · 2026-09-05
  17. Vals IndexVals AI · 2026-09-04
  18. Coding Agent IndexArtificial Analysis · 2026-09-05
  19. Muse Spark 1.3 discussionHacker News · 2026-09-02
  20. Astra is good, but maybe we should calm down with the hypeReddit, r/codex · 2026-09-03
  21. Meta's muse spark 1.3 surpassed fable 5 and GPT 5.6 solReddit, r/singularity · 2026-09-02
  22. Meta Muse Spark 1.3 is FREE on OpenCode ZenReddit, r/opencode · 2026-09-03
  23. Meta's benchmarks for its new AI models are a bit misleadingTechCrunch · 2025-04-06
  24. The Leaderboard IllusionarXiv, Cohere Labs et al. · 2025-04-29
  25. On the Terminal-Bench resource caps in the Muse Spark 1.1 evaluation reportHacker News · 2026-07-09
  26. Muse Spark 1.1 evaluation reportMeta Superintelligence Labs · 2026-07-09
  27. The future of Meta Superintelligence: a 1 year progress updateSemiAnalysis · 2026-07-09
  28. AI #184: Post Post MortemZvi Mowshowitz · 2026-09-03
  29. Coding agents benchmarking methodologyArtificial Analysis · 2026-09-05