Muse Spark 1.3 a devancé GPT-6 deux jours. Voici pourquoi
Muse Spark 1.3 a obtenu 62 sur Artificial Analysis, devant GPT-6 Astra, puis il est tombé neuvième après un recalcul. J’ai cherché d’où venait ce score.
Sur cette page
- Ce qui s’est passé entre le 2 et le 4 septembre 2026
- Ce que Meta a livré, et ce qu’elle a revendiqué
- Pourquoi l’indice a-t-il placé Muse Spark à côté de Fable et d’Astra ? Quatre effets
- Ce que la version 4.2 a changé, et ce qu’elle n’a pas changé
- Le chiffre qui a survécu : le prix et la vitesse
- Ce qu’en disent les développeurs qui l’ont utilisé
- Où je l’utiliserais
Meta a lancé Muse Spark 1.3 le 2 septembre 2026, et Artificial Analysis a noté son réglage le plus poussé 62 sur l’Intelligence Index, troisième derrière Claude Fable 5.1 et Opus 5, et un point devant le GPT-6 Astra qu’OpenAI a livré le lendemain. [1] [4] Le 4 septembre, l’indice est passé en version 4.2 et Muse Spark est tombé à 53, au neuvième rang. [2] [3] Le score était réel, la chute aussi. Quatre facteurs expliquent les deux, et aucun n’est une tricherie.
Ce qui s’est passé entre le 2 et le 4 septembre 2026
Muse Spark 1.3 a tenu une place dans le trio de tête de l’indice indépendant le plus cité pendant environ 48 heures, puis l’indice lui-même a changé. L’enchaînement compte plus que n’importe quel chiffre isolé, alors le voici dans l’ordre.
-
Muse Spark 1.0
Premier modèle de Meta Superintelligence Labs, poids fermés.
-
Muse Spark 1.2 et Muse Code
L’agent de programmation maison de Meta est livré avec le modèle.
-
Muse Spark 1.3
Artificial Analysis note le réglage max à 62, troisième de tous les modèles.
-
GPT-6 Astra
Le modèle phare d’OpenAI entre dans le même indice à 61.
-
Indice v4.2
Recalcul : Muse Spark 1.3 à 53, neuvième. Le réglage max devient public le même jour.
La figure 1 explique pourquoi tant de gens ont vu des chiffres contradictoires la même semaine. Le 2 septembre, Artificial Analysis écrivait que Muse Spark 1.3 en max « obtient 62 sur l’Artificial Analysis Intelligence Index, derrière les seuls Claude Fable 5.1 et Claude Opus 5 », le réglage xhigh accessible à tous se situant à 61. [1] Quand GPT-6 Astra est arrivé le 3 septembre, le même indice lui a donné 61, et des captures d’écran montrant Meta au-dessus d’OpenAI ont circulé en quelques heures. [4] Le 4 septembre, Artificial Analysis a publié la version 4.2 de l’indice. Sur cette version, Muse Spark 1.3 en max obtient 53 et se classe neuvième sur 202 modèles, Fable 5.1 obtient 57, Astra 55, Opus 5 54 et GPT-5.6 Sol 51. [2] [3] Les deux séries de chiffres sont exactes pour la version à laquelle elles appartiennent, et c’est en citant l’une sans sa version que la dispute a commencé.
Ce que Meta a livré, et ce qu’elle a revendiqué
Muse Spark 1.3 est un modèle à poids fermés de Meta Superintelligence Labs, vendu par l’API maison de Meta et par son agent Muse Code à 1,25 $ par million de tokens en entrée et 4,25 $ par million de tokens en sortie, avec un palier contributeur (contributor tier) à 0,10 $ et 0,20 $ pour les développeurs qui autorisent Meta à entraîner ses modèles sur leurs prompts. [5] [7] Meta revendiquait des performances de pointe pour une fraction du prix. Son propre tableau comparatif appuie une partie de cette affirmation et contredit discrètement le reste.
Le passé de Meta pèse sur la façon dont ces chiffres ont été reçus. L’entreprise a présenté Muse Spark en avril 2026 comme le premier modèle d’une nouvelle série issue de Meta Superintelligence Labs, le laboratoire monté mi-2025 autour d’Alexandr Wang après la déception de la génération Llama 4. [8] [27] Llama n’a pas été officiellement abandonné, mais il n’existe aucun chemin de migration depuis cette famille, puisque Muse Spark est propriétaire et servi uniquement par Meta. [9] Mark Zuckerberg a promis des poids ouverts pour Muse Spark 1.2, et Meta a publié en août un modèle distinct de 30 milliards de paramètres, Muse Glimmer, sous licence ouverte, mais au 5 septembre aucun poids de Muse Spark n’est public. [10] [11]
Les annonces du lancement, elles, étaient ambitieuses. Zuckerberg a déclaré que Muse Spark 1.3 « se déploie aujourd’hui avec des performances de pointe presque trop bon marché pour être facturées », et le tableau de Meta le compare à GPT-5.6 Sol et à Claude Opus 5, tous deux à leur réglage de raisonnement maximal. [6] [11] Sur ce tableau, Muse Spark gagne sur DeepSWE avec 75,4 % contre 73,0 % pour Sol et 74,0 % pour Opus, égale Sol sur Terminal-Bench 2.1 à 88,8 %, et affiche 98,1 % sur un test de mémoire à long contexte entre 512K et 1M tokens où Sol plafonne à 73,8 %. Opus 5 remporte en revanche la plupart des lignes consacrées aux agents, dont GDPval-AA avec 1 824 points Elo contre 1 754, l’utilisation d’ordinateur OSWorld et AutomationBench. [6] Les chiffres de Meta décrivent donc un modèle qui domine sur la programmation et le long contexte et qui reste derrière Anthropic sur le travail d’agent, ce qui est nettement plus étroit que le discours du lancement.
Deux choix de méthode méritent d’être signalés, parce qu’ils influencent chaque ligne du tableau. Meta présente son propre modèle en max mais sa version précédente, Muse Spark 1.2, en xhigh, si bien qu’une partie du gain d’une version à l’autre vient d’un changement de réglage. Et pour les concurrents, l’entreprise retient « la valeur la plus élevée disponible pour la métrique principale comparable », qu’elle vienne de ses propres exécutions, du classement officiel ou du chiffre annoncé par le fournisseur, en gardant la meilleure des trois. [12] Le tableau ne compare par ailleurs aucun modèle plus récent que fin juillet : ni Claude Fable 5.1, sorti le 1er septembre, ni GPT-6 Astra n’y figurent. [6]
Pourquoi l’indice a-t-il placé Muse Spark à côté de Fable et d’Astra ? Quatre effets
Le 62 vient d’une évaluation réelle, menée par un tiers, sur un modèle qui est vraiment bon dans certains domaines. Il vient aussi d’une version d’indice précise, d’un réglage d’effort précis, d’un harness précis et d’un jeu de comparaisons choisi par Meta. Chacun de ces éléments a poussé le chiffre vers le haut, et chacun est documenté.
| Mesure | Muse Spark 1.3 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Intelligence Index v4.1.1, 2 sept. | 62 | 66 (Meilleure valeur de la ligne) | 63 | 61 | 61 |
| Intelligence Index v4.2, 5 sept. | 53 | 57 (Meilleure valeur de la ligne) | 54 | 55 | 51 |
| Coût par tâche de l’indice, $ | 0,95 (Meilleure valeur de la ligne) | 6,12 | 4,21 | 2,57 | 1,25 |
| Temps avant le premier token, s | 18,7 (Meilleure valeur de la ligne) | 266,5 | 91,2 | 463,7 | 163,0 |
| Vitesse de sortie, tokens/s | 190,1 (Meilleure valeur de la ligne) | 68,7 | 59,1 | 87,5 | 85,4 |
La figure 2 sert de carte pour la suite de cette section. Les deux lignes d’indice montrent la chute, et les trois lignes en dessous montrent ce qui est resté vrai malgré elle. Les cinq modèles sont à leur réglage d’effort maximal, et la colonne Muse Spark correspond à la variante max. [1] [3] [4]
L’indice récompense les tâches d’agent, et c’est exactement là que Meta a progressé. Artificial Analysis construit l’Intelligence Index à partir de quatre catégories : les agents et le raisonnement général comptent chacun pour 30 %, la programmation et les sciences pour 20 % chacune, et l’entreprise dit ouvertement que « la pondération met l’accent sur les tâches agentiques ». [13] Le gain de Muse Spark 1.3 sur la version 1.2 tient presque entièrement à cette part agent : son score sur un benchmark de service client bancaire est passé de 35 % à 52 %, ce qui l’a placé premier de tous les modèles, et sa note sur le test de travail professionnel GDPval a gagné environ 139 points Elo. Pendant ce temps, il perdait quatre points sur le raisonnement à long contexte et un à trois points sur le test de connaissances. [1] Artificial Analysis explique aussi comment le réglage max gagne ses points supplémentaires : en « utilisant plus de tours et plus de tokens de raisonnement au total, avec 62 % de raisonnement en plus sur GDPval-AA v2 et 28 % de plus sur Tau3-Bench Banking » qu’en xhigh. [1] Un score composite peut donc monter grâce à deux lignes pendant que les lignes qui intéressent un développeur baissent.
Le 62 a été mesuré sur un réglage que personne ne pouvait acheter. La variante max était en préversion limitée, réservée aux partenaires de Meta le jour du lancement, et VentureBeat a rapporté que Meta « terminait encore des tests de sécurité supplémentaires » et promettait une ouverture prochaine. Elle est devenue publique le 4 septembre. [11] Le réglage que les développeurs pouvaient réellement appeler, xhigh, obtenait 61 sur l’ancien indice et 52 sur le nouveau. [1] [3] Ce n’est pas inhabituel, puisque Anthropic et OpenAI publient eux aussi leurs meilleurs chiffres tous efforts confondus, mais cela veut dire que « Muse Spark bat Astra » comparait une préversion à un produit commercialisé.
Les scores de programmation viennent du harness maison de Meta. Artificial Analysis fait tourner ses tests d’agent de programmation dans l’agent de chaque fournisseur quand il en existe un, donc Muse Spark tourne dans Muse Code, et Meta indique que le modèle a été entraîné sur ses propres harness. [5] [18] Vals AI, qui fait tourner tous les modèles sur le même harness Terminal-Bench 2.1, donne 72,28 % à Muse Spark 1.3 et le classe seizième sur 62, alors qu’Astra, Sol, Fable 5.1 et Opus 5 se situent tous entre 85 % et 87 %. [14] Le tableau de Meta annonce 88,8 % sur le même benchmark. [6] L’écart est un effet de harness, et Cline l’a démontré en août : l’équipe a copié les instructions du system prompt de Muse Code dans son propre agent, puis a lancé le même modèle Muse Spark 1.2 sur la même tâche. Le nombre de tokens est tombé de 19,7 millions à 7,2 millions, l’exécution s’est terminée en 24 minutes au lieu de 49, et le coût est passé de 7,69 $ à 3,25 $ sans rien changer d’autre que le prompt. [15]
Les comparaisons de Meta ont été choisies pour lui être favorables. Le décalage entre max et xhigh et la règle de la meilleure valeur disponible sont décrits plus haut. Une ligne suffit à montrer ce que cela donne en pratique. Le tableau de Meta attribue 59,4 à Muse Spark sur le benchmark de questions sur une base de code de Scale, devant Opus 5 à 52,7 et Sol à 53,5. Le classement de Scale, mesuré sur une autre métrique, donne 63,17 à Opus 5 et 46,00 à Sol, et ne mentionne pas du tout Muse Spark 1.3. [6] [16] Personne n’a falsifié quoi que ce soit, mais le tableau oppose une exécution maison de Meta à des chiffres tirés des documents d’autres fournisseurs, et il présente le résultat comme une victoire.
Ce que la version 4.2 a changé, et ce qu’elle n’a pas changé
Le recalcul du 4 septembre a doublé le poids des jeux de tests privés, porté à 40 % « pour empêcher les manipulations », retiré GPQA Diamond parce que ce benchmark « est désormais saturé », et ajouté deux nouvelles évaluations. [2] Muse Spark 1.3 obtenait 94 % sur GPQA. Avec la nouvelle pondération, il est passé de la troisième à la neuvième place, et le score de tous les modèles s’est resserré, si bien que l’écart avec Opus 5 s’est réduit à un point au moment même où Astra passait devant. [2] [3]
Artificial Analysis ne cite aucun laboratoire dans cette annonce, et je ne vais pas le faire à sa place. Une partie du changement de classement tient simplement à l’arrivée de GPT-6 Astra au tableau le 3 septembre. Mais le calendrier est ce qu’il est : un modèle qui s’appuyait sur un benchmark public saturé et sur des lignes d’agent en partie publiques a reculé au moment précis où l’indice s’est appuyé sur des données privées. Le nouveau benchmark privé, un test sur documents professionnels appelé AA-Briefcase, place Muse Spark quatrième, derrière Fable 5.1, Opus 5 et Astra, donc il ne s’est pas effondré sur des données jamais vues. [3] Il a simplement cessé d’être troisième.
Un deuxième évaluateur dit à peu près la même chose sans aucun changement de version. L’indice de Vals AI, qui pondère les tâches selon leur valeur économique et fait tout tourner sur un seul harness, place Muse Spark 1.3 huitième sur 54 pour 2,90 $ par test, avec Fable 5.1 en tête à 28,92 $. [17] Deux méthodes indépendantes s’accordent donc aujourd’hui sur une neuvième place environ. Mon interprétation : le modèle se situait là depuis le début, et le résultat de la version 4.1.1 était un artefact de pondération et de réglage d’effort qui a duré deux jours, pas deux jours pendant lesquels Meta a devancé OpenAI.
Le chiffre qui a survécu : le prix et la vitesse
Un seul argument est resté debout après chaque recalcul. Muse Spark 1.3 est de loin le modèle le moins cher parmi ceux du haut du tableau, et c’est aussi le plus rapide à répondre. Voilà la version honnête des « performances de pointe presque trop bon marché pour être facturées ».
- par tâche de l’Intelligence Index
- 0,95 $
- Fable 5.1 coûte 6,12 $, Astra 2,57 $
- avant le premier token
- 18,7 s
- Astra attend 464 s, Fable 5.1 267 s
- vitesse de sortie
- 190 tok/s
- environ le double d’Astra, le triple d’Opus 5
La figure 3 exprime l’avantage de prix dans les mêmes unités que le score d’intelligence. Sur l’indice actuel, Muse Spark 1.3 se situe quatre points sous Fable 5.1 pour environ un sixième du coût par tâche, et deux points sous Astra pour à peine plus du tiers. [3] Les chiffres de vitesse sont ceux que les utilisateurs remarquent en premier : un premier token en moins de 19 secondes, là où Astra à l’effort maximal met presque huit minutes. [3] [4] Artificial Analysis affirmait le jour du lancement qu’aucun modèle notant 59 ou plus ne coûtait moins cher par tâche, et l’annonce de la version 4.2 place toujours Meta parmi les quatre laboratoires situés sur sa frontière du coût par tâche. [1] [2]
La comparaison sur la programmation suit le même schéma. Sur le Coding Agent Index, Muse Spark 1.3 dans Muse Code obtient 64 pour 1,62 $ par tâche et environ 13 minutes, face à Fable 5.1 dans Claude Code à 70 pour 9,18 $ et 24 minutes, et à Astra dans Codex à 67 pour 4,72 $. [18] Six points derrière le premier pour moins d’un cinquième du prix, c’est une position réelle, même en gardant à l’esprit la réserve sur le harness rappelée plus haut.
Le palier contributeur est la partie que je relirais deux fois. À 0,10 $ en entrée et 0,20 $ en sortie, il revient environ douze fois moins cher que le palier standard, et la contrepartie est que Meta peut utiliser vos prompts et les réponses du modèle pour entraîner ses modèles futurs. [7] OpenCode a rendu ce modèle contributeur gratuit pendant une période après le lancement, et le fil r/opencode qui l’annonçait le présentait comme le modèle gratuit le plus capable du moment. [22] Pour un projet personnel, c’est une bonne affaire. Pour un dépôt qui contient le code d’un client, c’est une décision sur le traitement des données, pas une décision de prix.
Ce qu’en disent les développeurs qui l’ont utilisé
Les personnes qui ont réellement fait tourner Muse Spark 1.3 décrivent un modèle de travail rapide, bon marché et obéissant, qui ne donne pas l’impression d’être un modèle de tête, et cette description colle mieux à l’indice que les annonces de lancement ou que les rejets en bloc. Les rejets, eux, ont été plus bruyants.
Le verdict le plus voté est arrivé sur r/codex le 3 septembre, dans un fil qui relevait qu’Artificial Analysis mettait Astra au niveau de Sol et sous Muse Spark. La réponse, avec 204 points, était sans détour : « Ce score ne veut plus dire grand-chose. Si vous aviez utilisé Muse Spark 1.3, vous sauriez qu’il est très loin d’être un modèle du top 10. » [20] Le meilleur témoignage de première main venait de r/singularity, où un utilisateur a publié quatre messages au cours de la même soirée. Avant de tester, il avait « du mal à y croire ». Une heure plus tard : « ça paraît mécanique (excellent pour le travail, aucune idée pour la stratégie) et très capable. Semble très rapide. » Son verdict final : le modèle « place la barre plus haut que Grok 4.6 ; vraiment intelligent, mais sans profondeur. Très, très capable au travail ». [21] Sur Hacker News, un développeur qui utilisait le palier contributeur de la 1.2 pour son travail écrivait que ce n’était « en aucun cas un modèle de pointe », mais qu’il « avait l’air de connaître ses faiblesses et n’essayait pas de m’imposer ses opinions ». Un autre a résumé le lancement mieux que la plupart des articles de presse : il ne faut pas se dire « waouh, Facebook a rattrapé son retard », mais plutôt « waouh, Facebook a moins de 6 mois de retard sur la pointe ». [19]
Les accusations de tricherie sont une autre affaire, parce que je n’ai trouvé aucune preuve derrière elles. Le commentaire en tête d’un fil Reddit était un lien intitulé « Pretraining on the Test Set Is All You Need », et le mot « benchmaxxed » apparaît dans presque tous les fils, mais personne n’a produit de constat de contamination contre un modèle Muse, et Artificial Analysis a ajouté une détection du reward hacking à son indice de programmation sans en signaler un seul. [29] La seule critique de méthode vraiment précise porte sur un point étroit. En juillet, un commentateur de Hacker News qui se présentait comme un ancien employé de Meta a relevé que le rapport d’évaluation de Muse Spark 1.1 exécutait les tâches Terminal-Bench avec 6 cœurs de processeur et 8 Go de mémoire, au-dessus des plafonds fixés par la plupart de ces tâches, et il en concluait que cela expliquait l’absence du modèle du classement officiel. Le rapport de Meta le dit effectivement, et la critique a été contestée dans le même fil par quelqu’un pour qui ces limites sont des recommandations qui ne changent pas les résultats. [25] [26] J’y vois une vraie question sur un benchmark, pas la preuve de quelque chose de plus large.
La méfiance a une origine, et elle ne date pas de 2026. En avril 2025, Meta a soumis au classement LMArena une version expérimentale de Llama 4 Maverick réglée pour la conversation, où elle a pris la deuxième place, alors que la version livrée ensuite aux développeurs s’est classée trente-deuxième. LMArena a déclaré que l’interprétation de sa politique par Meta « ne correspondait pas à ce que nous attendons des fournisseurs de modèles », et un article publié plus tard a recensé 27 variantes privées de Meta testées sur l’arène avant la sortie de Llama 4. [23] [24] Rien de comparable n’est apparu pour Muse Spark, et Meta publie désormais un document de méthodologie à chaque sortie. [12] Mais quand un laboratoire avec ce passé affiche un chiffre supérieur au nouveau modèle phare d’OpenAI, internet se tourne d’abord vers l’ancienne explication. Pour moi, l’épisode de 2025 explique pourquoi le scepticisme de 2026 a été immédiat, et les quatre effets décrits plus haut expliquent pourquoi il avait en partie raison, mais pour de mauvaises raisons.
Où je l’utiliserais
J’utiliserais Muse Spark 1.3 pour du travail d’agent en grand volume, quand la vitesse et le prix comptent plus que les derniers points de jugement, et je garderais Fable 5.1, Opus 5 ou Astra pour tout ce qui s’étend sur la durée et pour tout ce que je ne pourrais pas me permettre de refaire. Les scores appuient ce partage bien mieux qu’ils n’appuient « Meta a rattrapé son retard » ou « Meta a manipulé l’indice ».
| Tâche | Verdict | Pourquoi |
|---|---|---|
| Exécutions d’agent en masse : classification, extraction, tickets courants | Bon | Environ 0,95 $ par tâche de l’indice et un premier token en 19 secondes |
| Itérer vite dans Muse Code | Bon | Le harness avec lequel il a été entraîné, et où ses scores de programmation sont mesurés |
| Programmation au long cours sur un grand dépôt | Faible | Seizième sur un harness de terminal neutre, en retard sur le test d’agent privé |
| Tout ce qui touche au code d’un client ou à des données sensibles | Palier standard seulement | La remise contributeur se paie en droits d’entraînement |
| Remplacer un modèle de pointe à cause de l’indice | Pas encore | Neuvième sur deux indices indépendants, à effort et version constants |
Deux remarques pratiques. Demandez à quel niveau d’effort un chiffre a été mesuré avant de lui faire confiance, parce que max et xhigh sont séparés de un à dix points sur ce modèle selon le test. [3] [11] Et considérez que chaque score d’indice porte un numéro de version, parce que celui que vous lisez sur une capture d’écran a peut-être déjà été remplacé. Zvi Mowshowitz faisait remarquer la semaine du lancement que Grok 4.6 avait lui aussi obtenu 61 à un moment, avant qu’on cesse à peu près d’en parler, et que la position raisonnable était de garder un œil sur Muse Spark en supposant qu’il n’était pas encore assez bon. [28] Après trois jours passés à lire les chiffres derrière les chiffres, j’arrive à peu près au même endroit, avec une nuance : à ce prix, « pas encore assez bon » mérite quand même une place dans la boîte à outils.
Sources
- Muse Spark 1.3: Meta reaches the frontier
- Announcing Artificial Analysis Intelligence Index v4.2
- Muse Spark 1.3 (max) model analysis
- Benchmarking GPT-6 Astra
- Introducing Muse Spark 1.3
- Muse Spark model page
- Pricing and rate limits
- Introducing Muse Spark: Scaling towards personal superintelligence
- Meta abandons open-source Llama for proprietary Muse Spark
- Meta to open source its most powerful AI model as it takes swipe at OpenAI, Anthropic
- Meta says Muse Spark 1.3 has frontier performance, but its best results come from a model developers can't broadly use yet
- Muse Spark 1.3 evaluation methodology
- Intelligence benchmarking methodology
- Terminal-Bench 2.1 leaderboard
- On running Muse Spark 1.2 with Muse Code prompts inside Cline
- SWE Atlas: Codebase QnA
- Vals Index
- Coding Agent Index
- Muse Spark 1.3 discussion
- Astra is good, but maybe we should calm down with the hype
- Meta's muse spark 1.3 surpassed fable 5 and GPT 5.6 sol
- Meta Muse Spark 1.3 is FREE on OpenCode Zen
- Meta's benchmarks for its new AI models are a bit misleading
- The Leaderboard Illusion
- On the Terminal-Bench resource caps in the Muse Spark 1.1 evaluation report
- Muse Spark 1.1 evaluation report
- The future of Meta Superintelligence: a 1 year progress update
- AI #184: Post Post Mortem
- Coding agents benchmarking methodology