Benchmarks

Kimi K3 tient la route, GLM-5.2 est un pari, rien n'est donné

Kimi K3 égale GPT-5.6 sur l'indice indépendant de code, en 4,6 fois plus de temps. Les tokens à 1,40 $ de GLM-5.2 coûtent 6,51 $ par tâche. La hype, mesurée.

Sur cette page
  1. D’où vient la hype ?
  2. Que disent les chiffres indépendants ?
  3. Moins cher au token, vraiment moins cher ?
  4. Où Kimi K3 est-il vraiment bon ?
  5. Pourquoi GLM-5.2 s’est-il écrasé dans Claude Code ?
  6. Comment lire un classement de code
  7. Où ces modèles atterrissent dans mon routage

Le discours derrière les nouveaux modèles chinois est simple : des poids ouverts qui égalent la frontière occidentale pour une fraction du prix. Les chiffres indépendants sont plus précis. Sur le Coding Agent Index d’Artificial Analysis, Kimi K3 égale bel et bien le réglage medium de GPT-5.6, en 4,6 fois plus de temps actif [1]. Et les tokens de GLM-5.2 à 1,40 $ se sont transformés en 6,51 $ par tâche tentée [2].

Je n’ai encore fait tourner aucun des deux modèles sur mes propres dépôts, ce n’est donc pas un test terrain. C’est une lecture des reçus qui existent : les mesures d’agents indépendantes, les votes des arènes, les tableaux des fournisseurs avec leurs propres notes de bas de page, et les conditions de licence que personne ne cite dans les fils de lancement. Version courte : la capacité est réelle, la remise, rarement.

D’où vient la hype ?

De trois faits vrais arrivés en même temps. Kimi K3 mène le classement fullstack d’Arena [3] et occupe la deuxième place de la WebDev Arena, devant Claude Fable 5 et GPT-5.6 [4]. Les deux modèles publient des poids ouverts à des tailles que personne n’avait ouvertes avant [5] [6]. Et les deux affichent des prix au token très en dessous des vaisseaux amiraux occidentaux [5] [7].

Les résultats d’arène méritent d’être pris au sérieux. Sur le tableau fullstack daté du 24 juillet 2026, Kimi K3 max tient le rang 1 avec un score de 1 664, devant GPT-5.6 Sol à 1 633 et Fable 5 à 1 623 [3]. Sur la WebDev Arena quatre jours plus tard, Claude Opus 5 max mène à 1 712 et Kimi est deuxième à 1 682 sur 3 777 votes, au-dessus de Fable 5, Sol et GLM-5.2 [4]. Des gens qui ont le choix continuent de voter pour ce que ce modèle construit dans un navigateur.

L’ouverture est réelle aussi. Moonshot présente Kimi K3 comme le premier modèle à poids ouverts de 2 800 milliards de paramètres, avec une fenêtre de contexte d’un million de tokens, la vision intégrée, et un prix d’API de 3 $ par million de tokens en entrée et 15 $ en sortie [5]. GLM-5.2 est le petit frère : 753 milliards de paramètres sous une licence MIT toute simple [6], affiché à 1,40 $ en entrée et 4,40 $ en sortie [7]. Posez ces étiquettes à côté de la grille tarifaire occidentale et le récit s’écrit tout seul.

Moonshot est plus prudent que ses fans. Le billet de lancement admet que K3 reste derrière Fable 5 et GPT-5.6 Sol, et concède « un écart sensible d’expérience utilisateur » face aux deux [5]. Cette phrase, écrite par le fournisseur lui-même, se révèle être aussi le résumé le plus exact des données indépendantes.

Que disent les chiffres indépendants ?

Artificial Analysis fait passer chaque système par la même batterie en trois volets : 113 tâches d’ingénierie logicielle (DeepSWE), 84 tâches agentiques de terminal (Terminal-Bench v2) et 124 questions techniques sur du code (SWE-Atlas Q&A), à poids égal dans le Coding Agent Index v1.3 [8]. Relevé le 30 juillet 2026 : Kimi K3 obtient 61, exactement au niveau de GPT-5.6 à effort medium. Opus 5 medium obtient 62. GLM-5.2 obtient 43 [1] [2].

Un détail de cadrage compte plus que n’importe quel score. L’indice mesure des systèmes, pas des poids : Kimi tournait dans sa propre Kimi Code CLI, GLM-5.2 dans Claude Code, Sol dans Codex, les modèles Claude dans Claude Code [1] [2]. On ne mesure jamais un modèle. On mesure un modèle habillé d’un agent donné, à un niveau d’effort donné.

Mesure Kimi K3GLM-5.2Sol mediumOpus 5 medium
Coding Agent Index 61 43 61 62 (Meilleure valeur de la ligne)
DeepSWE, % 64 29 64 63
Terminal-Bench v2, % 84 (Meilleure valeur de la ligne) 72 78 79
SWE-Atlas Q&A, % 37 29 40 44 (Meilleure valeur de la ligne)
Coût par tâche, $ 3,18 6,51 2,99 (Meilleure valeur de la ligne) 3,14
Temps actif, min 23,8 25,1 5,2 (Meilleure valeur de la ligne) 12,2
Figure 1. Coding Agent Index v1.3, sous-scores et coûts mesurés par tâche. Artificial Analysis, relevé le 30 juillet 2026.

L’histoire du tableau se lit sur la diagonale : Kimi gagne le terminal, Opus gagne la compréhension, Sol gagne le chronomètre, et GLM-5.2 ne gagne rien à ces réglages.

Regardez d’abord l’égalité, car c’est le résumé le plus juste de Kimi en une ligne. Le même 61 que Sol medium, à 3,18 $ par tâche contre 2,99 $, soit environ 6 % de plus [1]. Mais il lui faut 23,8 minutes actives contre 5,2 pour Sol, c’est le 4,6 fois de l’entame, et 10,6 millions de tokens contre 5,8 millions. Face à Opus 5 medium, le tableau se répète : un point d’indice en dessous, quatre cents de plus par tâche, à peu près le double de temps [2].

Le plafond reste occidental. Sol max atteint 67 à 7,08 $ par tâche [1] ; Opus 5 xhigh égale ce 67 à 8,23 $ et signe la meilleure compréhension de dépôt de la batterie, 55 % sur SWE-Atlas Q&A [2]. Fable 5 max se pose à 66 pour 11,71 $ par tâche, la façon la plus chère d’acheter un point qu’Opus xhigh vend aussi [2]. Les 84 % de Kimi sur Terminal-Bench v2 sont du vrai territoire de frontière, au-dessus des 83 % de Sol high et à quelques points des vaisseaux amiraux à effort maximal [1] [2].

Le point faible de Kimi est tout aussi visible : 37 % sur le volet questions de code, sous les 40 % de Sol medium et loin sous ce que signent les configurations Claude [1] [2]. Le profil se lit comme un agent meilleur pour faire que pour comprendre ce qui existe déjà. Sur un projet neuf, cela compte à peine. Sur un dépôt hérité de 300 000 lignes, c’est tout le métier.

Moins cher au token, vraiment moins cher ?

Pas en soi. Une tâche coûte des tokens fois le prix du token, et un agent qui a besoin de plus de tours, de plus de reprises ou de plus de réflexion multiplie le premier facteur plus vite que n’importe quelle remise ne réduit le second. GLM-5.2 en est la preuve mesurée : le prix catalogue le plus bas du tableau, et pourtant un coût par tâche au-dessus de toutes les configurations occidentales en medium [2] [7].

Les prix catalogue d’abord, car deux m’ont surpris. Jusqu’au 31 août 2026, Claude Sonnet 5 se vend au tarif de lancement de 2 $ par million de tokens en entrée et 10 $ en sortie, puis passe à 3 $ et 15 $ à partir du 1er septembre [9]. Kimi K3 coûte 3 $ et 15 $ aujourd’hui [5]. Le fameux modèle chinois bon marché est 50 % plus cher au token que le modèle de volume d’Anthropic ce mois-ci, et identique au catalogue dès l’automne.

Le reste du tableau : Opus 5 à 5 $ en entrée et 25 $ en sortie, Fable 5 à 10 $ et 50 $ [9], GPT-5.6 à 5 $ et 30 $ avec un palier long contexte à 10 $ et 45 $ [10], et GLM-5.2 sous tout le monde à 1,40 $ et 4,40 $ avec des lectures de cache à 0,26 $ [7].

Deux notes de bas de page rendent même ces étiquettes glissantes. Les tokenizers varient selon le fournisseur : Anthropic documente que son tokenizer actuel produit environ 30 % de tokens de plus pour le même texte que le précédent [9], un prix par million de tokens n’est donc même pas une unité fixe d’une famille de modèles à l’autre. Et le comportement de réflexion varie aussi : Kimi K3 réfléchit toujours, la FAQ de la plateforme est explicite sur le fait que cela ne se désactive pas, et l’effort par défaut est max [11]. Vous payez des tokens que vous ne voyez jamais.

prix catalogue, par million de tokens d'entrée
1,40 $
le modèle le moins cher de cette comparaison
mesuré, par tâche tentée
6,51 $
dans Claude Code, 25,1 minutes actives
dérivé, par tâche résolue
15,14 $
coût par tentative divisé par le taux de réussite de 43 %
Figure 2. Ce que devient le prix catalogue de GLM-5.2, mesuré puis dérivé. Artificial Analysis et Z.ai, juillet 2026.

Faites tourner cette arithmétique sur tout le tableau et l’ordre change. Sol medium ressort autour de 4,90 $ par tâche résolue, Opus 5 medium à 5,06 $, Kimi K3 à 5,21 $ et GLM-5.2 à 15,14 $, trois fois sa concurrence occidentale. La lecture du graphique en une ligne : sous mesure, l’étiquette la moins chère de la comparaison devient le changement résolu le plus cher.

Et cela ignore encore la partie coûteuse. Dix minutes d’un ingénieur qui trie une exécution ratée coûtent plus que n’importe quel chiffre de cette figure. Dès que les échecs retombent sur un humain plutôt que sur une boucle de reprise, le taux de réussite domine entièrement le prix du token.

Où Kimi K3 est-il vraiment bon ?

Le travail lourd en terminal, le développement web en forme de produit, les longues sessions d’agent, et tous les scénarios où posséder les poids compte. La batterie indépendante le confirme, les arènes le confirment, et le positionnement de Moonshot lui-même colle [1] [3] [5]. Ce qu’il n’est pas, en l’état des preuves : un remplaçant bon marché pour du travail lourd sur des dépôts existants.

Le résultat terminal tient des deux côtés : 84 % mesurés indépendamment dans la propre CLI de Kimi [1], 88,3 % dans la configuration préférée de Moonshot [12]. La promesse longue distance est mesurée par le fournisseur, mais notable : K3 domine le tableau SWE-Marathon de Moonshot à 42, et ce même tableau note ouvertement en bas de page que Fable 5 est tombé en modèle de secours sur 35 % de ces tâches, et que certaines lignes Kimi tournaient sur une branche préliminaire calibrée pour du matériel H20 [12]. Ajoutez la vision native via un encodeur dédié et la fenêtre d’un million de tokens [12], et l’idée de Moonshot d’itérer entre code et captures d’écran en direct [5] cesse de sonner comme du marketing.

Les faiblesses sont tout aussi concrètes. Compréhension : 37 % sur les questions de code [1]. Vitesse : 23,8 minutes actives par tâche, donc on parallélise des agents ou on attend ; sa propre attention, elle, ne se parallélise pas. Et « poids ouverts » mérite un calcul de coin de table avant de planifier de l’auto-hébergement : 2 800 milliards de paramètres, c’est environ 1,4 To de poids même quantifiés en 4 bits, avant le cache KV et le surcoût de service. C’est un cluster, pas une station de travail.

La paperasse compte aussi. La licence est permissive mais pas standard : une activité de modèle-service au-delà de 20 millions de dollars de revenus cumulés exige un accord séparé avec Moonshot, et tout produit au-delà de 100 millions d’utilisateurs actifs mensuels ou de 20 millions de dollars de revenus mensuels doit afficher « Kimi K3 » en évidence ; l’usage interne est exempté [13]. Et les conditions standard de l’API autorisent Moonshot à utiliser le contenu client pour fournir, maintenir, développer, assister et améliorer ses services, les restrictions sur l’entraînement de modèles passant par des accords entreprise séparés [14]. Je ne pointerais pas l’API publique vers un dépôt propriétaire sans avoir eu cette conversation par écrit.

Pourquoi GLM-5.2 s’est-il écrasé dans Claude Code ?

Personne en dehors de Z.ai ne le sait exactement, et c’est précisément le sujet. Les mêmes poids obtiennent 81 % sur Terminal-Bench dans le harness Terminus de Z.ai [6] et 72 % dans Claude Code [2]. Ce qui s’est effondré dans la mesure indépendante, c’est le système autour du modèle : appels d’outils, récupération, comportement du cache, adéquation aux conventions de l’agent. La mesure condamne une configuration, pas nécessairement les poids.

La ligne indépendante complète reste rude à lire : indice 43, DeepSWE 29 %, questions de code 29 %, 6,51 $ par tâche tentée et, à 25,1 minutes actives, l’exécution la plus lente de tout le tableau [2]. Une trajectoire qui brûle 25 minutes et 6,51 $ avec un catalogue à 1,40 $/4,40 $ est une trajectoire qui a passé le plus gros de son budget à tourner en rond.

Les chiffres de Z.ai sortent d’une machinerie plus amicale, et la fiche du modèle le dit sans détour : SWE-Bench Pro à 62,1 via OpenHands avec un prompt d’instructions sur mesure, DeepSWE avec des délais de deux heures en conteneurs isolés, Terminal-Bench via Terminus sur un budget de quatre heures [6]. Rien de tout cela n’est de la triche. C’est un fournisseur qui montre le modèle dans l’environnement pour lequel il l’a réglé. Ce n’est simplement pas une preuve sur l’agent que vous exécutez vraiment.

Il lui reste pourtant une voie rationnelle. À 753 milliards de paramètres sous MIT [6], GLM-5.2 est le candidat réaliste à l’auto-hébergement des deux, et à 1,40 $ le million de tokens, c’est un pilote sensé pour du travail de masse à vérification automatique : des codemods avec suites de tests, des candidats de migration, tout ce où un contrôle déterministe attrape les 57 % d’échecs et où l’échec ne coûte que du calcul. Dès qu’un humain relit les échecs, l’arithmétique se retourne.

Comment lire un classement de code

Les lancements de Kimi et GLM sont un cas d’école de lecture de benchmarks, alors voici la carte que j’utilise avant de croire un chiffre.

SignalCe que ça récompenseCe que ça ne peut pas vous dire
DeepSWE, 113 tâchesboucler des tâches d’ingénierie de bout en boutl’adéquation aux conventions de votre code
Terminal-Bench v2, 84 tâchesmener un shell à un état final vérifiéla compréhension d’un grand dépôt existant
SWE-Atlas Q&A, 124 tâchesrépondre à des questions techniques sur du codela capacité à faire atterrir le changement décrit
WebDev et Fullstack Arenace que les gens préfèrent en duelcorrection, tests, sécurité, maintenabilité
Fiches modèles des fournisseursle modèle sous son meilleur jour, chez luila comparabilité entre les lignes

Appliquez ensuite trois décotes. Un, le bruit d’infrastructure : l’équipe d’ingénierie d’Anthropic a mesuré un écart de 6 points de pourcentage sur Terminal-Bench 2.0 dû aux seules limites de ressources, vu les taux d’erreur d’infrastructure tomber de 5,8 % à 0,5 % en desserrant ces limites, et conclu que les écarts de classement sous environ 3 points méritent le scepticisme tant que les configurations ne sont pas documentées et alignées [15]. L’égalité de Kimi avec Sol medium tombe dans cette bande ; traitez-la comme une parité, pas comme la victoire de l’un ou l’autre.

Deux, l’asymétrie des notes de bas de page. Le tableau comparatif de Moonshot fait tourner chaque concurrent dans un harness différent, inclut des modèles de secours sur certaines lignes, et note son propre benchmark maison, où Fable 5 a enregistré 13 bascules de secours et un refus sur 80 tâches [12]. Rendons à César : Moonshot a imprimé ces notes lui-même. Les fils de lancement qui citaient le tableau, non.

Trois, la discipline de version. L’indice indépendant porte une version (v1.3 aujourd’hui) parce que son mélange de tâches change [8] ; un score d’une version n’est pas comparable à celui d’une autre, aussi proche que semble le nom. Toute comparaison qui n’annonce pas harness, effort, budget et version est une intuition déguisée en décimale.

Où ces modèles atterrissent dans mon routage

Tout ce qui précède change ce que j’essaierais en premier, pas ce sur quoi je standardiserais. Ma table de routage aujourd’hui, avec les deux nouveaux venus placés honnêtement :

Le travailMon choix aujourd’hui
Changements de routine avec de bons testsSonnet 5, à 2 $/10 $ jusqu’au 31 août 2026
Boucles d’agent rapides et travail de terminalGPT-5.6 à effort medium ou high
Travail sur un grand dépôt existantOpus 5 à effort medium ou high
Fullstack neuf et builds chargés en UIKimi K3, la voie que les votes d’arène soutiennent
Travail de masse à vérification automatiqueGLM-5.2 dans son harness natif, en pilote
Escalade quand tout le reste échoueFable 5, avec parcimonie

C’est la même arithmétique que m’a apprise la semaine de lancement d’Opus 5 : ce que vous achetez vraiment, ce sont des changements approuvés, et tout le reste, tokens compris, n’est qu’un intrant.

Deux résultats feraient bouger ces lignes. Une exécution de Kimi K3 dans un harness neutre (Claude Code ou Codex) qui tienne ce 61, ce qui prouverait que le score appartient au modèle et non à sa CLI à domicile. Et une mesure indépendante de GLM-5.2 dans son agent natif, faite par quelqu’un qui ne le vend pas. D’ici là, le résumé honnête tient toujours : les modèles sont réels, les prix relèvent du marketing, et les reçus sont ci-dessus.

Sources

  1. Codex vs Kimi Code CLI: coding agent comparisonArtificial Analysis
  2. Claude Code vs OpenCode: coding agent comparisonArtificial Analysis
  3. Fullstack Arena leaderboardArena · 2026-07-24
  4. WebDev Arena leaderboardArena · 2026-07-28
  5. Kimi K3Moonshot AI
  6. GLM-5.2 model cardZ.ai on Hugging Face
  7. GLM-5.2 API pricingZ.ai Docs
  8. Coding Agent IndexArtificial Analysis
  9. PricingClaude Platform Docs
  10. API pricingOpenAI Developers
  11. Kimi K3 quickstartKimi Platform Docs
  12. Kimi K3 model cardMoonshot AI on Hugging Face
  13. Kimi K3 licenseMoonshot AI on GitHub
  14. Model use agreementKimi Platform Docs
  15. Benchmark scores and infrastructure noiseAnthropic Engineering