Claude dirige 26 % de la R&D d’Anthropic. Qui vérifie ?
Anthropic dit que Claude dirige un quart de sa recherche en IA sous supervision humaine. Je regarde ce que ce chiffre mesure et qui vérifie les résultats.

Selon Anthropic, Claude dirigeait 26 % de ses travaux internes de recherche et développement en IA dans un état des lieux d’août 2026, sous supervision humaine. Le rapport du 17 septembre ne relève aucun travail entièrement autonome parmi les activités mesurées. J’en retiens qu’il faut mesurer séparément la conduite d’une recherche et la vérification de ses résultats. [1]
Que signifie « Claude dirige 26 % de la recherche » ?
Dans la classification d’Anthropic, Claude prend la direction du travail pendant qu’une personne le supervise. Ce n’est pas la même chose que mener une recherche sans intervention humaine. Un système peut décider comment exécuter une tâche tout en dépendant de quelqu’un pour juger si le résultat est utile. [1]
La discussion du 17 septembre sur r/singularity a repris le chiffre de 26 %. J’y vois une bonne raison de lire le rapport original, car le mot « diriger » suggère davantage que ce que la mesure exige. Un développeur peut imaginer une IA qui choisit un programme de recherche, exécute les expériences et décide de ce qu’il faut publier. Ce sont des responsabilités distinctes. [2]
Voici comment je les séparerais pour évaluer un agent dans mon travail. Il s’agit de ma grille de vérification, pas du barème officiel d’Anthropic.
| Responsabilité | Question à poser | Éléments que je demanderais |
|---|---|---|
| Choisir la tâche | Qui décide de ce qui mérite d’être fait ? | Un objectif et ses critères d’acceptation |
| Exécuter le travail | Qui choisit et exécute les étapes ? | Un relevé des actions et des résultats intermédiaires |
| Accepter le résultat | Qui vérifie que la conclusion tient ? | Une vérification à partir de preuves indépendantes |
Déléguer la ligne du milieu ne règle pas les deux autres. Cette distinction se retrouve dans mon analyse des difficultés de programmation et de supervision d’Opus 5 : produire un résultat conséquent et permettre de lui faire confiance facilement sont deux qualités différentes.
Comment le pourcentage a-t-il été mesuré ?
Anthropic décrit une estimation interne fondée sur des traces de travail et une classification assistée par des modèles. La pondération utilise le temps de travail humain comme approximation, en répartissant le poids hebdomadaire de chaque personne entre ses tâches. Elle permet de suivre l’évolution des pratiques, sans mesurer directement les heures économisées. [1]
Ce dénominateur change ma lecture du titre. « L’IA dirige une partie du travail » ne peut pas devenir automatiquement « il nous faut cette proportion de personnes en moins ». Pour défendre la seconde affirmation, je voudrais savoir ce que font les personnes après avoir délégué, combien de temps elles consacrent aux vérifications et si la qualité ou le volume des résultats acceptés a changé.
Prenons un ingénieur fictif qui délègue une expérience puis passe l’après-midi à vérifier la validité du protocole. L’agent peut avoir dirigé l’exécution, alors que l’ingénieur consacre toujours beaucoup de temps au projet. À l’inverse, ce même ingénieur pourrait vérifier plusieurs expériences utiles dans le temps auparavant nécessaire pour une seule. La classification d’une tâche ne suffit pas à distinguer ces situations.
J’utiliserais le rapport pour formuler les questions d’une évaluation plus précise, comme j’utilise les comparaisons de benchmarks d’IA pour décider de ce qui mérite un test. La suite utile consiste à relier délégation, résultats acceptés et effort de vérification. Sinon, une équipe peut mesurer davantage d’activité de l’IA sans savoir si son travail s’est amélioré.
Cela signifie-t-il que l’IA s’améliore de manière autonome ?
Dans un autre essai, When AI builds itself, Anthropic écrit que l’auto-amélioration récursive n’a pas encore été atteinte et n’est pas inévitable. L’entreprise cite aussi le choix des objectifs de recherche et le jugement des résultats parmi les domaines où l’expertise humaine reste importante. Le rapport décrit donc une organisation du travail de recherche, pas un cycle de développement entièrement autonome. [3]
L’auto-amélioration récursive demanderait davantage qu’une contribution de code au modèle suivant. Il faudrait montrer que les améliorations permettent au système d’en produire de nouvelles en dépendant moins des personnes. Une contribution utile ne démontre pas, à elle seule, l’existence de ce processus continu. J’examine cette même distinction dans le récit de Z.ai sur l’utilisation de GLM pour optimiser les logiciels d’inférence.
À mon sens, la pression immédiate porte sur la vérification. S’il devient plus facile de proposer une expérience, quelqu’un doit toujours déterminer si elle répond à la question. Une explication soignée d’un mauvais test peut compliquer cette tâche en donnant au relecteur davantage d’éléments plausibles à contrôler.
Je séparerais donc le mécanisme qui produit une réponse des preuves utilisées pour l’accepter. En développement logiciel, cela pourrait consister à vérifier le comportement à partir d’exigences et de tests qui n’ont pas été réécrits pour s’adapter au correctif. En recherche, il s’agit de demander quel résultat remettrait l’explication proposée en cause. Ce sont des choix d’évaluation, pas des conclusions supplémentaires du rapport d’Anthropic.
Que changerais-je dans un processus de programmation ?
Je préciserais les vérifications nécessaires avant de déléguer une tâche plus importante. L’agent a besoin d’un résultat attendu clair, mais la personne chargée de le valider doit aussi pouvoir en établir la justesse. Cette réponse au rapport me paraît plus utile qu’une simple augmentation du nombre d’agents.
Pour une investigation, je demanderais les preuves qui soutiennent la conclusion et les contradictions encore ouvertes. Pour une modification de code, je demanderais quel comportement a changé et comment il a été vérifié. J’évaluerais ensuite si la relecture demande moins d’effort que l’exécution directe du travail, en comptant le temps nécessaire pour corriger une erreur initialement convaincante.
La même question se pose dans la conception d’applications fondées sur l’OpenAI Agents API. Une application peut déléguer l’exécution tout en laissant l’acceptation à la personne responsable du résultat. Déterminer où intervient cette acceptation fait partie de la conception du produit.
Lors du prochain lancement de modèle, je regarderais ce qu’une personne peut vérifier après une longue exécution. Un modèle qui accomplit plus de travail est utile ; savoir sur quelles parties on peut compter détermine la quantité de travail que je peux réellement accepter.





