Sorties

Claude va filigraner ses textes. La raison : l'UE

Les modèles Claude filigraneront leurs textes par le choix des mots, sans caractères cachés. J'explique pourquoi l'AI Act est en cause, pas la distillation.

Sur cette page
  1. Comment un filigrane survit-il au copier-coller sans caractères cachés ?
  2. Pourquoi Anthropic filigrane-t-elle ses textes ?
  3. Le filigrane de Claude vise-t-il vraiment les laboratoires chinois ?
    1. Pourquoi la théorie chinoise est plausible
    2. Pourquoi l’explication européenne me paraît plus solide
  4. Que prouve vraiment une détection positive ?
    1. Les textes courts, remaniés ou exacts peuvent échapper à la détection
    2. Une réécriture complète peut supprimer le filigrane
    3. La marque n’identifie ni l’utilisateur ni le propriétaire
  5. Qu’est-ce qui change pour le code, la prose et les fichiers Claude ?
    1. Les fichiers utilisent un certificat C2PA distinct

Le 14 août 2026, Anthropic a confirmé que les futurs modèles Claude intégreront un filigrane textuel, appelé « watermark » dans ses documents [1]. Contrairement à l’annonce virale, il ne repose pas sur des caractères cachés, mais sur les mots choisis par Claude. La raison déclarée n’est pas la copie par des laboratoires chinois : c’est l’AI Act européen [1].

Un visuel diffusé sur les réseaux sociaux affirmait que Claude allait désormais filigraner ses textes de manière invisible, afin qu’ils restent détectables après un copier-coller. La phrase est étonnamment juste, mais le mot « invisible » laisse croire que des données cachées sont ajoutées au résultat. L’explication technique d’Anthropic décrit un mécanisme très différent.

Comment un filigrane survit-il au copier-coller sans caractères cachés ?

Parce que le filigrane n’est pas attaché au texte : il est le texte. Claude marque sa sortie par les mots qu’il choisit aux endroits où plusieurs options se valent, et le centre d’aide de Claude en tire la conséquence sans détour : le filigrane fait partie du texte, il voyage donc avec lui quand on le copie-colle ailleurs [2].

Voici le mécanisme décrit par Anthropic. Un modèle de langage écrit en choisissant sans cesse le mot suivant. À de nombreux endroits, plusieurs mots conviendraient aussi bien. Le modèle tranche normalement au hasard entre ces options acceptables. Le filigrane conserve cette part d’aléatoire, mais en change la source : une clé secrète, associée à quelques mots précédents, détermine l’option retenue à la place d’un générateur de nombres aléatoires ordinaire [1]. Répété sur les nombreux choix de faible importance d’un passage, le procédé laisse un motif invisible pour le lecteur, mais vérifiable par quiconque détient la clé [1]. Rien n’est ajouté au texte, aucun caractère n’est caché et aucun token supplémentaire n’est nécessaire. Il n’augmente donc ni le coût de fonctionnement de Claude ni son prix d’utilisation [1].

Anthropic précise aussi que le filigrane ne pousse jamais Claude vers un mot qu’il n’aurait pas envisagé. L’annonce cite « nubilous », un synonyme anglais obscur de « nuageux » que Claude n’emploierait presque jamais. Le filigrane change uniquement la manière de choisir entre des mots plausibles [1].

L’approche est empruntée, et Anthropic le dit ouvertement. Le filigrane de Claude est une version de SynthID-Text, que Google DeepMind a publié dans la revue Nature en 2024, tandis que cette famille de méthodes remonte à une proposition de Scott Aaronson en 2022 [1]. La description de DeepMind rejoint celle d’Anthropic : SynthID ajuste les scores de probabilité des tokens candidats pendant la génération, puis le motif formé par ces scores à travers les choix de mots constitue le filigrane [3].

L’article de Nature est la raison pour laquelle je prends au sérieux l’absence annoncée de perte de qualité. Dans une expérience menée au sein du système de production Gemini sur près de 20 millions de réponses, le taux d’avis positifs du modèle filigrané différait de 0,01 % de celui du modèle sans filigrane. L’écart n’était que de 0,02 % pour les avis négatifs, et aucun des deux n’était statistiquement significatif [4]. Anthropic rapporte le même résultat dans ses propres tests internes : aucun effet mesuré sur le contenu, la créativité ou la lisibilité des textes de Claude [1].

La détection applique le même principe à l’envers. Avec la clé, un détecteur peut vérifier si un passage contient, bien plus souvent que ne l’expliquerait le hasard, les mots qu’une génération filigranée aurait privilégiés. Le signal s’accumule à chaque choix, donc la confiance dans l’intervention de Claude augmente avec la longueur du passage. Un texte très court contient trop peu de décisions pour permettre une conclusion [1]. L’affirmation sur le copier-coller est juste, car rien n’est attaché au texte et ne peut en être détaché. Reste à comprendre le calendrier.

Pourquoi Anthropic filigrane-t-elle ses textes ?

Pour se conformer à l’AI Act européen. Anthropic le dit directement [1]. L’article 50, paragraphe 2, du règlement (UE) 2024/1689, publié sur EUR-Lex, oblige les fournisseurs de systèmes d’IA générant du texte, de l’audio, des images ou de la vidéo à marquer leurs résultats dans un format lisible par machine et détectable comme contenu généré par IA [5].

Les dates expliquent le calendrier d’août. La FAQ de la Commission européenne sur l’article 50 précise que les obligations s’appliquent à partir du 2 août 2026, avec une seule exception, étroite : les systèmes déjà sur le marché avant cette date ont jusqu’au 2 décembre 2026 pour respecter l’obligation de marquage et de détection [6]. L’enjeu n’a rien de symbolique non plus, puisque les amendes peuvent atteindre 15 millions d’euros ou 3 % du chiffre d’affaires annuel mondial de l’exercice précédent [6].

Anthropic a aussi choisi la plus prévisible des deux voies de conformité. En juillet 2026, elle a signé le code de bonnes pratiques européen sur la transparence des contenus générés par IA, le Code of Practice on Transparency of AI-Generated Content [1], et la page que la Commission consacre au code explique pourquoi un fournisseur le ferait : les signataires peuvent s’appuyer sur les mesures du code pour démontrer leur conformité, tandis que les fournisseurs qui préfèrent leur propre approche doivent convaincre individuellement les autorités de surveillance du marché que leurs mesures suffisent [7]. Fin juillet 2026, environ 190 organisations avaient signé, et parmi les signataires notables cités par la Commission figurent Anthropic, Google, Meta, Microsoft, Mistral et OpenAI [8]. Quoi que deviennent les filigranes textuels, ils ne seront pas une particularité de Claude.

Qu’est-ce que l’UE cherche à empêcher, au juste ? Les lignes directrices de la Commission sur ces obligations de transparence décrivent le problème ainsi : des contenus d’IA devenus difficiles à distinguer des contenus humains, avec à la clé des risques de désinformation et de manipulation à grande échelle, de fraude, d’usurpation d’identité et de tromperie des consommateurs [9].

Un détail détonne pour une règle européenne : le filigrane est déployé dans le monde entier. L’explication d’Anthropic est opérationnelle plutôt que juridique. Elle ne dispose pas encore d’un moyen fiable de limiter le filigrane à une région, elle l’applique donc partout dès le lancement et dit continuer d’évaluer d’autres approches [1]. Le centre d’aide de Claude confirme la portée : le marquage s’applique aux sorties des modèles concernés partout où Claude est proposé [2]. Gardez ce détail en tête, il compte pour la section suivante.

Le filigrane de Claude vise-t-il vraiment les laboratoires chinois ?

Anthropic présente la conformité européenne comme l’objectif du filigrane, et je n’ai trouvé aucune déclaration publique qui le relie aux laboratoires chinois [1]. La théorie chinoise reste plausible sur le plan technique, mais elle repose sur une interprétation du calendrier et sur les recherches distinctes présentées ci-dessous. Ce n’est pas un fait documenté. Une entreprise peut néanmoins poursuivre plusieurs objectifs avec la même sortie.

Pourquoi la théorie chinoise est plausible

Cette théorie relie deux faits documentés. Anthropic a accusé des laboratoires chinois de distillation de modèles, c’est-à-dire d’entraîner un modèle à partir des réponses de Claude [10]. Un article publié sur arXiv et présenté à NeurIPS 2024 montre en outre que les traces d’un filigrane peuvent survivre dans le modèle ainsi entraîné [13]. L’interprétation consiste à voir dans le filigrane un moyen de repérer ces laboratoires, l’AI Act servant alors de justification commode. C’est aussi une autre lecture que certains ont faite du calendrier du visuel viral.

La guerre de la distillation est bien documentée. Le 23 février 2026, Anthropic a déclaré avoir repéré des campagnes à l’échelle industrielle menées par DeepSeek, Moonshot et MiniMax pour extraire les capacités de Claude : plus de 16 millions d’échanges avec Claude via environ 24 000 comptes frauduleux, ciblant le raisonnement agentique, l’utilisation d’outils et le code [10]. Reuters a rapporté ces accusations le même jour et précisé qu’aucune des trois entreprises n’avait répondu dans l’immédiat [11].

La campagne de juin était encore plus vaste. Le 24 juin 2026, Reuters a cité une lettre envoyée par Anthropic à deux sénateurs américains. Selon celle-ci, des opérateurs affiliés à Alibaba et à son laboratoire Qwen avaient produit plus de 28,8 millions d’échanges via près de 25 000 comptes frauduleux entre le 22 avril et le 5 juin 2026. Anthropic a présenté l’opération comme la plus grande attaque connue de ce type contre l’entreprise. Alibaba n’a pas répondu dans l’immédiat [12].

La recherche confirme aussi que la théorie est techniquement plausible. Dans un article présenté à NeurIPS 2024, Tom Sander et ses collègues ont montré que les filigranes rendent les modèles de langage « radioactifs » : un modèle affiné sur du texte filigrané hérite de traces faibles mais détectables du filigrane, et pour un modèle à poids ouverts ils ont pu prouver avec une confiance élevée l’entraînement sur des instructions filigranées, même quand 5 % seulement du texte d’entraînement portait une marque [13].

Une autre étude en montre les limites. Leyi Pan et ses collègues ont testé, dans un article accepté à ACL 2025, la capacité des filigranes à empêcher une distillation non autorisée. Ils ont trouvé deux moyens de les contourner : paraphraser les données d’entraînement avant la distillation, ou neutraliser le filigrane au moment de l’inférence après l’entraînement. Les deux méthodes ont entièrement supprimé les marques héritées. La seconde a conservé les capacités transférées avec peu de coût supplémentaire [14].

Les chercheurs ont depuis conçu des filigranes pour ce combat précis. En mai 2026, le laboratoire FAIR de Meta a publié TextSeal sur arXiv. Ce filigrane vise à rester détectable après une distillation et se positionne directement face à SynthID-Text. Ses auteurs comprennent les principaux chercheurs de l’article sur la radioactivité [15].

Pourquoi l’explication européenne me paraît plus solide

Les documents officiels désignent toujours la conformité européenne. Anthropic donne l’AI Act comme raison du filigrane [1], alors que son billet de février sur les attaques par distillation nomme d’autres défenses : classifieurs et empreintes comportementales du trafic API, détection des activités coordonnées entre comptes, vérification renforcée pour les types de comptes les plus détournés, et mesures destinées à rendre les réponses moins utiles à une distillation illicite [10].

Le déploiement mondial rend aussi une motivation centrée sur la distillation moins convaincante à mes yeux. Anthropic explique qu’elle applique le filigrane partout faute de moyen fiable pour le limiter à une région, et qu’elle cherche encore une telle solution [1]. Si repérer la distillation constituait l’objectif principal, chercher comment désactiver la marque hors d’Europe serait une décision produit étrange.

La chronologie pointe dans la même direction. L’annonce du filigrane est tombée douze jours après l’entrée en application de l’article 50 et bien avant l’échéance du 2 décembre 2026 pour les systèmes plus anciens ; elle a suivi les accusations contre DeepSeek de presque six mois, et la lettre sur Alibaba de sept semaines. Posez les deux calendriers côte à côte : l’explication par la conformité demande simplement moins d’hypothèses, chaque date du filigrane suit une obligation européenne, tandis que les dates de la distillation restent à des mois de distance.

  1. Accusations de distillation

    Anthropic nomme DeepSeek, Moonshot et MiniMax.

  2. Accusation visant Alibaba

    Reuters rapporte 28,8 millions d'échanges via des comptes frauduleux.

  3. Décompte du code de bonnes pratiques

    La Commission compte environ 190 signataires, dont Anthropic.

  4. L'article 50 s'applique

    Les nouveaux systèmes d'IA doivent marquer les contenus générés.

  5. Filigrane annoncé

    Les futurs modèles Claude marqueront leur texte.

  6. Échéance pour les anciens systèmes

    L'obligation de marquage atteint les systèmes antérieurs au 2 août 2026.

Figure 1. Le filigrane de Claude a été annoncé douze jours après l'entrée en application de l'article 50.

Mon interprétation est donc que la conformité européenne explique ce lancement, tandis que la détection de la distillation n’est qu’un effet secondaire possible. Les faits documentés vont dans ce sens : Anthropic combat la distillation avec des outils qu’elle nomme, et le filigrane de Claude n’a qu’un objectif déclaré, la conformité européenne. Si des réponses filigranées de Claude se retrouvent dans les données d’entraînement d’un tiers, les recherches sur la radioactivité suggèrent néanmoins qu’Anthropic pourrait disposer d’un moyen de détection, que cet effet ait été prévu ou non [13]. Reste à savoir ce qu’une telle détection prouverait réellement.

Que prouve vraiment une détection positive ?

Elle indique que Claude est probablement intervenu, sans en dire beaucoup plus. Selon Anthropic, sa clé estime la probabilité qu’un texte ait été en partie écrit par Claude. Une correspondance ne permet pas de distinguer un texte rédigé par Claude d’un texte fortement remanié par Claude. Elle ne confirme pas non plus une origine humaine et ne reconnaît pas l’IA d’une autre entreprise, qui utiliserait une autre clé ou une autre méthode [1].

Une marque peut même exagérer l’implication. Le centre d’aide de Claude note qu’une sortie peut porter une marque Claude alors que les idées, le texte ou les données de départ venaient d’ailleurs : une détection dit que Claude a traité les mots à un moment donné, pas d’où viennent les idées [2].

Les textes courts, remaniés ou exacts peuvent échapper à la détection

Un résultat négatif prouve encore moins. Le centre d’aide liste les situations où un contenu marqué cesse d’être détectable : le passage est très court, ou le texte a été fortement remanié, paraphrasé, traduit ou mélangé à d’autres écrits [2]. Le texte peut aussi venir d’un modèle Claude qui ne marque pas encore, car les modèles lancés avant le 2 août 2026 restent en phase de transition. Anthropic prévoit de leur ajouter le filigrane au cours des mois suivants [1] [2].

La traduction agit dans les deux sens. Une traduction produite par Claude reçoit un nouveau filigrane, puisque chaque mot résulte d’un choix de Claude [1]. À l’inverse, traduire un texte déjà marqué avec un autre outil remplace ses choix de mots et peut effacer le signal [2].

Le filigrane est aussi inégal par construction. Là où une seule sortie est correcte, il ne s’applique pas, parce que choisir un autre mot rendrait le texte faux. L’exemple d’Anthropic est la complétion de « Isaac Newton’s most famous work was called Principia », où « Mathematica » est la seule bonne réponse : le filigrane n’a aucune prise [1]. La même logique affaiblit la marque dans le code, qui doit surtout être exact ; les choix libres, comme la formulation des commentaires, peuvent le porter, mais Anthropic attend un effet négligeable sur le code produit [1]. La relecture se comporte de la même façon : quand Claude ne corrige que la grammaire et la ponctuation d’un texte humain, le filigrane ne peut vivre que dans la poignée de corrections, parfois trop peu pour être détecté [1]. Ce comportement rejoint d’ailleurs le texte de la loi, puisque l’article 50 exempte l’IA qui joue un rôle d’assistance pour l’édition standard ou ne modifie pas substantiellement les données d’entrée [5].

Une réécriture complète peut supprimer le filigrane

Personne en dehors d’Anthropic n’a encore testé la version de Claude, mais la famille SynthID-Text a déjà été mise à l’épreuve. En décembre 2024, le SRI Lab de l’ETH Zurich a évalué SynthID-Text sur un modèle Llama déployé localement. Il l’a jugé plus difficile à imiter que des méthodes comparables, mais plus facile à effacer : la paraphrase le supprimait plus aisément que d’autres filigranes de pointe, même avec de simples outils de paraphrase disponibles dans le commerce [16]. Anthropic reconnaît la limite : une retouche légère ne supprimera probablement pas tout le filigrane, mais une réécriture complète remplaçant chaque mot y parviendra. On peut alors se demander si le texte reste véritablement généré par IA [1].

La marque n’identifie ni l’utilisateur ni le propriétaire

Le filigrane ne contient aucune information vous concernant. Anthropic affirme que ni la marque ni sa clé ne permettent de retrouver des données sur l’utilisateur, son organisation ou ses conversations. Le marquage ne change rien non plus à la propriété du résultat ni aux droits de l’utilisateur [1]. Pour l’instant, personne en dehors d’Anthropic ne peut vérifier la marque. La détection exige sa clé, raison pour laquelle les détecteurs d’IA tiers emploient d’autres méthodes [1]. Au 17 août 2026, l’API de détection annoncée par Anthropic n’avait encore aucun détail public sur son fonctionnement, ses seuils ou ses conditions d’accès [1].

Qu’est-ce qui change pour le code, la prose et les fichiers Claude ?

Dans le travail courant, très peu de choses changent. Les modèles Claude concernés marquent la prose partout où ils fonctionnent, le code porte peu de signal lorsque l’exactitude laisse peu de choix de mots, et les fichiers pris en charge reçoivent un certificat C2PA distinct dans leurs métadonnées [1]. Le déploiement dépend des modèles, et non de chaque produit Claude [2].

Un modèle concerné marque donc son texte partout où il fonctionne : dans les applications Claude, l’API de la Claude Platform, Claude Code, Claude Cowork ou Claude Tag, ainsi que via AWS, Google Cloud et Microsoft Foundry [2]. Anthropic précise que certaines plateformes ou fonctionnalités peuvent ne pas accepter tous les types de marquage [2]. Les modèles lancés à partir du 2 août 2026 marquent leurs résultats dès leur sortie, tandis que les plus anciens recevront cette fonction au cours de la transition [2]. Il n’existe donc pas de date unique à laquelle tous les textes de Claude seront marqués, ni de moment unique où la détection deviendra fiable partout.

Pour les développeurs, les conséquences pratiques devraient rester minces. Le code doit surtout être exact, une sortie exacte n’est pas filigranée, et Anthropic attend un effet négligeable sur le code que Claude produit réellement ; dans une session de code, le signal vit surtout là où la formulation est libre, comme les commentaires [1]. C’est la prose ordinaire qui laisse au filigrane la place de travailler, et là, les tests internes d’Anthropic comme l’expérience Gemini de DeepMind disent que la qualité ne bouge pas de façon mesurable [1] [4].

Les fichiers utilisent un certificat C2PA distinct

Les fichiers suivent un autre mécanisme. Quand Claude produit un type pris en charge, comme un .png, .jpg ou .svg, il lui ajoute un certificat de contenu. Cette petite note signée cryptographiquement se trouve dans les métadonnées et indique que Claude a créé ou traité le fichier [1]. Elle utilise le format de la Coalition for Content Provenance and Authenticity, ou C2PA, un standard technique ouvert qui établit l’origine et l’historique des modifications d’un contenu numérique. Les fabricants d’appareils photo et les logiciels de retouche emploient le même format [1] [17]. Tout outil compatible C2PA peut lire le certificat, et Anthropic prévoit son propre outil de vérification [1].

Ma lecture des deux mécanismes : leurs points faibles sont exactement inverses. Le filigrane textuel survit au copier-coller parce qu’il est fait des mots eux-mêmes, et il ne s’estompe qu’à mesure que l’édition remplace ces mots [2]. Le certificat de fichier ne touche pas au contenu, mais il vit dans les métadonnées, qui se perdent à la première capture d’écran, conversion de format ou réenregistrement [2].

Propriété Filigrane textuelCertificat de fichier C2PA
Où vit le signal Dans le motif des choix de mots Dans des métadonnées signées jointes au fichier
Modifie le contenu lui-même Non Non
Survit au copier-coller Oui, la marque est le texte Seulement si les métadonnées suivent
Ce qui l'efface Une réécriture qui remplace les mots Captures d'écran, conversions de format, réenregistrements
Identifie l'utilisateur Non Non
Comment vérifier La clé d'Anthropic ; une API de détection est prévue Tout outil compatible C2PA
Figure 2. Filigrane textuel contre certificat de fichier C2PA : deux marques aux points faibles opposés.

Le filigrane de Claude n’est pas le détecteur d’IA que réclament les enseignants et les rédactions. Sans la clé, rien ne peut être vérifié et, même avec elle, le résultat reste une probabilité plutôt qu’un verdict [1]. Anthropic intègre plutôt une information de provenance directement dans ses modèles, parce qu’une loi l’exige et qu’environ 190 organisations ont adopté une manière commune de la fournir [8]. Ma prochaine étape est simple : lorsque l’API de détection paraîtra, je lui soumettrai mes articles publiés et une série de transcriptions Claude, puis je noterai comment les scores de confiance varient réellement selon la longueur du texte.

Sources

  1. How Claude's text watermark worksAnthropic · 2026-08-14
  2. How Claude marks AI-generated contentClaude Help Center · 2026-08-10
  3. Watermarking AI-generated text and video with SynthIDGoogle DeepMind · 2024-05-14
  4. Scalable watermarking for identifying large language model outputsNature · 2024-10-23
  5. Regulation (EU) 2024/1689 (Artificial Intelligence Act)EUR-Lex · 2024-06-13
  6. Transparency obligations under Article 50 of the AI ActEuropean Commission · 2026-07-24
  7. Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  8. Strong backing for the Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  9. Guidelines on transparency obligations for providers and deployers of certain AI systemsEuropean Commission · 2026-08-06
  10. Detecting and preventing distillation attacksAnthropic · 2026-02-23
  11. Chinese AI companies 'distilled' Claude to improve own models, Anthropic saysReuters · 2026-02-23
  12. Anthropic says Alibaba illicitly extracted Claude AI model capabilitiesReuters · 2026-06-24
  13. Watermarking Makes Language Models RadioactivearXiv · 2024-02-22
  14. Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?arXiv · 2025-02-17
  15. TextSeal: A Localized LLM Watermark for Provenance & Distillation ProtectionarXiv · 2026-05-12
  16. Probing Google DeepMind's SynthID-Text WatermarkETH Zurich SRI Lab · 2024-12-20
  17. Coalition for Content Provenance and Authenticity (C2PA)C2PA