Claude avrà un watermark nel testo. Il motivo è l'UE
I modelli Claude marcheranno il testo con le parole che scelgono, senza caratteri nascosti. Il motivo è l'AI Act europeo, non la guerra della distillazione.
In questa pagina
- Come fa un watermark a sopravvivere al copia e incolla senza caratteri nascosti?
- Perché Anthropic lo sta facendo?
- Il watermark di Claude serve davvero a colpire i laboratori cinesi?
- Cosa dimostra davvero il rilevamento del watermark di Claude?
- Cosa cambia per il codice, la prosa e i file prodotti da Claude?
Anthropic ha confermato il 14 agosto 2026 che i futuri modelli Claude inseriranno nei testi un watermark, cioè una filigrana invisibile [1]. La notizia virale sbaglia due cose. Non si tratta di caratteri nascosti, ma dello schema delle parole scelte da Claude. E il motivo dichiarato non è fermare i laboratori cinesi. È l’AI Act europeo [1].
Sui social ha iniziato a circolare una grafica con questa affermazione: «Claude applicherà un watermark invisibile al testo generato dall’AI, che resterà rilevabile anche dopo il copia e incolla». La frase è sorprendentemente precisa, ma «invisibile» fa pensare a dati nascosti aggiunti all’output. La spiegazione tecnica di Anthropic descrive un meccanismo molto diverso.
Come fa un watermark a sopravvivere al copia e incolla senza caratteri nascosti?
Perché il watermark non è attaccato al testo. È il testo. Claude marca il proprio output attraverso le parole che sceglie nei punti in cui più opzioni funzionerebbero ugualmente bene, e il Claude Help Center spiega la conseguenza senza giri di parole: il watermark fa parte del testo, quindi viaggia insieme a esso quando viene copiato e incollato altrove [2].
Ecco il meccanismo come lo descrive Anthropic. Un modello linguistico scrive scegliendo una parola dopo l’altra, e in molte posizioni la scelta conta poco perché diverse parole andrebbero bene comunque. Normalmente il modello sceglie a caso tra quelle accettabili. Il watermark mantiene le scelte casuali ma cambia da dove arriva la casualità: al posto di un generatore di numeri casuali qualsiasi, il modello usa una chiave segreta insieme ad alcune delle parole precedenti per decidere quale opzione prendere [1]. Ripetuto su tutte le scelte di poco conto di un brano, questo procedimento lascia uno schema che nessun lettore può vedere, ma che chiunque abbia la chiave può verificare [1]. Non viene aggiunto nulla al testo, non ci sono caratteri nascosti e il watermark non richiede token extra, quindi non aumenta il costo di eseguire o usare Claude [1].
Anthropic è altrettanto chiara su cosa il watermark non fa: non spinge mai Claude verso una parola che non avrebbe comunque preso in considerazione. L’esempio nell’annuncio è «nubilous», un sinonimo inglese raro di «nuvoloso» che Claude non userebbe quasi mai; il watermark cambia solo il modo in cui viene fatta la scelta tra parole plausibili [1].
Anthropic dichiara apertamente di aver ripreso l’approccio. Il watermark di Claude è una versione di SynthID-Text, che Google DeepMind ha pubblicato sulla rivista Nature nel 2024, e questa famiglia di metodi risale a una proposta di Scott Aaronson del 2022 [1]. La descrizione di DeepMind coincide con quella di Anthropic: SynthID regola i punteggi di probabilità dei token candidati durante la generazione, e lo schema finale di quei punteggi lungo le scelte del modello è il watermark [3].
Il paper su Nature è il motivo per cui prendo sul serio l’affermazione che la qualità non ne risente. In un esperimento dal vivo nel sistema di produzione di Gemini, su quasi 20 milioni di risposte, il tasso di valutazioni positive del modello con watermark differiva dello 0,01% rispetto al modello senza watermark, mentre quello delle valutazioni negative differiva dello 0,02%. Nessuna delle due differenze era statisticamente significativa [4]. Anthropic riporta lo stesso risultato dai propri test interni: nessun impatto misurato sul contenuto, sulla creatività o sulla leggibilità dei testi di Claude [1].
Il rilevamento usa lo stesso trucco al contrario. Con la chiave, un rilevatore può controllare se un brano contiene le scelte di parole che una generazione con watermark avrebbe preferito, molto più spesso di quanto il caso possa spiegare. Il segnale si accumula scelta dopo scelta, quindi più il brano è lungo, più il rilevatore può essere sicuro del coinvolgimento di Claude, mentre un brano molto corto contiene troppo poche decisioni per dire qualcosa [1]. La grafica virale ha ragione sul copia e incolla, perché nel testo non c’è nulla che possa essere rimosso. Per capire la tempistica, invece, bisogna guardare all’AI Act.
Perché Anthropic lo sta facendo?
Per rispettare l’AI Act europeo. Anthropic lo dice direttamente [1]. L’articolo 50(2) di quella legge, il Regolamento (UE) 2024/1689, impone ai fornitori di sistemi di AI che generano testo, audio, immagini o video di marcare gli output in un formato leggibile dalle macchine, riconoscibile come generato artificialmente [5].
Le date spiegano la tempistica di agosto. Le FAQ della Commissione europea sull’articolo 50 precisano che gli obblighi si applicano dal 2 agosto 2026, con un’unica proroga: i sistemi già sul mercato prima di quella data hanno tempo fino al 2 dicembre 2026 per rispettare l’obbligo di marcatura e rilevamento [6]. E la posta in gioco non è simbolica, perché le multe possono arrivare a 15 milioni di euro o al 3% del fatturato mondiale totale dell’esercizio precedente [6].
Anthropic ha anche scelto la più prevedibile delle due strade verso la conformità. A luglio 2026 ha firmato il Codice di buone pratiche europeo sulla trasparenza dei contenuti generati dall’AI [1], e la pagina della Commissione sul codice spiega perché a un fornitore conviene: i firmatari possono appoggiarsi alle misure del codice per dimostrare la conformità, mentre chi sceglie una strada propria deve convincere una per una le autorità di vigilanza del mercato che le sue misure sono adeguate [7]. A fine luglio 2026 avevano firmato circa 190 organizzazioni, e tra i firmatari di rilievo la Commissione cita Anthropic, Google, Meta, Microsoft, Mistral e OpenAI [8]. Il watermark testuale non sarà una caratteristica esclusiva di Claude.
Cosa sta cercando di prevenire l’UE, in concreto? Le linee guida della Commissione su questi obblighi di trasparenza descrivono il problema così: i contenuti AI stanno diventando difficili da distinguere da quelli umani, e questo alza i rischi di disinformazione e manipolazione su larga scala, frode, furto d’identità e inganno dei consumatori [9].
C’è un dettaglio che stona, per una norma europea: il watermark arriva in tutto il mondo. La spiegazione di Anthropic è operativa, non legale. Non ha ancora un modo affidabile per limitare il watermark su base geografica, quindi al lancio lo applica ovunque e dice che continuerà a valutare altre soluzioni [1]. Il Claude Help Center conferma la portata: la marcatura riguarda l’output dei modelli supportati ovunque Claude venga offerto [2]. Tieni a mente questo dettaglio, perché conta per la prossima sezione.
Il watermark di Claude serve davvero a colpire i laboratori cinesi?
Anthropic indica la conformità europea come scopo del watermark, e non ho trovato dichiarazioni pubbliche che lo colleghino ai laboratori cinesi [1]. La teoria cinese è tecnicamente plausibile, ma resta una lettura della tempistica e delle ricerche riportate qui sotto, non un fatto documentato. Una stessa release può comunque avere più di un motivo.
Perché la teoria cinese è plausibile
La teoria unisce due fatti documentati. Anthropic ha accusato alcuni laboratori cinesi di distillazione dei modelli, cioè di addestrare un modello sull’output di Claude [10], mentre un paper su arXiv presentato a NeurIPS 2024 ha mostrato che le tracce di un watermark possono sopravvivere nel modello addestrato [13]. Da qui nasce l’ipotesi: il vero scopo sarebbe individuare quei laboratori, mentre l’AI Act offrirebbe una copertura comoda. È anche l’altra interpretazione nata dalla tempistica della grafica virale.
Le accuse sulla distillazione sono ben documentate. Il 23 febbraio 2026 Anthropic ha dichiarato di aver individuato campagne su scala industriale di DeepSeek, Moonshot e MiniMax per estrarre le capacità di Claude: più di 16 milioni di scambi con Claude attraverso circa 24.000 account fraudolenti, mirati al ragionamento agentico, all’uso di strumenti e al coding di Claude [10]. Reuters ha riportato le accuse lo stesso giorno, notando che nessuna delle tre aziende ha risposto nell’immediato [11].
Il caso di giugno era più grande. Il 24 giugno 2026 Reuters ha riferito, citando una lettera di Anthropic a due senatori statunitensi, che operatori legati ad Alibaba e al suo laboratorio Qwen avevano generato più di 28,8 milioni di scambi tramite quasi 25.000 account fraudolenti tra il 22 aprile e il 5 giugno 2026. Anthropic lo ha definito il più grande attacco noto di questo tipo contro l’azienda. Nemmeno Alibaba ha risposto subito [12].
La ricerca sui watermark sostiene la premessa tecnica della teoria. In un paper presentato a NeurIPS 2024, Tom Sander e colleghi hanno mostrato che i watermark rendono i modelli linguistici «radioattivi»: un modello sottoposto a fine-tuning su testo con watermark eredita tracce deboli ma rilevabili. Nel caso di un modello a pesi aperti, i ricercatori sono riusciti a dimostrare con alta confidenza l’addestramento su istruzioni marcate anche quando solo il 5% del testo di addestramento portava il segno [13].
Altri studi ne mostrano i limiti. Un paper su arXiv di Leyi Pan e colleghi, accettato ad ACL 2025, ha verificato se i watermark riescono a impedire la distillazione non autorizzata e ha trovato due modi per aggirarli: parafrasare i dati di addestramento prima della distillazione oppure neutralizzare il watermark in fase di inferenza dopo l’addestramento. Entrambi eliminano in modo efficace i segni ereditati. Il secondo metodo conserva anche la capacità trasferita e comporta un costo aggiuntivo contenuto [14].
Da allora i ricercatori hanno costruito watermark pensati proprio per questo scontro. A maggio 2026 il laboratorio FAIR di Meta ha pubblicato su arXiv TextSeal, un watermark progettato per restare rilevabile attraverso la distillazione e presentato come alternativa diretta a SynthID-Text. Tra gli autori ci sono i principali ricercatori del paper sulla radioattività [15].
Perché continuo a ritenere più convincente la spiegazione europea
I documenti ufficiali continuano a indicare la conformità europea. Anthropic presenta l’AI Act come motivo del watermark [1], mentre nel post di febbraio sugli attacchi di distillazione elenca un insieme separato di difese: classificatori e fingerprinting comportamentale del traffico API, rilevamento delle attività coordinate tra account, verifiche più severe per i tipi di account più abusati e contromisure pensate per rendere gli output meno utili alla distillazione illecita [10].
Il rollout mondiale rende meno convincente l’idea che la distillazione sia il motivo principale. Anthropic dice di applicare il watermark ovunque perché non ha ancora un modo affidabile per limitarlo su base geografica, e continua a cercarne uno [1]. Se l’obiettivo principale fosse scoprire la distillazione, studiare come disattivare il watermark fuori dall’Europa sarebbe una scelta di prodotto strana.
Anche il calendario punta nella stessa direzione. L’annuncio del watermark è arrivato dodici giorni dopo l’entrata in applicazione dell’articolo 50 e con largo anticipo sulla scadenza del 2 dicembre 2026 per i sistemi più vecchi. Ha seguito le accuse a DeepSeek di quasi sei mesi e la lettera su Alibaba di sette settimane. Affiancando i due calendari, la spiegazione della conformità richiede meno ipotesi: ogni data legata al watermark segue un obbligo europeo, mentre le accuse di distillazione risalgono a settimane o mesi prima.
-
Accuse di distillazione
Anthropic nomina DeepSeek, Moonshot e MiniMax.
-
Accusa ad Alibaba
Reuters riporta 28,8 milioni di scambi tramite account fraudolenti.
-
Firme del Codice di buone pratiche
La Commissione conta circa 190 firmatari, Anthropic inclusa.
-
Si applica l'articolo 50
I nuovi sistemi di AI devono marcare i contenuti generati.
-
Annuncio del watermark
I futuri modelli Claude marcheranno il loro testo.
-
Scadenza per i sistemi più vecchi
L'obbligo di marcatura raggiunge i sistemi precedenti al 2 agosto 2026.
La mia lettura è che questa release si spieghi con la conformità europea, mentre il rilevamento della distillazione sia un possibile effetto collaterale. I fatti documentati sostengono questa distinzione: Anthropic combatte la distillazione con strumenti che ha nominato, mentre per il watermark di Claude dichiara un solo scopo, la conformità europea. Se l’output marcato di Claude finisse nei dati di addestramento di qualcuno, la ricerca sulla radioattività suggerisce che Anthropic avrebbe comunque una possibilità di rilevarlo, che fosse previsto o meno [13]. Resta da capire che cosa dimostrerebbe davvero un simile rilevamento.
Cosa dimostra davvero il rilevamento del watermark di Claude?
Che Claude è stato probabilmente coinvolto, e poco altro. Anthropic precisa che la sua chiave risponde a una sola domanda: la probabilità che un testo sia stato scritto in parte da Claude. Una corrispondenza non può separare «l’ha scritto Claude» da «Claude l’ha pesantemente modificato», non può confermare che un testo sia opera di un umano e non può riconoscere l’AI di un’altra azienda, che userebbe una chiave o un metodo diversi [1].
Un segno può perfino sopravvalutare il coinvolgimento. Il Claude Help Center osserva che l’output può portare un segno di Claude anche quando le idee, il testo o i dati di partenza vengono da un’altra fonte, quindi un rilevamento dice che Claude ha maneggiato quelle parole a un certo punto, non da dove arrivano le idee [2].
Testi brevi, modificati o esatti possono sfuggire al rilevamento
Un risultato negativo dimostra ancora meno. Il Claude Help Center elenca i casi in cui un contenuto marcato smette di essere rilevabile: il brano è molto corto, oppure il testo è stato pesantemente modificato, parafrasato, tradotto o mescolato ad altra scrittura [2]. Il testo può anche provenire da un modello Claude che non applica ancora il watermark, perché i modelli lanciati prima del 2 agosto 2026 sono ancora in transizione. Anthropic dice che per quei modelli la funzione arriverà nei prossimi mesi [1] [2].
La traduzione funziona in entrambe le direzioni. Una traduzione prodotta da Claude porta un nuovo watermark, perché ogni parola è stata scelta da Claude [1]. Se invece un altro traduttore elabora un testo già marcato, sostituisce quelle scelte di parole e può cancellare il segnale [2].
Per come è progettato, il watermark non compare con la stessa intensità in ogni testo. Dove esiste un solo output corretto non viene applicato, perché scegliere una parola diversa renderebbe il testo sbagliato. L’esempio di Anthropic è il completamento di «l’opera più famosa di Isaac Newton si intitola Principia», dove «Mathematica» è l’unica risposta giusta, quindi il watermark non ha nulla su cui agire [1]. La stessa logica assottiglia il segno nel codice, che per lo più deve essere esatto; le scelte libere, come la formulazione dei commenti, possono portarlo, ma Anthropic prevede un effetto trascurabile sul codice vero e proprio [1]. La correzione di bozze si comporta allo stesso modo: quando Claude sistema solo grammatica e punteggiatura in un testo umano, il watermark può vivere solo in quella manciata di correzioni, che possono essere troppo poche per lasciare un segnale misurabile [1]. Questo comportamento si allinea con la legge, perché l’articolo 50 esenta l’AI che svolge una funzione di assistenza nell’editing standard o che non altera in modo sostanziale l’input [5].
Una riscrittura completa può eliminare il watermark
Nessuno fuori da Anthropic ha ancora testato la versione di Claude, ma la famiglia SynthID-Text è stata messa alla prova. A dicembre 2024 il laboratorio SRI dell’ETH di Zurigo ha valutato SynthID-Text su un modello Llama installato in locale e l’ha trovato più difficile da falsificare rispetto a sistemi comparabili, ma più facile da ripulire. Una parafrasi lo rimuoveva più facilmente rispetto ad altri watermark avanzati, anche quando l’attaccante usava soltanto strumenti di parafrasi pronti all’uso [16]. Anthropic riconosce lo stesso limite: una modifica leggera probabilmente non elimina del tutto il watermark, mentre una riscrittura completa in cui ogni parola viene sostituita sì. A quel punto, però, è discutibile che il testo sia ancora generato dall’AI [1].
Il segno non identifica né l’utente né il proprietario
Il watermark non contiene nulla su di te. Anthropic dichiara che né il watermark né la sua chiave permettono di ricostruire informazioni sull’utente, sulla sua organizzazione o sulle sue conversazioni. Inoltre, un segno non cambia nulla sulla proprietà dell’output o sui diritti di chi lo usa [1]. Per ora nessuno fuori da Anthropic può controllarlo: il rilevamento richiede la chiave, ed è per questo che i rilevatori di AI di terze parti usano metodi diversi [1]. L’API di rilevamento che Anthropic dice di voler offrire presto non aveva, al 17 agosto 2026, dettagli pubblici su implementazione, soglie o modalità di accesso [1].
Cosa cambia per il codice, la prosa e i file prodotti da Claude?
Nel lavoro quotidiano cambia molto poco. I modelli Claude supportati marcano la prosa ovunque vengano eseguiti, il codice porta poco segnale quando l’esattezza lascia poche parole tra cui scegliere, e i file supportati ricevono una credenziale C2PA separata nei metadati [1]. Il rollout segue i modelli, non i singoli prodotti Claude [2].
Questo significa che un modello supportato marca il testo ovunque venga eseguito: nelle app Claude, nell’API della Claude Platform, in Claude Code, Claude Cowork o Claude Tag, oppure tramite AWS, Google Cloud e Microsoft Foundry [2]. Anthropic precisa che alcune piattaforme o funzioni potrebbero non supportare ogni tipo di marcatura [2]. I modelli lanciati dal 2 agosto 2026 in poi applicano il watermark fin dal lancio, mentre quelli più vecchi ricevono la funzione man mano che procede la transizione [2]. Non esiste un giorno unico in cui tutto il testo di Claude diventa marcato, e quindi nemmeno un giorno unico in cui il rilevamento diventa affidabile ovunque.
Per chi programma, l’impatto concreto dovrebbe restare minimo. Il codice per lo più deve essere esatto, l’output esatto non viene marcato, e Anthropic prevede un effetto trascurabile sul codice che Claude produce davvero. In una sessione di coding il segnale si concentra dove la formulazione è libera, per esempio nei commenti [1]. La prosa ordinaria è il terreno dove il watermark ha spazio per lavorare, e lì sia i test interni di Anthropic sia l’esperimento di DeepMind su Gemini dicono che la qualità non cambia in modo misurabile [1] [4].
I file usano una credenziale C2PA separata
I file ricevono un trattamento del tutto diverso. Quando Claude produce un tipo di file supportato, come .png, .jpg o .svg, allega una content credential: una piccola nota firmata crittograficamente nei metadati del file, che registra che il file è stato creato o elaborato con Claude [1]. Il formato è C2PA, della Coalition for Content Provenance and Authenticity, uno standard tecnico aperto per stabilire l’origine e la storia delle modifiche dei contenuti digitali. È lo stesso formato usato dai produttori di fotocamere e dai software di fotoritocco [1] [17]. Qualsiasi strumento compatibile con C2PA può leggere la credenziale, e Anthropic dice che fornirà un proprio strumento di verifica [1].
Secondo me, i due meccanismi hanno punti deboli opposti. Il watermark testuale sopravvive al copia e incolla perché è fatto delle parole stesse, e sbiadisce solo man mano che quelle parole vengono sostituite dalle modifiche [2]. La credenziale del file lascia intatto il contenuto ma vive nei metadati, che si perdono con uno screenshot, una conversione di formato o un nuovo salvataggio [2].
| Proprietà | Watermark testuale | Credenziale C2PA del file |
|---|---|---|
| Dove vive il segnale | Nello schema delle scelte di parole | Nei metadati firmati allegati al file |
| Modifica il contenuto | No | No |
| Sopravvive al copia e incolla | Sì, il segno è il testo | Solo se i metadati viaggiano insieme al file |
| Cosa lo rimuove | Una riscrittura che sostituisce le parole | Screenshot, conversioni di formato, nuovi salvataggi |
| Identifica l'utente | No | No |
| Come si verifica | La chiave di Anthropic; un'API di rilevamento è in arrivo | Qualsiasi strumento compatibile con C2PA |
Quello che arriva qui non è il rilevatore di AI che insegnanti e redattori continuano a chiedere, e Anthropic non finge il contrario: senza la chiave non c’è nulla da controllare, e anche con la chiave la risposta è una probabilità, non un verdetto [1]. Quello che arriva è la provenienza integrata nei modelli stessi, perché una legge la richiede e circa 190 organizzazioni si sono accordate su come fornirla [8]. Il mio prossimo passo è concreto: quando l’API di rilevamento uscirà, ci farò passare i miei articoli pubblicati e una pila di trascrizioni di Claude, e annoterò cosa fanno davvero i punteggi di confidenza alle diverse lunghezze.
Fonti
- How Claude's text watermark works
- How Claude marks AI-generated content
- Watermarking AI-generated text and video with SynthID
- Scalable watermarking for identifying large language model outputs
- Regulation (EU) 2024/1689 (Artificial Intelligence Act)
- Transparency obligations under Article 50 of the AI Act
- Code of Practice on Transparency of AI-generated Content
- Strong backing for the Code of Practice on Transparency of AI-generated Content
- Guidelines on transparency obligations for providers and deployers of certain AI systems
- Detecting and preventing distillation attacks
- Chinese AI companies 'distilled' Claude to improve own models, Anthropic says
- Anthropic says Alibaba illicitly extracted Claude AI model capabilities
- Watermarking Makes Language Models Radioactive
- Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
- TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
- Probing Google DeepMind's SynthID-Text Watermark
- Coalition for Content Provenance and Authenticity (C2PA)