Claude pondrá marcas de agua en sus textos. La razón es la UE
Claude marcará sus textos con las palabras que elige, no con caracteres ocultos. La razón es la Ley de IA de la UE, no la guerra por la destilación.
En esta página
Anthropic confirmó el 14 de agosto de 2026 que los próximos modelos Claude llevarán una marca de agua («watermark» en la documentación inglesa) [1]. La noticia viral se equivoca en dos cosas: la marca vive en las palabras que Claude elige, no en caracteres ocultos, y la razón declarada es la Ley de IA de la UE, no los laboratorios chinos [1].
Un gráfico difundió esta afirmación en las redes sociales: «Claude ahora marcará de forma invisible el texto generado por IA para que pueda detectarse después de copiarlo y pegarlo». La frase es sorprendentemente precisa, pero «de forma invisible» suena a datos ocultos añadidos a la salida. La explicación técnica de Anthropic describe algo muy distinto.
¿Cómo sobrevive una marca de agua al copiar y pegar sin caracteres ocultos?
Porque la marca de agua no va pegada al texto. Es el texto. Claude marca su salida mediante las palabras que elige cuando varias opciones funcionarían igual de bien. El centro de ayuda de Claude explica la consecuencia de forma directa: la marca forma parte del texto, así que viaja con él cuando alguien lo copia y lo pega en otro sitio [2].
Este es el mecanismo que describe Anthropic. Un modelo de lenguaje escribe eligiendo una y otra vez la siguiente palabra. En muchas posiciones la elección apenas importa, porque varias palabras encajarían. Normalmente, el modelo escoge al azar entre esas palabras aceptables. La marca de agua conserva el azar, pero cambia su origen: en vez de usar un generador cualquiera de números aleatorios, el modelo combina una clave secreta con algunas de las palabras anteriores para decidir qué opción escoger [1]. Al repetirlo en las muchas decisiones de poca importancia de un pasaje, queda un patrón que ningún lector puede ver, pero que cualquiera con la clave puede comprobar [1]. No se añade nada al texto, no hay caracteres ocultos y la marca no necesita tokens extra, así que no encarece el uso ni el funcionamiento de Claude [1].
Anthropic es igual de claro sobre lo que la marca de agua no hace: nunca empuja a Claude hacia una palabra que no habría considerado de todos modos. El ejemplo del anuncio es «nubilous», un sinónimo inglés rebuscado de «nublado» que Claude casi nunca usaría; la marca solo cambia cómo se resuelve la elección entre palabras plausibles [1].
Claude no inventó el método, y Anthropic lo reconoce abiertamente. La marca de agua de Claude es una versión de SynthID-Text, que Google DeepMind publicó en la revista Nature en 2024, y esta familia de técnicas se remonta a una propuesta de Scott Aaronson de 2022 [1]. La descripción de DeepMind coincide con la de Anthropic: SynthID ajusta las puntuaciones de probabilidad de los tokens candidatos durante la generación, y el patrón final de puntuaciones entre las palabras elegidas por el modelo forma la marca de agua [3].
El artículo de Nature es la razón por la que me tomo en serio la afirmación de que no hay pérdida de calidad. En un experimento en vivo dentro del sistema de producción de Gemini, con cerca de 20 millones de respuestas, la tasa de valoraciones positivas del modelo marcado difirió de la del modelo sin marcar en un 0,01 % y la de valoraciones negativas en un 0,02 %. Ninguna de las dos diferencias tenía significación estadística [4]. Anthropic cuenta lo mismo de sus pruebas internas: no midió ningún impacto en el contenido, la creatividad ni la legibilidad del texto de Claude [1].
La detección aplica el mismo mecanismo al revés. Con la clave, un detector puede comprobar si un pasaje contiene las palabras que una generación marcada habría preferido con mucha más frecuencia de la que explicaría el azar. La señal se acumula elección a elección, así que la confianza en la participación de Claude crece con la longitud del pasaje. Uno muy corto contiene demasiado pocas decisiones para afirmar algo [1]. La frase sobre copiar y pegar es correcta porque no hay nada adjunto al texto que se pueda eliminar. El momento del anuncio requiere otra explicación.
¿Por qué lo hace Anthropic?
Para cumplir la Ley de IA de la UE. Anthropic lo dice de forma directa [1]. El artículo 50(2) del Reglamento (UE) 2024/1689, publicado por EUR-Lex, obliga a los proveedores de sistemas de IA que generan texto, audio, imágenes o vídeo a marcar sus salidas en un formato legible por máquina que permita detectarlas como contenido generado por IA [5].
Las fechas explican el momento del anuncio. Las preguntas frecuentes de la Comisión Europea sobre el artículo 50 indican que las obligaciones se aplican desde el 2 de agosto de 2026, con un único periodo de gracia muy limitado: los sistemas que ya estaban en el mercado antes de esa fecha tienen hasta el 2 de diciembre de 2026 para cumplir la obligación de marcado y detección [6]. Lo que hay en juego tampoco es simbólico, porque las multas pueden llegar a los 15 millones de euros o al 3 % de la facturación mundial total del ejercicio anterior [6].
Anthropic también eligió la más predecible de las dos vías para cumplir. En julio de 2026 firmó el Código de buenas prácticas de la UE sobre transparencia del contenido generado por IA [1]. La página de la Comisión sobre el código explica el incentivo: los firmantes pueden apoyarse en sus medidas para demostrar que cumplen, mientras que los proveedores que elijan su propio método deben convencer por separado a las autoridades de vigilancia del mercado de que sus medidas son suficientes [7]. A finales de julio de 2026 lo habían firmado unas 190 organizaciones. Entre los proveedores destacados de IA, la Comisión menciona a Anthropic, Google, Meta, Microsoft, Mistral y OpenAI [8]. Las marcas de agua de texto no serán algo exclusivo de Claude.
¿Y qué intenta evitar la UE exactamente? Las directrices de la Comisión sobre estas obligaciones de transparencia describen el problema así: el contenido de IA se está volviendo difícil de distinguir del contenido humano, y eso eleva el riesgo de desinformación y manipulación a gran escala, fraude, suplantación de identidad y engaño al consumidor [9].
Un detalle parece extraño para una norma europea: la marca de agua se despliega en todo el mundo. La explicación de Anthropic es operativa, no legal. Todavía no tiene una forma duradera de limitar la marca por región, así que la aplica globalmente desde el lanzamiento y dice que seguirá evaluando otras opciones [1]. El centro de ayuda de Claude confirma el alcance: el marcado se aplica a la salida de los modelos compatibles allá donde se ofrezca Claude [2]. Guarda ese detalle, porque importa en la siguiente sección.
¿La marca de agua de Claude está dirigida a laboratorios chinos?
Anthropic presenta el cumplimiento de la UE como el propósito de la marca, y no encontré ninguna declaración pública que la relacione con laboratorios chinos [1]. La teoría china es técnicamente plausible, pero sigue siendo una interpretación del calendario y de la investigación que aparece más abajo, no un hecho documentado. Una empresa también puede tener más de una razón para el mismo lanzamiento.
Por qué la teoría china es plausible
La teoría conecta dos hechos documentados. Anthropic acusó a laboratorios chinos de destilación de modelos (model distillation), es decir, de entrenar un modelo con las salidas de Claude [10]. Además, un artículo publicado en arXiv y presentado en NeurIPS 2024 concluyó que los rastros de una marca de agua pueden pasar al modelo entrenado [13]. De ahí nace la interpretación de que el propósito real es detectar a esos laboratorios y que la Ley de IA de la UE ofrece una explicación conveniente. Esa fue también la segunda lectura que mucha gente hizo del momento en que apareció el gráfico viral.
La guerra de la destilación está bien documentada. El 23 de febrero de 2026 Anthropic dijo que había identificado campañas a escala industrial de DeepSeek, Moonshot y MiniMax para extraer las capacidades de Claude: más de 16 millones de intercambios con Claude a través de unas 24.000 cuentas fraudulentas, dirigidos al razonamiento agéntico, el uso de herramientas y la programación [10]. Reuters cubrió las acusaciones ese mismo día y señaló que ninguna de las tres empresas respondió de inmediato [11].
La campaña de junio fue mayor. El 24 de junio de 2026, Reuters informó, citando una carta que Anthropic envió a dos senadores estadounidenses, de que operadores vinculados a Alibaba y a su laboratorio Qwen generaron más de 28,8 millones de intercambios mediante casi 25.000 cuentas fraudulentas entre el 22 de abril y el 5 de junio de 2026. Anthropic lo describió como el mayor ataque conocido de este tipo contra la empresa. Alibaba tampoco respondió de inmediato [12].
La investigación sobre marcas de agua respalda la base técnica de la teoría. En un artículo presentado en NeurIPS 2024, Tom Sander y sus colegas demostraron que las marcas vuelven «radiactivos» a los modelos de lenguaje: un modelo ajustado con texto marcado hereda rastros débiles pero detectables. En el caso de un modelo de pesos abiertos, pudieron demostrar con alta confianza que se había entrenado con instrucciones marcadas incluso cuando solo el 5 % del texto de entrenamiento llevaba una marca [13].
Otra investigación muestra los límites. Un artículo de Leyi Pan y sus colegas, aceptado en ACL 2025, probó si las marcas de agua podían impedir la destilación no autorizada de conocimiento y encontró dos formas de sortearlas: parafrasear los datos de entrenamiento antes de destilar y neutralizar la marca durante la inferencia, después del entrenamiento. Ambos métodos eliminaron los rastros heredados, y el segundo conservó la capacidad transferida con poca sobrecarga [14].
Desde entonces, los investigadores han creado marcas específicamente para este problema. En mayo de 2026, el laboratorio FAIR de Meta publicó TextSeal en arXiv, una marca diseñada para seguir siendo detectable después de la destilación y presentada como alternativa directa a SynthID-Text. Entre sus autores están los investigadores principales del artículo sobre la radiactividad [15].
Por qué sigo creyendo que la explicación europea encaja mejor
Los documentos oficiales siguen apuntando al cumplimiento de la UE. Anthropic señala la Ley de IA de la UE como razón de la marca [1], mientras que su publicación de febrero sobre los ataques de destilación enumera otro conjunto de defensas: clasificadores y huellas de comportamiento para el tráfico de la API, detección de actividad coordinada entre cuentas, verificaciones más estrictas para los tipos de cuenta más explotados y medidas destinadas a reducir la utilidad de las salidas para la destilación ilícita [10].
El despliegue mundial hace que un motivo centrado en la destilación me parezca menos convincente. Anthropic dice que aplica la marca en todo el mundo porque no tiene una forma duradera de limitarla por región y sigue buscando una [1]. Si detectar la destilación fuera el objetivo principal, investigar cómo desactivar la marca fuera de Europa sería una decisión de producto extraña.
El calendario apunta en la misma dirección. El anuncio de la marca de agua llegó doce días después de que el artículo 50 empezara a aplicarse y con margen de sobra antes del plazo del 2 de diciembre de 2026 para los sistemas antiguos; en cambio, llegó casi seis meses después de las acusaciones contra DeepSeek y siete semanas después de la carta sobre Alibaba. Pon los dos calendarios uno al lado del otro y la explicación del cumplimiento simplemente necesita menos supuestos: cada fecha de la marca de agua sigue una obligación de la UE, mientras que las fechas de la destilación quedan a meses de distancia.
-
Acusaciones de destilación
Anthropic señala a DeepSeek, Moonshot y MiniMax.
-
Acusación a Alibaba
Reuters informa de 28,8 millones de intercambios mediante cuentas fraudulentas.
-
Recuento del código de la UE
La Comisión cuenta unas 190 organizaciones firmantes, Anthropic incluida.
-
El artículo 50 se aplica
Los sistemas de IA nuevos deben marcar el contenido generado.
-
Anuncio de la marca de agua
Los próximos modelos Claude marcarán su texto.
-
Plazo para sistemas antiguos
La obligación de marcado alcanza a los sistemas anteriores al 2 de agosto de 2026.
Mi lectura es que el cumplimiento de la UE explica este lanzamiento, mientras que detectar la destilación sería un posible efecto secundario. Los hechos documentados respaldan esa diferencia: Anthropic combate la destilación con herramientas concretas, y la marca de agua de Claude tiene un único propósito documentado, cumplir la normativa europea. Si las salidas marcadas de Claude acaban en los datos de entrenamiento de alguien, la investigación sobre la radiactividad sugiere que Anthropic podría obtener una vía de detección, tanto si alguien lo planeó así como si no [13]. Lo que demostraría una detección de ese tipo es otra pregunta.
¿Qué demuestra realmente la detección de una marca de Claude?
Que Claude probablemente intervino, y poco más. Anthropic afirma que su clave responde a una sola pregunta: la probabilidad de que un texto haya sido escrito en parte por Claude. Una coincidencia no puede separar «Claude escribió esto» de «Claude editó esto a fondo», no puede confirmar que un texto sea de autoría humana y no puede reconocer la IA de otra empresa, que usaría otra clave u otro método [1].
Una marca puede incluso exagerar la participación. El centro de ayuda de Claude señala que una salida puede llevar la marca de Claude aunque las ideas, el texto o los datos de partida vinieran de otra fuente. Por tanto, una detección indica que Claude procesó las palabras en algún momento, no de dónde salieron las ideas [2].
Los textos cortos, editados y exactos pueden evitar la detección
Un resultado negativo demuestra aún menos. El centro de ayuda enumera las situaciones en las que el contenido marcado deja de ser detectable: el pasaje es muy corto o el texto se ha editado, parafraseado, traducido o mezclado mucho con otros textos [2]. También puede proceder de un modelo Claude que aún no incluye la marca, porque los modelos lanzados antes del 2 de agosto de 2026 siguen en transición. Anthropic dice que la marca llegará a esos modelos durante los próximos meses [1] [2].
La traducción funciona en ambos sentidos. Una traducción producida por Claude lleva una marca nueva, porque cada palabra es una elección de Claude [1]. En cambio, pasar un texto ya marcado por otro traductor sustituye esas palabras y puede borrar la señal [2].
La marca de agua también es desigual por diseño. Donde solo una salida es correcta, la marca no se aplica, porque elegir otra palabra haría el texto incorrecto. El ejemplo de Anthropic es completar «la obra más famosa de Isaac Newton se llamó Principia», donde «Mathematica» es la única respuesta válida, así que la marca no tiene sobre qué actuar [1]. La misma lógica adelgaza la marca en el código, que en su mayor parte tiene que ser exacto; las elecciones libres, como la redacción de los comentarios, pueden llevarla, pero Anthropic espera un efecto insignificante en el código producido [1]. La revisión de textos se comporta igual: cuando Claude solo corrige gramática y puntuación en un texto humano, la marca solo puede vivir en el puñado de correcciones, que pueden ser tan pocas que no lleguen a registrarse [1]. Ese comportamiento encaja además con la ley, porque el artículo 50 exime a la IA que cumple una función de asistencia en la edición estándar o que no altera sustancialmente la entrada [5].
Una reescritura completa puede eliminar la marca
Nadie fuera de Anthropic ha probado todavía la versión de Claude, pero la familia SynthID-Text sí se ha analizado. En diciembre de 2024, el SRI Lab de ETH Zurich evaluó SynthID-Text en un modelo Llama ejecutado en local. Los investigadores comprobaron que era más difícil de falsificar que otros métodos comparables, pero más fácil de borrar: el parafraseo lo eliminaba con más facilidad que otros sistemas avanzados, incluso cuando el atacante solo usaba herramientas corrientes de parafraseo [16]. La propia Anthropic admite el límite: una edición ligera probablemente no eliminará la marca por completo, pero una reescritura total que sustituya cada palabra sí lo hará. En ese punto se puede discutir si el texto sigue siendo generado por IA [1].
La marca no revela quién eres ni cambia tus derechos
La marca de agua no contiene información sobre ti. Anthropic afirma que ni la marca ni su clave permiten recuperar información sobre el usuario, su organización o sus conversaciones. Tampoco cambia nada sobre la propiedad de la salida ni sobre los derechos del usuario [1]. Por ahora, nadie fuera de Anthropic puede comprobarla. La detección requiere la clave, por lo que los detectores de IA de terceros usan métodos diferentes [1]. La API de detección que Anthropic dice que ofrecerá pronto no tenía detalles publicados sobre la implementación, los umbrales ni el modelo de acceso a 17 de agosto de 2026 [1].
¿Qué cambia para el código, la prosa y los archivos de Claude?
Para el trabajo diario cambia muy poco. Los modelos Claude compatibles marcan la prosa en cualquier lugar donde se ejecuten, el código contiene poca señal cuando la exactitud deja pocas palabras entre las que elegir y los archivos compatibles reciben una credencial C2PA distinta en sus metadatos [1]. El despliegue sigue a los modelos, no a cada producto de Claude [2].
Eso significa que un modelo compatible marca su texto dondequiera que se ejecute: en las aplicaciones de Claude, la API de Claude Platform, Claude Code, Claude Cowork o Claude Tag, así como en el acceso a través de AWS, Google Cloud y Microsoft Foundry [2]. Anthropic señala que algunas plataformas o funciones pueden no admitir todos los tipos de marcado [2]. Los modelos lanzados el 2 de agosto de 2026 o después incluyen la marca desde el lanzamiento; los anteriores la recibirán a medida que avance la transición [2]. No habrá un único día en que todo el texto de Claude pase a estar marcado. Tampoco habrá uno en que la detección se vuelva fiable para todos los modelos.
Para quien programa, el impacto práctico debería ser pequeño. El código tiene que ser exacto en su mayor parte, la salida exacta no se marca, y Anthropic espera un efecto insignificante en el código que Claude produce de verdad; en una sesión de programación la señal vive sobre todo donde la redacción es libre, como en los comentarios [1]. La prosa corriente es donde la marca de agua tiene margen para actuar, y ahí tanto las pruebas internas de Anthropic como el experimento de DeepMind con Gemini indican que la calidad no cambia de forma medible [1] [4].
Los archivos usan una credencial C2PA independiente
Los archivos reciben un tratamiento completamente distinto. Cuando Claude produce un tipo de archivo compatible, como un .png, .jpg o .svg, adjunta una credencial de contenido: una pequeña nota firmada criptográficamente en los metadatos que registra que el archivo se creó o procesó con Claude [1]. El formato es C2PA, de la Coalition for Content Provenance and Authenticity, un estándar técnico abierto para establecer la procedencia y el historial de edición del contenido digital. Es el mismo formato que usan fabricantes de cámaras y programas de edición fotográfica [1] [17]. Cualquier herramienta compatible con C2PA puede leer la credencial, y Anthropic dice que ofrecerá su propia herramienta de comprobación [1].
Mi lectura de los dos mecanismos es que fallan en direcciones opuestas. La marca de agua de texto sobrevive al copiar y pegar porque está hecha de las propias palabras, y solo se desvanece a medida que la edición las va sustituyendo [2]. La credencial de archivo no toca el contenido, pero vive en los metadatos, que se pierden cuando alguien hace una captura de pantalla, convierte el formato o vuelve a guardar el archivo [2].
| Propiedad | Marca de agua de texto | Credencial C2PA de archivo |
|---|---|---|
| Dónde vive la señal | En el patrón de elecciones de palabras | En metadatos firmados adjuntos al archivo |
| Modifica el contenido en sí | No | No |
| Sobrevive al copiar y pegar | Sí, la marca es el texto | Solo si los metadatos viajan con él |
| Qué la elimina | Una reescritura que sustituye las palabras | Capturas de pantalla, conversión de formato, volver a guardar |
| Identifica al usuario | No | No |
| Cómo comprobarla | La clave de Anthropic; hay una API de detección prevista | Cualquier herramienta compatible con C2PA |
La marca de agua de Claude no es el detector de IA que profesores y editores llevan tiempo pidiendo. Sin la clave no hay nada que comprobar, e incluso con ella la respuesta es una probabilidad, no un veredicto [1]. En su lugar, Anthropic está integrando la procedencia en sus modelos porque una ley lo exige y unas 190 organizaciones han acordado cómo aplicarla [8]. Mi siguiente paso es concreto: cuando aparezca la API de detección, pasaré por ella mis artículos publicados y varias transcripciones de Claude para observar cómo cambian los niveles de confianza según la longitud del texto.
Fuentes
- How Claude's text watermark works
- How Claude marks AI-generated content
- Watermarking AI-generated text and video with SynthID
- Scalable watermarking for identifying large language model outputs
- Regulation (EU) 2024/1689 (Artificial Intelligence Act)
- Transparency obligations under Article 50 of the AI Act
- Code of Practice on Transparency of AI-generated Content
- Strong backing for the Code of Practice on Transparency of AI-generated Content
- Guidelines on transparency obligations for providers and deployers of certain AI systems
- Detecting and preventing distillation attacks
- Chinese AI companies 'distilled' Claude to improve own models, Anthropic says
- Anthropic says Alibaba illicitly extracted Claude AI model capabilities
- Watermarking Makes Language Models Radioactive
- Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?
- TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
- Probing Google DeepMind's SynthID-Text Watermark
- Coalition for Content Provenance and Authenticity (C2PA)