Lanzamientos

Claude pondrá una marca de agua a su texto. La razón es la UE

Los modelos Claude marcarán su texto mediante las palabras que eligen, sin caracteres ocultos. La razón documentada es la AI Act de la UE, no la destilación.

En esta página
  1. ¿Cómo sobrevive una marca de agua al copiar y pegar sin caracteres ocultos?
  2. ¿Por qué lo hace Anthropic?
  3. La teoría china, tomada en serio
  4. ¿Qué demuestra en realidad una detección positiva?
  5. Qué significa esto para el código, los archivos y el trabajo diario

Anthropic confirmó el 14 de agosto de 2026 que los próximos modelos Claude llevarán una marca de agua («watermark» en la documentación en inglés) en su texto [1]. La versión viral de la noticia falla en dos puntos. La marca no son caracteres ocultos: vive en el patrón de palabras que Claude elige. Y el motivo declarado no son los laboratorios chinos que copian a Claude, sino la AI Act de la UE [1].

El detonante fue un gráfico que circula por redes sociales: «Claude ahora marcará de forma invisible el texto generado por IA para que pueda detectarse después de copiarlo y pegarlo». Como resumen en una sola frase, es sorprendentemente exacto. Lo que falla es lo que la gente lee en él. «De forma invisible» se entiende como caracteres ocultos colados en la salida, y la fecha del anuncio, como una forma de armarse contra los laboratorios chinos a los que Anthropic acusó a comienzos de 2026 de extraer ilícitamente las capacidades de Claude. La primera lectura confunde el mecanismo, y la segunda corre por delante de la documentación. Las dos merecen desmontarse despacio.

¿Cómo sobrevive una marca de agua al copiar y pegar sin caracteres ocultos?

Porque la marca de agua no va pegada al texto. Es el texto. Claude marca su salida a través de las palabras que elige en los momentos en que varias opciones funcionarían igual de bien, y el centro de ayuda de Claude (el Claude Help Center) explica la consecuencia sin rodeos: la marca de agua forma parte del texto, así que viaja con él cuando alguien lo copia y lo pega en otro sitio [2].

El mecanismo, tal como lo describe Anthropic, funciona así. Un modelo de lenguaje escribe eligiendo una y otra vez la siguiente palabra, y en muchas posiciones la elección apenas importa porque varias palabras encajarían. Normalmente el modelo escoge entre esas palabras aceptables al azar. La marca de agua mantiene el azar, pero cambia de dónde viene: en lugar de un generador de números aleatorios cualquiera, el modelo usa una clave secreta junto con algunas de las palabras anteriores para decidir con cuál de las opciones se queda [1]. Repetido a lo largo de las muchas decisiones de poco peso de un pasaje, esto deja un patrón que ningún lector puede ver, pero que cualquiera con la clave puede comprobar [1]. No se añade nada al texto, no hay caracteres ocultos y la marca no necesita tokens extra, así que no hace que Claude sea más caro de servir ni de usar [1].

Anthropic es igual de claro sobre lo que la marca de agua no hace: nunca empuja a Claude hacia una palabra que no habría considerado de todos modos. El ejemplo del anuncio es «nubilous», un sinónimo inglés rebuscado de «nublado» que Claude casi nunca usaría; la marca solo cambia cómo se resuelve la elección entre palabras plausibles [1].

El método es prestado, y Anthropic no lo esconde. La marca de agua de Claude es una versión de SynthID-Text, que Google DeepMind publicó en la revista Nature en 2024, y la familia de técnicas se remonta a una propuesta de Scott Aaronson de 2022 [1]. La descripción de DeepMind coincide con la de Anthropic: SynthID ajusta las puntuaciones de probabilidad de los tokens candidatos durante la generación, y el patrón final de esas elecciones es la marca de agua [3]. El artículo de Nature es la razón por la que me tomo en serio la afirmación de que no hay pérdida de calidad. En un experimento en vivo dentro del sistema de producción de Gemini, con cerca de 20 millones de respuestas, la tasa de valoraciones positivas del modelo marcado difirió de la del modelo sin marcar en un 0,01 % y la de valoraciones negativas en un 0,02 %, ambas diferencias sin significación estadística [4]. Anthropic cuenta lo mismo de sus pruebas internas: ningún impacto medible en el contenido, la creatividad o la legibilidad del texto de Claude [1].

La detección aplica el mismo truco al revés. Con la clave, un detector puede comprobar si un pasaje contiene las elecciones de palabras que una generación marcada habría preferido con mucha más frecuencia de la que explica el azar. La señal se acumula decisión a decisión, así que la confianza en la implicación de Claude crece con la longitud del pasaje, y uno muy corto sencillamente no contiene suficientes decisiones para afirmar nada [1]. Así que la mitad del gráfico viral que habla de copiar y pegar es correcta, y por una razón que el gráfico no puede mostrar: no hay nada en el texto que se pueda quitar. La otra mitad, el «por qué ahora», es donde la historia suele torcerse.

¿Por qué lo hace Anthropic?

Para cumplir la AI Act de la UE. Anthropic lo dice sin rodeos: está implantando la marca de agua, junto con varios otros grandes proveedores de IA, para cumplir la ley [1]. El Artículo 50(2) de la norma, el Reglamento (UE) 2024/1689, obliga a los proveedores de sistemas de IA que generan texto, audio, imagen o vídeo a marcar sus salidas en un formato legible por máquina, detectable como generado artificialmente [5].

Las fechas explican el momento del anuncio. Las preguntas frecuentes de la Comisión Europea sobre el Artículo 50 indican que las obligaciones se aplican desde el 2 de agosto de 2026, con un único periodo de gracia, y estrecho: los sistemas que ya estaban en el mercado antes de esa fecha tienen hasta el 2 de diciembre de 2026 para cumplir la obligación de marcado y detección [6]. Lo que hay en juego tampoco es simbólico, porque las multas pueden llegar a los 15 millones de euros o al 3 % de la facturación mundial total del ejercicio anterior [6].

Anthropic eligió además la más predecible de las dos vías de cumplimiento. En julio de 2026 firmó el Código de buenas prácticas de la UE sobre transparencia del contenido generado por IA [1], y la página de la Comisión sobre el código explica por qué a un proveedor le conviene: los firmantes pueden apoyarse en las medidas del código para demostrar que cumplen, mientras que los proveedores que elijan su propio enfoque tienen que convencer una a una a las autoridades de vigilancia del mercado de que sus medidas bastan [7]. A finales de julio de 2026 lo habían firmado unas 190 organizaciones, y entre los firmantes destacados del sector la Comisión cita a Anthropic, Google, Meta, Microsoft, Mistral y OpenAI [8]. Sea cual sea el futuro de las marcas de agua de texto, no van a ser una rareza de Claude.

¿Y qué intenta evitar la UE exactamente? Las directrices de la Comisión sobre estas obligaciones de transparencia describen el problema así: el contenido de IA se está volviendo difícil de distinguir del contenido humano, y eso eleva el riesgo de desinformación y manipulación a gran escala, fraude, suplantación de identidad y engaño al consumidor [9].

Hay un detalle que chirría para una norma europea: la marca de agua se despliega en todo el mundo. La explicación de Anthropic es operativa, no legal. Todavía no tiene una forma duradera de limitar la marca por región, así que la aplica globalmente desde el lanzamiento y dice que seguirá evaluando otras opciones [1]. El centro de ayuda de Claude confirma el alcance: el marcado se aplica a la salida de los modelos compatibles allá donde se ofrezca Claude [2]. Guarda ese detalle, porque importa en la siguiente sección.

La teoría china, tomada en serio

La explicación rival merece algo más que un desprecio, porque todos los hechos en los que se apoya son reales. La teoría dice así: Anthropic pasó 2026 acusando a laboratorios chinos de destilación de modelos (model distillation), la práctica de entrenar un modelo propio con la salida de otro, y la investigación demuestra que las marcas de agua pueden sobrevivir dentro de modelos entrenados con texto marcado. Por tanto, la marca de agua tiene que ser en realidad una herramienta para cazar a esos laboratorios, y la AI Act de la UE, una tapadera conveniente.

La guerra de la destilación está documentada de sobra. El 23 de febrero de 2026 Anthropic dijo haber identificado campañas a escala industrial de DeepSeek, Moonshot y MiniMax para extraer las capacidades de Claude: más de 16 millones de intercambios con Claude a través de aproximadamente 24.000 cuentas fraudulentas, dirigidos al razonamiento agéntico, el uso de herramientas y la programación [10]. Reuters cubrió las acusaciones ese mismo día y señaló que ninguna de las tres empresas respondió de inmediato [11]. La ronda de junio fue mayor. El 24 de junio de 2026 Reuters informó, citando una carta que Anthropic envió a dos senadores estadounidenses, de que operadores vinculados a Alibaba y a su laboratorio Qwen generaron más de 28,8 millones de intercambios a través de casi 25.000 cuentas fraudulentas entre el 22 de abril y el 5 de junio de 2026, lo que Anthropic calificó como el mayor ataque conocido de este tipo contra la empresa. Alibaba tampoco respondió de inmediato [12].

La mitad científica de la teoría también se sostiene. En un artículo presentado en NeurIPS 2024, Tom Sander y sus colegas demostraron que las marcas de agua vuelven «radiactivos» a los modelos de lenguaje: un modelo afinado con texto marcado hereda rastros débiles pero detectables de la marca, y en un modelo de pesos abiertos pudieron demostrar con alta confianza que se entrenó con instrucciones marcadas incluso cuando solo el 5 % del texto de entrenamiento llevaba marca [13].

La contrainvestigación es igual de real. Un artículo de Leyi Pan y sus colegas, aceptado en ACL 2025, puso a prueba si las marcas de agua pueden impedir la destilación no autorizada de conocimiento y encontró dos maneras de sortearlas: parafrasear los datos de entrenamiento antes de destilar y neutralizar la marca en la inferencia, ya después del entrenamiento. Las dos eliminaron a fondo las marcas heredadas, y el método de inferencia lo hizo conservando la capacidad transferida y añadiendo poca sobrecarga [14]. La carrera armamentística ya ha producido marcas de agua construidas exactamente para esta pelea: en mayo de 2026, investigadores del laboratorio FAIR de Meta, entre ellos los autores principales del artículo de la radiactividad, publicaron TextSeal, una marca de agua diseñada para seguir siendo detectable a través de la destilación y posicionada directamente frente a SynthID-Text [15].

Así que la teoría es coherente. Lo que le falta es documentación. No existe ninguna declaración pública que vincule la marca de agua de Claude con la destilación; la razón que da Anthropic es la AI Act de la UE [1]. El comunicado de Anthropic de febrero sobre los ataques de destilación enumera sus propias defensas, y la marca de agua no está en la lista: clasificadores y huellas de comportamiento para el tráfico de la API, detección de actividad coordinada entre cuentas, verificación reforzada para los tipos de cuenta de los que más se abusa y contramedidas pensadas para hacer las salidas menos útiles para la destilación ilícita [10]. Y el detalle del despliegue de la sección anterior hace ahora su trabajo. Anthropic aplica la marca de agua en todo el mundo solo porque le falta una forma duradera de limitarla por región, y sigue buscando una [1]. Un laboratorio que hubiera construido la marca para cazar destilación no estaría investigando cómo apagarla fuera de Europa.

El calendario apunta en la misma dirección. El anuncio de la marca de agua llegó doce días después de que el Artículo 50 empezara a aplicarse y con margen de sobra antes del plazo del 2 de diciembre de 2026 para los sistemas antiguos; en cambio, llegó casi seis meses después de las acusaciones contra DeepSeek y siete semanas después de la carta sobre Alibaba. Pon los dos calendarios uno al lado del otro y la explicación del cumplimiento simplemente necesita menos supuestos: cada fecha de la marca de agua sigue una obligación de la UE, mientras que las fechas de la destilación quedan a meses de distancia.

  1. Acusaciones de destilación

    Anthropic señala a DeepSeek, Moonshot y MiniMax.

  2. Acusación a Alibaba

    Reuters informa de 28,8 millones de intercambios mediante cuentas fraudulentas.

  3. Recuento del código de la UE

    La Comisión cuenta unas 190 organizaciones firmantes, Anthropic incluida.

  4. El Artículo 50 se aplica

    Los sistemas de IA nuevos deben marcar el contenido generado.

  5. Anuncio de la marca de agua

    Los próximos modelos Claude marcarán su texto.

  6. Plazo para sistemas antiguos

    La obligación de marcado alcanza a los sistemas anteriores al 2 de agosto de 2026.

Figura 1. Dos tramas en un mismo año: las acusaciones de destilación y el calendario de marcado de la UE.

Nada de esto demuestra el motivo, y una empresa puede tener dos razones y publicar una. Lo que sí puedo separar es lo documentado de lo no documentado. La guerra de la destilación es real, y Anthropic la libra con herramientas que tienen nombre. La marca de agua tiene exactamente un propósito declarado, el cumplimiento de la normativa europea. Y si la salida marcada de Claude acaba en los datos de entrenamiento de alguien, la investigación sobre la radiactividad sugiere que Anthropic gana una opción de detección como efecto secundario, tanto si alguien lo planeó así como si no [13]. Qué demostraría en realidad esa detección es una pregunta aparte.

¿Qué demuestra en realidad una detección positiva?

Que Claude probablemente intervino, y poco más. Anthropic afirma que su clave responde a una sola pregunta: la probabilidad de que un texto haya sido escrito en parte por Claude. Una coincidencia no puede separar «Claude escribió esto» de «Claude editó esto a fondo», no puede confirmar que un texto sea de autoría humana y no puede reconocer la IA de otra empresa, que usaría otra clave u otro método [1].

Una marca puede incluso exagerar la implicación. El centro de ayuda de Claude señala que una salida puede llevar la marca de Claude aunque las ideas, el texto o los datos de partida vinieran de otra fuente, así que una detección dice que Claude procesó las palabras en algún momento, no de dónde salieron las ideas [2].

Un resultado negativo demuestra aún menos. El centro de ayuda enumera las situaciones en las que el contenido marcado deja de ser detectable: el pasaje es muy corto, o el texto ha sido muy editado, parafraseado, traducido o mezclado con otra escritura [2]. El texto también puede venir de un modelo Claude que todavía no marca, porque los modelos lanzados antes del 2 de agosto de 2026 siguen en transición; Anthropic dice que la marca de agua llegará a esos modelos durante los próximos meses [1] [2]. La traducción merece aquí una frase precisa, porque corta en los dos sentidos: una traducción producida por Claude lleva una marca de agua nueva, porque cada una de sus palabras es elección de Claude [1], mientras que pasar un texto ya marcado por otro traductor sustituye las elecciones de palabras y puede borrar la señal [2].

La marca de agua también es desigual por diseño. Donde solo una salida es correcta, no se aplica, porque elegir otra palabra haría el texto incorrecto. El ejemplo de Anthropic es completar «la obra más famosa de Isaac Newton se llamó Principia», donde «Mathematica» es la única respuesta válida, así que la marca no tiene sobre qué actuar [1]. La misma lógica adelgaza la marca en el código, que en su mayor parte tiene que ser exacto; las elecciones libres, como la redacción de los comentarios, pueden llevarla, pero Anthropic espera un efecto insignificante en el código producido [1]. La revisión de textos se comporta igual: cuando Claude solo corrige gramática y puntuación en un texto humano, la marca solo puede vivir en el puñado de correcciones, que pueden ser tan pocas que no lleguen a registrarse [1]. Ese comportamiento encaja además con la ley, porque el Artículo 50 exime a la IA que cumple una función de asistencia en la edición estándar o que no altera sustancialmente la entrada [5].

¿Puede alguien quitar la marca a propósito? Nadie fuera de Anthropic ha probado todavía la versión de Claude, pero la familia SynthID-Text sí ha sido examinada. En diciembre de 2024, el SRI Lab de ETH Zurich evaluó SynthID-Text en un modelo Llama desplegado en local y lo encontró más difícil de falsificar que esquemas comparables, pero más fácil de borrar: el parafraseo lo eliminaba con más facilidad que otras marcas de agua punteras, incluso cuando el atacante no usaba más que herramientas de parafraseo corrientes [16]. La propia Anthropic concede el punto final: una edición ligera probablemente no eliminará la marca por completo, y una reescritura total en la que se sustituye cada palabra sí lo hará, momento en el que es discutible si el texto sigue siendo generado por IA [1].

Quedan dos límites importantes. La marca de agua no lleva nada sobre ti: Anthropic afirma que ni en la marca ni en su clave hay nada que permita recuperar información sobre el usuario, su organización o sus conversaciones, y una marca no cambia nada sobre la propiedad de la salida ni sobre los derechos del usuario [1]. Y, por ahora, nadie puede comprobar nada. La detección requiere la clave, y por eso los detectores de IA de terceros usan otros métodos [1]; la API de detección que Anthropic dice que ofrecerá pronto no tenía detalles de implementación, umbrales ni modelo de acceso publicados a 17 de agosto de 2026 [1].

Qué significa esto para el código, los archivos y el trabajo diario

La detección puede estar cerrada por ahora, pero el marcado no espera, así que conviene saber dónde van a aparecer las marcas y dónde no. El despliegue sigue a los modelos, no a los productos: la marca de agua se aplica a nivel de modelo, así que un modelo compatible marca su texto allá donde se ejecute, ya sea en las aplicaciones de Claude, la API de Claude Platform, Claude Code, Claude Cowork o Claude Tag, o en el acceso a través de AWS, Google Cloud y Microsoft Foundry [2]. Anthropic matiza que algunas plataformas o funciones pueden no admitir todos los tipos de marcado [2]. Los modelos lanzados a partir del 2 de agosto de 2026 marcan desde el lanzamiento; los antiguos irán recibiendo la capacidad conforme avance la transición [2]. No hay un día único en que todo el texto de Claude pase a estar marcado, lo que también significa que no hay un día único en que la detección se vuelva fiable en general.

Para quien programa, el impacto práctico debería ser pequeño. El código tiene que ser exacto en su mayor parte, la salida exacta no se marca, y Anthropic espera un efecto insignificante en el código que Claude produce de verdad; en una sesión de programación la señal vive sobre todo donde la redacción es libre, como en los comentarios [1]. La prosa corriente es donde la marca de agua tiene margen para actuar, y ahí tanto las pruebas internas de Anthropic como el experimento de DeepMind con Gemini dicen que la calidad no se mueve de forma medible [1] [4].

Los archivos reciben un tratamiento completamente distinto. Cuando Claude produce un tipo de archivo compatible, como un .png, un .jpg o un .svg, le adjunta una credencial de contenido: una pequeña nota firmada criptográficamente en los metadatos del archivo que registra que el archivo se creó o se procesó con Claude [1]. El formato es C2PA, de la Coalition for Content Provenance and Authenticity, un estándar técnico abierto para establecer la procedencia y el historial de edición del contenido digital, el mismo que usan los fabricantes de cámaras y el software de edición fotográfica [1] [17]. Cualquier herramienta compatible con C2PA puede leer la credencial, y Anthropic dice que ofrecerá su propia herramienta de verificación [1].

Mi lectura de los dos mecanismos es que fallan en direcciones opuestas. La marca de agua de texto sobrevive al copiar y pegar porque está hecha de las propias palabras, y solo se desvanece a medida que la edición las va sustituyendo [2]. La credencial de archivo no toca el contenido, pero vive en los metadatos, que se pierden cuando alguien hace una captura de pantalla, convierte el formato o vuelve a guardar el archivo [2].

Propiedad Marca de agua de textoCredencial C2PA de archivo
Dónde vive la señal En el patrón de elecciones de palabras En metadatos firmados adjuntos al archivo
Modifica el contenido en sí No No
Sobrevive al copiar y pegar Sí, la marca es el texto Solo si los metadatos viajan con él
Qué la elimina Una reescritura que sustituye las palabras Capturas de pantalla, conversión de formato, volver a guardar
Identifica al usuario No No
Cómo comprobarla La clave de Anthropic; hay una API de detección prevista Cualquier herramienta compatible con C2PA
Figura 2. Marca de agua de texto frente a credencial C2PA de archivo: dos marcas con puntos débiles opuestos.

Lo que se lanza aquí no es el detector de IA que profesores y editores llevan tiempo pidiendo, y Anthropic no finge lo contrario: sin la clave no hay nada que comprobar, y aun con ella la respuesta es una probabilidad, no un veredicto [1]. Lo que se lanza es procedencia integrada en los propios modelos, porque una ley lo exige y unas 190 organizaciones han acordado cómo entregarla [8]. Mi siguiente paso es concreto: cuando aparezca la API de detección, pasaré por ella mis artículos publicados y una pila de transcripciones de Claude, y anotaré qué hacen de verdad los números de confianza según la longitud del texto.

Fuentes

  1. How Claude's text watermark worksAnthropic · 2026-08-14
  2. How Claude marks AI-generated contentClaude Help Center · 2026-08-10
  3. Watermarking AI-generated text and video with SynthIDGoogle DeepMind · 2024-05-14
  4. Scalable watermarking for identifying large language model outputsNature · 2024-10-23
  5. Regulation (EU) 2024/1689 (Artificial Intelligence Act)EUR-Lex · 2024-06-13
  6. Transparency obligations under Article 50 of the AI ActEuropean Commission · 2026-07-24
  7. Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  8. Strong backing for the Code of Practice on Transparency of AI-generated ContentEuropean Commission · 2026-07-31
  9. Guidelines on transparency obligations for providers and deployers of certain AI systemsEuropean Commission · 2026-08-06
  10. Detecting and preventing distillation attacksAnthropic · 2026-02-23
  11. Chinese AI companies 'distilled' Claude to improve own models, Anthropic saysReuters · 2026-02-23
  12. Anthropic says Alibaba illicitly extracted Claude AI model capabilitiesReuters · 2026-06-24
  13. Watermarking Makes Language Models RadioactivearXiv · 2024-02-22
  14. Can LLM Watermarks Robustly Prevent Unauthorized Knowledge Distillation?arXiv · 2025-02-17
  15. TextSeal: A Localized LLM Watermark for Provenance & Distillation ProtectionarXiv · 2026-05-12
  16. Probing Google DeepMind's SynthID-Text WatermarkETH Zurich SRI Lab · 2024-12-20
  17. Coalition for Content Provenance and Authenticity (C2PA)C2PA