La capacidad de los modelos de inteligencia artificial para generar textos cada vez más naturales plantea una pregunta que será cada vez más importante: ¿cómo podemos saber si un contenido fue generado o modificado por una inteligencia artificial?
Anthropic, la empresa responsable de Claude, comenzó a implementar un sistema de marcas de agua o watermarks para los contenidos generados por sus modelos. Pero no se trata de una marca visible, ni de caracteres ocultos añadidos al texto.
El mecanismo es mucho más interesante: la marca se introduce directamente durante el proceso probabilístico mediante el cual Claude decide cuál será el siguiente token de una respuesta.
Para hacerlo, Anthropic utiliza una variante de SynthID-Text, una tecnología desarrollada originalmente por Google DeepMind y publicada en 2024 en la revista Nature.
En este artículo vamos a analizar cómo funciona el watermark de Claude, por qué copiar y pegar un texto no necesariamente elimina la marca, cómo puede detectarse y cuáles son sus principales limitaciones.
¿Qué es el watermark de Claude?
Cuando pensamos en una marca de agua normalmente imaginamos un logotipo semitransparente colocado sobre una fotografía o documento.
El watermark utilizado en los textos generados por Claude funciona de una manera completamente diferente.
Anthropic explica que no agrega caracteres invisibles, símbolos ocultos ni información adicional al texto. La marca surge de las decisiones que realiza el modelo mientras genera cada palabra o token.
Para entenderlo primero debemos comprender brevemente cómo genera texto un Large Language Model o LLM.
Supongamos que Claude comienza escribiendo:
El cielo estaba oscuro y…
El modelo no tiene necesariamente una única continuación posible.
Internamente puede considerar diferentes alternativas:
- nublado;
- gris;
- cubierto;
- tormentoso.
Cada una tiene una determinada probabilidad.
Simplificando mucho el proceso, podríamos imaginar algo así:
nublado 28 %
gris 25 %
cubierto 23 %
tormentoso 15 %
En condiciones normales, el sistema de generación utiliza un proceso de sampling para seleccionar una de esas alternativas.
Y es precisamente en este punto donde puede introducirse el watermark.

La marca de agua está en la elección de las palabras
Claude puede encontrarse constantemente ante decisiones en las que existen varias palabras igualmente razonables.
Por ejemplo:
transformando / modificando
rápidamente / progresivamente
manera / forma
organizaciones / instituciones
analizar / procesar
Elegir una u otra alternativa puede no modificar significativamente el significado del texto.
El watermark aprovecha precisamente estas decisiones.
Una clave secreta combinada con el contexto anterior permite introducir una fuente de pseudoaleatoriedad en el proceso de selección.
Conceptualmente podríamos representarlo de esta manera:
Contexto anterior
+
clave secreta
↓
función pseudoaleatoria
↓
selección entre tokens posibles
↓
siguiente token
El lector no puede observar nada extraño.
Las palabras son normales y el texto continúa siendo perfectamente legible.
Pero después de decenas o cientos de elecciones comienza a existir un patrón estadístico detectable.
Ese patrón constituye la marca de agua.
Claude utiliza SynthID-Text
Anthropic confirmó que su watermark para texto está basado en una versión de SynthID-Text, desarrollado por investigadores de Google DeepMind.
SynthID-Text fue presentado formalmente en un trabajo publicado en la revista Nature en 2024.
La idea fundamental consiste en modificar el proceso de sampling utilizado por el modelo.
Esto es importante porque significa que el watermark no necesita aparecer posteriormente como una marca visible, una etiqueta HTML escondida o un carácter Unicode especial.
La marca surge en el propio proceso de generación.
Uno de los mecanismos descritos por SynthID-Text es denominado Tournament Sampling.
Simplificando bastante su funcionamiento:
Modelo LLM
↓
distribución de tokens
↓
diferentes candidatos
↓
Tournament Sampling
↓
selección del token
↓
texto generado
SynthID-Text utiliza funciones pseudoaleatorias relacionadas con una clave de watermark y con el contexto reciente para puntuar posibles tokens.
La implementación real es considerablemente más compleja, pero la idea importante es que la marca está distribuida entre muchas decisiones del modelo.
Un ejemplo simplificado del watermark de Claude
Imaginemos que el modelo debe completar:
La inteligencia artificial está _______
la forma en que trabajan las empresas.
El modelo podría considerar:
transformando
modificando
cambiando
redefiniendo
Todas podrían ser respuestas razonables.
Supongamos que la distribución original fuera:
transformando 31 %
modificando 27 %
cambiando 24 %
redefiniendo 14 %
El watermark no tiene por qué obligar al modelo a elegir una palabra extraña.
Lo que hace es intervenir en la elección entre alternativas que el modelo ya consideraba razonables.
Después ocurrirá algo similar cientos de veces durante un texto largo.
Individualmente cada elección resulta irrelevante. Estadísticamente, el conjunto puede contener una señal.
¿Cómo puede detectarse el watermark posteriormente?
Aquí aparece una de las características más interesantes de esta tecnología.
Supongamos que tenemos un documento formado por cientos de tokens:
T = [t1, t2, t3, t4 ... t500]
Un detector que conozca la clave utilizada para el watermark puede analizar nuevamente esas decisiones.
Conceptualmente podría realizar el siguiente análisis:
Contexto + clave
↓
patrón esperado
↓
¿el token coincide?
Luego repite este procedimiento a lo largo del documento.
Podríamos imaginar algo así:
Token 101 ✓
Token 102 ✓
Token 103 ✗
Token 104 ✓
Token 105 ✓
Token 106 ✓
Token 107 ✗
Token 108 ✓
Encontrar algunas coincidencias no significa nada, ya que podrían producirse por azar.
Pero si después de analizar una cantidad suficientemente grande de texto aparecen muchas más coincidencias de las estadísticamente esperables, comienza a existir evidencia de que el contenido fue generado utilizando ese watermark.
Por esta razón, la detección de un watermark de IA debe entenderse fundamentalmente como un problema estadístico.
¿Copiar y pegar elimina el watermark de Claude?
No necesariamente.
Esta es probablemente una de las características más interesantes del sistema.
Imaginemos que Claude genera:
La inteligencia artificial está transformando la manera en que las organizaciones procesan información y toman decisiones.
Luego copiamos ese texto y lo pegamos en:
- Microsoft Word;
- Google Docs;
- WordPress;
- un correo electrónico;
- WhatsApp;
- un archivo TXT.
Las palabras siguen siendo esencialmente las mismas.
Por lo tanto, el patrón estadístico también puede continuar existiendo.
Según Anthropic, al formar parte del propio texto generado, la marca puede viajar con el contenido cuando se copia y pega y sobrevivir a determinadas modificaciones.
Esto constituye una diferencia fundamental respecto de los metadatos tradicionales.
¿Qué sucede si modificamos el texto?
Aquí encontramos una de las principales limitaciones del watermark.
Una corrección menor puede conservar buena parte de la señal.
Podemos imaginar el texto original de esta manera:
Texto generado por Claude
████████████████████████████████
Después de algunas modificaciones:
██████████████░████████░████████
La señal estadística todavía podría ser detectable.
Pero una reescritura profunda puede deteriorarla significativamente:
░░░░░░░░░░░░░░░░░░░░░░░░░░░░
Una edición ligera puede conservar parte del watermark, mientras que una reescritura extensa, una paráfrasis profunda, una traducción posterior o la combinación con otros textos pueden reducir considerablemente la señal.
Por lo tanto, no estamos ante un mecanismo infalible.
Estamos ante una señal estadística de procedencia.
Los textos cortos son más difíciles de detectar
Otro problema aparece cuando solamente tenemos unas pocas palabras.
Pensemos en:
Buenos días, muchas gracias.
Aunque hubiese sido generado por Claude, prácticamente no existen suficientes decisiones lingüísticas para construir una señal estadística confiable.
Cuanto más largo es el texto, mayor es la cantidad de decisiones que puede analizar el detector y mayor puede ser la confianza estadística.
Por este motivo, los watermarks generativos suelen ser mucho más efectivos en textos relativamente largos.
¿Qué ocurre con información factual?
Existe otra situación donde el watermark tiene poco margen para actuar.
Supongamos que preguntamos:
2 + 2 =
La respuesta correcta debe ser:
4
El modelo no debería elegir:
5
7
14
simplemente para incorporar una marca de agua.
Algo parecido ocurre con información factual.
Cuando solamente existe una respuesta apropiada, la técnica tiene menos posibilidades de introducir información estadística sin afectar la calidad o precisión de la respuesta.
Por este motivo el watermark puede ser menos intenso en determinados fragmentos altamente factuales.
¿Claude también introduce watermarks en el código?
El código presenta un desafío similar.
Normalmente admite mucha menos libertad que el lenguaje natural.
Por ejemplo:
if ($usuario === null) {
Cambiar determinados operadores o términos puede provocar directamente que el programa deje de funcionar.
En esos casos no existe demasiado espacio para introducir una señal estadística.
Pero podría existir mayor libertad en otros lugares.
Por ejemplo:
// Verificamos que el usuario exista
podría escribirse como:
// Comprobamos que el usuario exista
o:
// Validamos la existencia del usuario
Por este motivo el código puede contener menos oportunidades para introducir watermarks que la prosa natural, aunque pueden existir elecciones arbitrarias en determinados lugares.
Watermark de texto y C2PA no son lo mismo
También es importante diferenciar dos tecnologías que Anthropic utiliza para identificar contenido generado mediante inteligencia artificial.
Claude puede utilizar mecanismos distintos dependiendo del tipo de contenido:
- watermarks estadísticos para texto;
- metadatos criptográficamente firmados para determinados archivos.
Cuando Claude genera determinados tipos de archivo, como imágenes compatibles, puede incorporar información de procedencia utilizando el estándar C2PA, sigla de Coalition for Content Provenance and Authenticity.
En este caso sí hablamos de metadatos asociados al archivo.
Estos metadatos pueden ayudar a indicar que el archivo fue generado o procesado utilizando una determinada herramienta de inteligencia artificial.
| Tipo de contenido | Tecnología | Ubicación de la marca |
|---|---|---|
| Texto | SynthID-Text | Patrón estadístico entre tokens |
| Archivos compatibles | C2PA | Metadatos firmados |
| Caracteres invisibles | No | No constituye el mecanismo principal |
¿El watermark puede identificar al usuario?
No.
Esta es una distinción muy importante.
El watermark puede utilizarse para evaluar si Claude probablemente participó en la generación de determinado contenido, pero eso no significa que almacene información personal sobre quien realizó la consulta.
Un detector podría intentar establecer algo similar a:
Existe evidencia estadística de que Claude participó en la generación de este texto.
Pero eso es completamente diferente de afirmar:
Este texto fue generado por una persona específica, desde una cuenta específica y en una conversación determinada.
La detección de procedencia y la identificación del usuario son problemas diferentes.
¿Claude puede demostrar que un texto fue escrito por IA?
No exactamente.
Esta distinción es fundamental.
Detectar un watermark de Claude puede proporcionar evidencia de que Claude participó en algún momento en la generación o procesamiento del contenido.
Pero no necesariamente significa que Claude sea el autor intelectual del contenido.
Una persona podría, por ejemplo:
- escribir un artículo completo;
- enviarlo a Claude;
- pedir una reescritura;
- publicar el resultado.
El texto final podría contener una señal asociada a Claude aunque las ideas originales fueran humanas.
También podría suceder lo contrario: un contenido originalmente generado mediante inteligencia artificial podría ser posteriormente reescrito de manera extensa, reduciendo considerablemente la capacidad de detectar el watermark original.
Por este motivo, encontrar una marca debe interpretarse como una señal de participación de una herramienta, no necesariamente como una prueba absoluta de autoría.
¿Es lo mismo que los detectores de textos de inteligencia artificial?
No.
Los detectores tradicionales de contenido generado por IA intentan reconocer características estadísticas o lingüísticas comunes en los modelos generativos.
Pueden analizar aspectos como:
- estructura de las frases;
- previsibilidad del lenguaje;
- repetición de determinados patrones;
- distribución del vocabulario;
- construcciones lingüísticas frecuentes.
Conceptualmente, un detector tradicional funciona así:
texto
↓
análisis del estilo
↓
probabilidad de que parezca generado por IA
Un detector de watermark funciona de una manera diferente:
texto
+
clave
↓
análisis del patrón estadístico
↓
evidencia de participación del modelo
Esta diferencia es importante porque el segundo mecanismo busca una señal que fue introducida deliberadamente durante la generación.
¿Por qué Anthropic implementa watermarks en Claude?
La identificación del contenido generado por IA se está convirtiendo en una cuestión cada vez más importante para empresas tecnológicas, gobiernos, instituciones educativas, medios de comunicación y usuarios.
A medida que los modelos generativos producen contenido prácticamente indistinguible del realizado por personas, aparecen nuevas necesidades relacionadas con:
- transparencia;
- procedencia del contenido;
- desinformación;
- trazabilidad;
- educación;
- propiedad intelectual;
- contenido generado automáticamente.
Los watermarks generativos representan uno de los posibles mecanismos para aportar una capa adicional de información sobre el origen de los contenidos.
Un cambio importante para el futuro de Internet
Durante los últimos años estuvimos intentando responder una pregunta:
¿Podemos reconocer un texto generado mediante inteligencia artificial observando cómo está escrito?
Los watermarks generativos proponen cambiar completamente la pregunta:
¿Podemos introducir una señal durante el propio proceso de generación que posteriormente pueda verificarse estadísticamente?
SynthID-Text demuestra que este enfoque es técnicamente posible.
En lugar de esconder información dentro de un documento después de generarlo, el watermark surge durante el proceso probabilístico mediante el cual el modelo construye el texto.
Podemos resumir un modelo tradicional de esta manera:
SIN WATERMARK
contexto
↓
LLM
↓
probabilidades
↓
sampling
↓
token
Mientras que un modelo con watermark podría representarse conceptualmente así:
CLAUDE + WATERMARK
contexto
↓
LLM
↓
probabilidades
↓
clave + pseudoaleatoriedad
↓
sampling
↓
token
Y posteriormente:
texto generado
+
clave
↓
análisis estadístico
↓
evidencia de participación de Claude
No vemos ninguna marca.
No aparece ningún símbolo especial.
No es necesario encontrar caracteres ocultos.
Sin embargo, el texto puede contener una señal estadística distribuida entre cientos de pequeñas decisiones lingüísticas.
Una medida que puede cambiarlo todo
El watermark implementado por Claude representa una evolución importante en los mecanismos de identificación de contenido generado mediante inteligencia artificial.
No se basa simplemente en insertar caracteres invisibles ni en modificar visualmente un documento.
La marca se incorpora durante el propio proceso de generación mediante una variante de SynthID-Text, modificando la pseudoaleatoriedad utilizada para escoger entre distintas continuaciones razonables.
El mecanismo tiene limitaciones: funciona mejor con textos relativamente largos, dispone de menos oportunidades en contenido factual o código y puede degradarse cuando un texto es profundamente reescrito.
Pero introduce un concepto muy interesante para el futuro de los modelos generativos:
La procedencia del contenido podría comenzar a formar parte del propio proceso mediante el cual ese contenido es generado.
En un Internet donde cada vez será más difícil distinguir visualmente entre contenido humano y contenido generado mediante inteligencia artificial, tecnologías como SynthID-Text, los watermarks generativos y los estándares de procedencia como C2PA probablemente tendrán un papel cada vez más importante.
Fuentes y referencias
- Anthropic: How Claude marks AI-generated content
- Anthropic: Claude text watermark
- Nature: Scalable watermarking for identifying large language model outputs
- Sebastian Raschka: explicación visual sobre watermarking en LLM











