La "prueba de identidad" de textos generados por IA bajo ataque: aparece "Anthropies" para eliminar la marca de agua de Claude

La "prueba de identidad" de textos generados por IA bajo ataque: aparece "Anthropies" para eliminar la marca de agua de Claude

¿Se puede eliminar la "marca de agua invisible" de Claude? Un nuevo debate en la era de la IA planteado por Anthropies, el fundador de Cardano

Hacer que los textos generados por IA sean distinguibles de los escritos por humanos.

A primera vista, parece un mecanismo bienvenido en una era saturada de información falsa y contenido generado masivamente por IA. Sin embargo, si esa "marca" es invisible para los humanos y puede quedar incluso en textos que solo han usado un poco de IA, la cuestión no es tan simple.

En agosto de 2026, Charles Hoskinson, conocido como cofundador de la criptomoneda Cardano, lanzó un proyecto de código abierto llamado "Anthropies" para eliminar marcas de agua y metadatos relacionados con la IA generativa "Claude" de Anthropic.

Esto no es simplemente la publicación de una herramienta conveniente, sino que suscita un debate más amplio sobre hasta qué punto se debe forzar técnicamente la transparencia de la IA y hasta qué punto las empresas de IA tienen derecho a dejar "marcas" en el contenido generado por los usuarios.


La "marca de agua invisible" introducida por Claude

Para entender el alboroto actual, es crucial comprender el mecanismo de la marca de agua de texto introducida en Claude.

Al escuchar "marca de agua", algunos podrían imaginar un logo en la esquina de una imagen o una cadena de texto secreta incrustada en un documento.

Sin embargo, el método adoptado por Anthropic es muy diferente.

No se añaden caracteres especiales al texto. En su lugar, se introduce un patrón estadístico en la forma en que la IA elige las palabras al generar un texto.

Por ejemplo, al continuar un texto, podría haber múltiples opciones que no suenan extrañas, como "importante", "crucial" o "esencial".

Mientras que una IA generativa normal elige la siguiente palabra basada en ciertas probabilidades, el método de marca de agua utiliza una regla basada en una clave secreta para introducir una tendencia estadística en esa elección.

Los humanos no pueden notar la diferencia al leer el texto.

Sin embargo, quienes poseen la clave pueden analizar un texto lo suficientemente largo para evaluar estadísticamente la "posibilidad de que Claude haya estado involucrado en la generación de ese texto".

Según Anthropic, este método se basa en el enfoque de SynthID Text investigado por Google DeepMind.

Lo importante es que esta marca no está oculta como "datos detrás de las letras", sino que está integrada en el lenguaje del texto mismo.

Simplemente eliminar caracteres especiales o borrar metadatos de un archivo de texto no la eliminará.


El trasfondo del EU AI Act

Una de las grandes razones por las que Anthropic introduce esta tecnología es la regulación de IA de la Unión Europea, el "EU AI Act".

Las disposiciones de transparencia, aplicadas desde el 2 de agosto de 2026, requieren que los proveedores de IA generativa tomen medidas para que el contenido generado o manipulado por IA pueda ser detectado por máquinas.

Esto incluye no solo textos, sino también imágenes, audio y video.

Con la rápida mejora del rendimiento de la IA generativa, se ha vuelto difícil distinguir entre contenido creado por humanos y contenido generado por IA. Como medida contra deepfakes, noticias falsas, suplantaciones y contenido publicitario generado masivamente, se busca establecer un sistema que permita verificar el origen del contenido.

Sin embargo, el sistema no es tan simple como "todo lo que ha tocado la IA debe mostrarse como contenido generado por IA".

Las directrices de la Comisión Europea muestran excepciones para ayudas editoriales estándar, y el código fuente también puede estar exento de la obligación de marcado bajo ciertas condiciones.

Además, para los sistemas que ya existían en el mercado antes del 2 de agosto de 2026, se ha establecido un período de transición limitado hasta el 2 de diciembre de 2026, solo para las obligaciones de marcado y detección.

Por lo tanto, no es correcto entender que "la UE ha obligado a marcar todas las utilizaciones de IA".

Aun así, es cierto que se está fortaleciendo la dirección de hacer que "los productos generados por IA sean identificables por máquinas" para los grandes proveedores de IA.


"Anthropies" publicado por Hoskinson

Aquí es donde apareció Anthropies.

Hoskinson anunció en su X que está creando un nuevo sistema que se puede usar en combinación con muchos LLM para eliminar la marca de agua de Anthropic.

El proyecto se ha publicado en GitHub bajo la licencia Apache 2.0.

Las "huellas de Claude" que Anthropies intenta manejar se pueden clasificar en tres tipos principales.

El primero es la marca de agua estadística incrustada en el texto mismo.

El segundo son las Credenciales de Contenido en formato C2PA asignadas a archivos como imágenes.

El tercero es la información de atribución como "Co-Authored-By: Claude" añadida a mensajes de confirmación de Git utilizados en el desarrollo de software.

Estos tres tipos pueden parecer similares, pero son técnicamente de naturaleza completamente diferente.

La información C2PA y las atribuciones de Git existen como metadatos o texto específicos, por lo que son relativamente fáciles de procesar.

Por otro lado, la marca de agua estadística existe en la elección de palabras del texto, por lo que no se puede simplemente "eliminar solo la parte de la marca de agua".


¿Por qué "reescribir con otra IA"?

Lo más interesante de Anthropies es su enfoque hacia la marca de agua en los textos.

Si la marca de agua existe como un patrón de elección de palabras, para romper ese patrón es necesario cambiar el texto mismo.

Por lo tanto, Anthropies adopta la idea de reconstruir el texto original con otro modelo.

El proyecto separa el proceso de eliminación de metadatos conocidos y el proceso de cambiar la estructura y expresión del texto.

Para las atribuciones de Git, basta con eliminar las partes designadas, pero para los textos en lenguaje natural, se necesita una reescritura significativa con un modelo diferente al que generó la marca de agua.

Por el contrario, si se solicita al mismo modelo generador "eliminar esta marca de agua y reescribir", es posible que el nuevo texto generado vuelva a incluir la misma marca de agua.

Esto refleja la dificultad fundamental de la tecnología de marca de agua de la IA generativa.


¿Tiene sentido una "marca de agua que se puede eliminar"?

Esta es precisamente la duda que se ve con frecuencia en las redes sociales.

"Si se puede eliminar con una gran paráfrasis por otra IA, ¿realmente puede prevenir el uso malintencionado por parte de humanos?" es una de las voces que se escuchan.

De hecho, la propia Anthropic no describe la marca de agua como infalible.

Si bien es posible que las características estadísticas permanezcan con ediciones leves, si se reescribe por completo, la señal puede perderse.

Además, en textos cortos, el número de elecciones de palabras que sirven como material de juicio es menor, por lo que la capacidad de detección disminuye en comparación con textos largos.

Lo mismo ocurre con los programas de código y los textos que describen hechos precisos.

En lugares donde la respuesta correcta está casi limitada a una, hay poco margen para que la IA elija libremente otras palabras. Por lo tanto, también disminuyen los lugares donde se pueden incrustar patrones estadísticos.

En las redes sociales, también se ve la crítica de que "si la información de procedencia de las imágenes se pierde con capturas de pantalla o reencodificación, y la señal del texto se debilita con una gran paráfrasis, entonces no afectará a los usuarios malintencionados, sino solo a los usuarios normales".

Por otro lado, también hay opiniones de que "aunque no se pueda prevenir todo uso indebido, tiene sentido".

No todos los contenidos generados por IA publicados masivamente en Internet se procesan necesariamente con la intención de eliminar la marca de agua.

Incluso si solo se puede detectar un cierto porcentaje de casos en los que el resultado generado se copia y publica casi tal cual, se considera que esto puede ser un material para identificar una gran cantidad de spam o contenido de baja calidad.


La preocupación destacada en las redes sociales: "¿Qué pasará con los textos escritos por humanos?"

Otra reacción fuerte en las redes sociales es sobre el tratamiento de los textos que un humano escribió y luego fueron corregidos por Claude.

 

Por ejemplo, si un humano escribe un informe de principio a fin y luego se lo pasa a Claude para que lo haga más legible.

Si como resultado, las partes modificadas por la IA generan un patrón estadístico, podría ser juzgado posteriormente como un texto "en el que Claude estuvo involucrado".

Lo importante aquí es que el juicio de "Claude estuvo involucrado" no es lo mismo que "Claude escribió este texto".

Anthropic también aclara esta diferencia.

La marca de agua solo puede indicar la posibilidad de que Claude haya estado involucrado en el texto, pero no es evidencia concluyente de quién es el autor, humano o IA.

Sin embargo, si el resultado del juicio se toma por sí solo en escuelas, empresas, reclutamiento o publicaciones, podría ser problemático para los usuarios.

En las redes sociales, se ha extendido la reacción de que no es aceptable que un texto escrito por un humano sea considerado "texto de IA" solo porque fue pasado por Claude para una edición de copia.

Anthropic explica que en textos donde solo se corrigen ligeramente la gramática o la puntuación, es posible que no quede suficiente marca de agua porque Claude selecciona pocas palabras.

Las directrices de la UE también establecen excepciones para la obligación de marcado en ayudas editoriales estándar.

Por lo tanto, no es cierto que "si Claude corrige incluso una letra, siempre se considerará generado por IA".

El problema es que en el uso real, es fácil que la línea entre "edición estándar" y "generación sustancial por IA" se vuelva borrosa.


También hay voces que dan la bienvenida a la transparencia

Por supuesto, también hay muchas opiniones que evalúan positivamente la marca de agua en sí.

En las redes sociales, se ha expresado la opinión de que un mecanismo que permita confirmar técnicamente que un contenido fue generado por IA será necesario para el futuro de Internet.

Cuanto más se acerquen los textos, imágenes y videos generados por IA al nivel de ser indistinguibles de las creaciones humanas, más importante será para los espectadores de contenido tener medios para juzgar su origen.

Considerando la desinformación política, los anuncios falsos que se hacen pasar por empresas, las noticias ficticias, las reseñas falsas y el contenido SEO generado automáticamente por IA, la tecnología que permite confirmar la "posibilidad de generación por IA" tiene un significado público.

Si las empresas de IA no hacen nada voluntariamente, la trazabilidad de los productos generados disminuirá cada vez más.

En ese sentido, algunos usuarios ven el esfuerzo de Anthropic como un "avance hacia una mayor transparencia".

Algunas publicaciones sugieren que incluso si no es una tecnología de detección completa, el simple hecho de poder identificar contenido de IA publicado masivamente sin procesar podría contribuir a mejorar la calidad de la información en Internet en general.


La "propiedad" que preocupa a Hoskinson

Ver Anthropies solo como una herramienta técnica para eliminar marcas de agua es entender solo la mitad de la intención de este proyecto.

Esto se debe a que Hoskinson está planteando fuertemente el problema de la "propiedad" y "atribución" de los productos generados por IA.

Los documentos de Anthropies cuestionan la permanencia de rastros del lado del proveedor de IA en los productos que pertenecen a los usuarios.

En particular, una visualización como "Co-Authored-By: Claude" en Git no es simplemente información de procedencia mecánica, sino que desde la perspectiva humana, puede parecer que Claude es un coautor.

Sin embargo, es importante tener en cuenta que esta atribución de Git y la nueva marca de agua estadística son mecanismos diferentes.

El propio repositorio de Anthropies explica que la atribución de coautoría de Git ha existido desde antes del actual sistema de marcas de agua, y no hay evidencia de que Anthropic considere ambos como el mismo mecanismo.

Y Anthropic ha dejado claro que la marca de agua no "indica propiedad o autoría".

Por lo tanto, en este momento,

"el hecho de que quede una marca de agua podría llevar a riesgos de propiedad en el futuro"

es una cuestión planteada por Hoskinson,

mientras que "la marca de agua no cambia los derechos de los usuarios"

es la afirmación de Anthropic.

Es necesario considerar estos dos puntos por separado.


La "guerra de procedencia de IA" que apenas comienza

Con la aparición de Anthropies, lo que ha salido a la luz podría ser un problema estructural más grande que la tecnología misma.

Las empresas de IA