OpenAI textGrain: marca de agua en ChatGPT y Codex en la UE

OpenAI textGrain: marca de agua en ChatGPT y Codex en la UE

OpenAI empezará a incrustar una marca de agua invisible en los textos generados por ChatGPT y Codex para los usuarios de la Unión Europea. La compañía asegura que el despliegue se hará a lo largo de las próximas semanas y que se aplicará a los resultados "aptos".

Los lectores no pueden ver la marca de agua, y al copiar el texto no queda ninguna señal visible. La tecnología, llamada textGrain, funciona ajustando ligeramente las palabras que elige el modelo. Esos pequeños cambios forman un patrón estadístico que un detector puede buscar después.

"En las próximas semanas, añadiremos una marca de agua invisible a los textos aptos generados por ChatGPT y Codex en la Unión Europea", ha afirmado OpenAI.

Activación voluntaria para desarrolladores y acceso limitado al detector

El despliegue en la UE no significa que la marca de agua vaya a activarse por defecto en todo el mundo. Fuera de ChatGPT y Codex en la UE, la función sigue desactivada salvo que alguien la active.

Los desarrolladores que usan la API, estén donde estén, ya pueden activar la marca de agua en los modelos compatibles. Por defecto, sigue desactivada.

OpenAI también admite ya solicitudes para su detector de marcas de agua. En un primer momento, solo tendrán acceso investigadores y organizaciones especializadas que hayan sido aprobados.

Pequeñas ediciones debilitan la detección

OpenAI no oculta los límites del sistema. Sus propias pruebas muestran que una edición corriente puede reducir de forma drástica la tasa de acierto del detector.

"En una evaluación de fragmentos de 400 tokens, sustituir el 10% de las palabras por sinónimos redujo la detección de aproximadamente un 92% a un 66%. Sustituir el 25% de las palabras la redujo al 17%", señaló la compañía.

La longitud también influye. Con un objetivo de falsos positivos del 1%, la marca de agua se detectó en alrededor del 80% de las respuestas de psicología de 200 tokens. Cuando las respuestas llegaban a 400 tokens, la cifra subía hasta aproximadamente el 95%.

Los resultados fueron peores en materias como las matemáticas. En estas áreas el modelo tiene menos margen para elegir entre palabras alternativas, lo que deja menos espacio para el patrón.

"La ausencia de una marca de agua detectada no demuestra la autoría humana", advirtió OpenAI. "El texto generado con herramientas de OpenAI puede ser demasiado corto, haber sido editado o traducido, de modo que la detección no funcione de forma fiable".

Lo que la marca de agua no revela

Según OpenAI, una detección positiva no identifica quién generó el texto. Tampoco revela la cuenta, el prompt ni la conversación que hay detrás.

El detector tampoco puede medir qué parte de un texto final escribió o editó una persona. Un resultado positivo solo indica que el patrón de la marca de agua está presente.

OpenAI afirma que la marca de agua no tiene un efecto apreciable en la calidad de GPT-6 Astra. Los resultados en las pruebas de rendimiento se mantuvieron en líneas generales similares con textGrain activado.

Nuestro análisis

Para los equipos de seguridad, el detalle más importante es lo fácil que resulta romper la señal. Las propias cifras de OpenAI muestran que cambiar una cuarta parte de las palabras hace caer la detección al 17%, y que una traducción o un texto corto pueden anularla por completo. Cualquiera que quiera hacer pasar un texto generado por IA como propio, incluidos los operadores de phishing o los estafadores, probablemente no tendrá muchos problemas para eliminar el patrón. Todo apunta a que textGrain sirve más para pillar resultados descuidados o sin modificar que para frenar un abuso decidido.

El diseño en materia de privacidad es un punto a favor. La marca de agua no contiene datos de la cuenta ni del prompt, así que no es un mecanismo de rastreo de usuarios concretos. Aun así, las organizaciones deberían tener cuidado de no tomar el resultado del detector como prueba de nada. OpenAI lo dice claramente: la ausencia de marca de agua no demuestra la autoría humana.

La medida llega en un momento en que el sector lidia con un volumen creciente de contenido escrito por máquinas. Google suspendió hace poco un programa de recompensas por fallos de código abierto por una avalancha de informes generados por IA, un caso en el que una detección fiable resultaría útil. También llega poco después de que OpenAI aparcara el lanzamiento de GPT-6.1 Astra mientras trabaja en sus argumentos de seguridad.

Habrá que ver si OpenAI extiende la activación por defecto más allá de la UE y hasta qué punto abre el acceso al detector. Otra incógnita es si otros proveedores de IA adoptan sistemas similares y si los investigadores independientes que obtengan acceso confirman las cifras de detección de la propia OpenAI.