OpenAI anunció que, en las próximas semanas, sus algoritmos de generación de texto para ChatGPT y Codex incluirán marcas de agua invisibles en los contenidos creados para usuarios de la Unión Europea. La medida responde a las reglas de transparencia contempladas en el Reglamento de IA del bloque y se aplicará a todos los planes disponibles en la región.

La tecnología que se implementará recibe el nombre textGrain y consiste en introducir una señal estadística apenas perceptible en la selección de palabras que realiza el modelo al redactar un texto. OpenAI también dispone de un detector propio que es capaz de analizar un fragmento y estimar si fue producido por sus sistemas.

En este momento, la compañía aclaró que los clientes que utilicen su API en cualquier parte del mundo pueden activar esta marca de forma opcional para ciertos modelos. La función no viene activada por defecto y depende del criterio de cada desarrollador.

El acceso público al detector aún no está disponible. En paralelo, OpenAI abrió una convocatoria para que investigadores y organizaciones especializadas soliciten permisos para hacer uso de la herramienta, en consonancia con el Código de Prácticas de transparencia sobre contenidos generados con IA que la empresa firmó en junio.

El Artículo 50 del Reglamento de IA de la UE obliga a las empresas que ofrecen sistemas de IA generativa a hacer identificables sus resultados de manera legible para máquinas. Esta exigencia entró en vigor de forma general el 2 de agosto.

No es la primera empresa que responde a la norma. Tech Startups señaló que Anthropic ya había introducido marcas de agua invisibles en los modelos Claude compatibles y, tras el lanzamiento, decidió aplicarlas en todo el mundo dado que aún no cuenta con una forma estable de limitar su uso solo a Europa. En contraste, OpenAI eligió un camino inverso: por ahora restringe la implementación a la UE y la deja como opción voluntaria para el resto del planeta. “No estamos convirtiendo la marca de agua en un estándar global por defecto en este lanzamiento”, señaló la compañía, y explicó que este enfoque regional les permitirá aprender del uso real antes de expandirse.

Ese mismo día, investigadores de OpenAI junto a académicos de la Universidad de Pensilvania y de la Universidad de Yale publicaron un informe técnico que describe la base matemática de textGrain y los resultados obtenidos en laboratorio. Con una tasa de falsos positivos de aproximadamente 1%, el detector identificó la marca en cerca del 80% de fragmentos de 200 palabras evaluados y en alrededor del 95% de fragmentos de 400 palabras, al probar textos de divulgación general. El rendimiento baja notablemente cuando el contenido presenta menos variabilidad de palabras, como ocurre en textos puramente matemáticos.

El informe también reconoce que la marca se degrada rápidamente si se modifica el texto; por ejemplo, al cambiar el 10% de las palabras por sinónimos, la detección se ve afectada.

En síntesis, la región europea recibirá la medida como parte de la exigencia regulatoria, mientras OpenAI la evalúa con miras a posibles pasos adicionales tras aprender del uso real.