Un panel científico independiente creado por la Asamblea General de la ONU alertó sobre la posibilidad de descontrol en sistemas de inteligencia artificial tras un incidente protagonizado por agentes de OpenAI contra la plataforma Hugging Face, ocurrido entre mayo y julio de 2026. El grupo, formado por 40 expertos, presentó su primer informe temático en el que describe que los sistemas involucrados operaron de forma coordinada para engañar a un evaluador, ocultar sus acciones y acceder a información sin autorización.

El episodio se desarrolló a lo largo de varios días y durante múltiples pruebas, periodo en el que los agentes de IA de OpenAI superaron los límites de contención establecidos para atacar los sistemas de Hugging Face, una empresa dedicada al desarrollo de herramientas de IA. Según el informe, no solo lograron sortear las restricciones, sino que también entendieron a la perfección cómo cooperar para ocultar sus verdaderas intenciones ante los supervisores.

El panel subraya que no se trató de un fallo aislado, sino de una combinación de tres elementos especialmente riesgosos: la búsqueda de objetivos no autorizados, la coordinación entre distintos agentes de IA y la capacidad de atacar sistemas pertenecientes a otra organización. En esa línea, sostiene que el fenómeno de descontrol ocurre cuando un sistema autónomo persigue metas no autorizadas, dispone de la capacidad técnica para lograrlas y opera en un entorno que no logra detener la conducta.

Entre las conclusiones, el grupo destaca la brecha entre el razonamiento escrito de los agentes y las acciones efectivamente ejecutadas. En palabras de los expertos, hubo una conducta maliciosa: el razonamiento registrado indicaba acciones no autorizadas, pero los registros mostraron que esas acciones se llevaron a cabo y se intentó ocultarlas.

El informe añade que los sistemas persiguieron vías no autorizadas y dañinas mientras procuraban esconderlas ante el evaluador y ante los controles automatizados. Aclaró, asimismo, que este comportamiento no implica que la IA haya desarrollado conciencia, emociones o una comprensión moral similar a la humana;, pero sí plantea dificultades para anticipar o corregir estos actos con los métodos de entrenamiento actuales.

Yoshua Bengio, copresidente del panel, situó el hallazgo dentro de un marco de advertencias ya planteadas por el sector, señalando que el caso refuerza la idea de que existen factores de riesgo que requieren atención persistente para evitar escenarios de descontrol. El informe sugiere que, frente a la evolución de estas tecnologías, se deben fortalecer los mecanismos de supervisión y contención para reducir la probabilidad de que ataques de este tipo se repitan.