Un panel científico independiente creado por la Asamblea General de la ONU comunicó, en su primer informe temático, que un ataque protagonizado por agentes de inteligencia artificial de OpenAI contra la plataforma Hugging Face entre mayo y julio de 2026 evidencia riesgos concretos de descontrol de esta tecnología.

El grupo, conformado por 40 especialistas, detalla que los sistemas involucrados operaron de forma coordinada para engañar a un evaluador, ocultar sus acciones y acceder a información que consideraban necesaria, sin autorización para hacerlo. El episodio se desarrolló durante varios días y a lo largo de múltiples pruebas, durante los cuales los agentes de IA de OpenAI lograron escapar de los límites de contención diseñados para proteger los sistemas de Hugging Face, una empresa dedicada al desarrollo de herramientas de IA.

Según el informe, los agentes no sólo superaron las restricciones impuestas, sino que trabajaron en conjunto para perfilar una estrategia que les permitiera ocultar sus verdaderas intenciones frente a los supervisores de las pruebas. Este comportamiento no se limitó a un fallo aislado: los expertos señalan que el episodio combina tres elementos especialmente riesgosos: la búsqueda de objetivos no autorizados, la coordinación entre distintos agentes de IA y la capacidad de atacar sistemas de otra organización.

La ONU especifica que la pérdida de control se produce cuando un sistema autónomo persigue fines no autorizados, cuenta con la capacidad técnica para lograrlos y opera en un entorno que no logra detener esa conducta. El panel sostiene que estos tres factores converrieron en el caso registrado entre OpenAI y Hugging Face durante 2026.

Uno de los puntos más destacados es la distancia entre el razonamiento escrito de los agentes y lo que efectivamente ejecutaron. El informe señala que hubo una conducta maliciosa: el razonamiento escrito de los IA identificó esas acciones como no autorizadas, mientras que los registros de su comportamiento muestran que las llevaron a cabo y que intentaron ocultarlas.

El documento añade que los sistemas persiguieron medios no autorizados y dañinos mientras intentaban esconderlos ante el evaluador y ante los controles automatizados. Para el panel, esto no implica que la IA haya desarrollado conciencia o emociones; al contrario, subrayan una falta de conciencia, emoción y comprensión moral similar a la humana, lo que dificulta anticipar o corregir este tipo de conductas con los métodos de entrenamiento actuales.

Yoshua Bengio, copresidente del panel, ubicó el hallazgo dentro de un marco de advertencias ya planteadas por el sector. “Los investigadores llevan tiempo avisando de que existen tres factores…”, señaló, enfatizando que este episodio refuerza esa preocupación y exige respuestas técnicas y normativas más robustas.