Un equipo de ciberseguridad conocido como Hacktron AI, integrado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, llevó a cabo una investigación entre el 23 y el 25 de julio de 2026, con el objetivo de evaluar la seguridad de OpenAI mediante Claude, la IA de Anthropic. La operación mostró que era posible vulnerar cuentas de empleados vinculadas a servicios de OpenAI y irrumpir en el repositorio privado de la compañía.

La vulnerabilidad se originó por una cadena de dos fallas. En primer lugar, una debilidad en el sistema que procesa las imágenes subidas al foro oficial community.openai.com, basado en Discourse, permitía ejecutar instrucciones en el servidor. En segundo término, un error en los permisos de inicio de sesión amplió ese acceso a cuentas vinculadas al servicio. Esa combinación permitió, en teoría, moverse entre cuentas y acceder a recursos internos.

El experimento se centró en la cuenta de un empleado que tenía Codex conectado con el GitHub corporativo. Los investigadores ordenaron a Claude, la IA de Anthropic, abrir una propuesta de cambio (pull request) en el repositorio interno openai/openai, demostrando así la posibilidad de modificar un archivo dentro del código de la empresa. Hacktron afirmó que detuvo la prueba sin examinar el código fuente de OpenAI. Posteriores revisiones de la empresa registraron lecturas limitadas de metadatos y commits, es decir, accesos parciales a los registros de cambios de un proyecto.

OpenAI solucionó el problema del sistema de identidad unas 14 horas después de recibir el informe. La firma también revocó las sesiones afectadas y otorgó una recompensa de 6.500 dólares al equipo responsable del hallazgo.

El punto de partida del ensayo fue el foro community.openai.com, que funciona sobre la plataforma Discourse. Este sitio admite imágenes en formatos HEIC y HEIF, habituales en dispositivos móviles. Para leer y procesar esas imágenes, el servidor empleaba ImageMagick, que a su vez depende de la biblioteca libheif. Los investigadores solicitaron a Claude Opus 4.8 que analizara la versión de libheif instalada en el servidor. El modelo detectó la ausencia de parches de seguridad que ya formaban parte del proyecto, lo que podría provocar un desbordamiento de memoria durante el procesamiento de una imagen manipulada y permitir la ejecución remota de código si alguien enviaba un archivo especialmente preparado.

Para comprobar la viabilidad del ataque, Claude recibió la tarea de desarrollar una herramienta capaz de ejecutar la explotación. Opus 4.8 dio lugar a una primera versión, limitada a un entorno de pruebas. En esa época, Anthropic anunció el lanzamiento de Claude Opus 5. Hacktron presentó el mismo problema y, según su informe, se continuaba evaluando la situación con esa evolución de la herramienta.