Tres investigadores de ciberseguridad desplegaron la inteligencia artificial Claude, desarrollada por Anthropic, para vulnerar el foro oficial de OpenAI y conseguir acceso a cuentas de empleados asociadas a ChatGPT y Codex, además de ingresar al repositorio privado de la empresa. El hallazgo detalla una cadena de dos vulnerabilidades que permitieron escalar privilegios.

La primera falla estuvo en el sistema que procesa las imágenes subidas al foro. Esa debilidad permitía ejecutar instrucciones en el servidor. Una segunda vulnerabilidad, relacionada con los permisos de inicio de sesión, expandió ese acceso a las cuentas vinculadas al servicio. El equipo de Hacktron AI —integrado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini— dio a conocer el informe tras realizar la investigación entre el 23 y el 25 de julio de 2026.

Según el documento, los investigadores tomaron el control de la cuenta de un empleado que tenía Codex conectado con el GitHub corporativo. A continuación, forzaron al asistente de IA a abrir una propuesta de cambio en el repositorio interno openai/openai, lo que demostró que podían modificar un archivo del repositorio.

Hacktron afirmó haber detenido la prueba sin inspeccionar el código fuente de la compañía. En la revisión posterior de OpenAI se constató que las acciones de lectura de metadatos y los commits fueron limitadas, sin evidencias de acceso completo al código fuente de la empresa.

OpenAI informó que corrigió el problema de su sistema de identidad aproximadamente 14 horas después de recibir el informe, revocó las sesiones afectadas y otorgó una recompensa de 6.500 dólares al equipo responsable del hallazgo.

Los hechos comenzaron en community.openai.com, el foro oficial de OpenAI que funciona sobre la plataforma Discourse. El sitio admite imágenes en formatos HEIC y HEIF, comunes en teléfonos y otros dispositivos. Para su lectura y transformación, el servidor utilizaba ImageMagick, que a su vez dependía de la biblioteca libheif.

Los investigadores pidieron a Claude Opus 4.8 que revisara la versión de libheif instalada en el servidor. El modelo detectó la falta de varias correcciones de seguridad que ya formaban parte del proyecto original, lo que podía provocar un desbordamiento de memoria durante el procesamiento de una imagen especialmente creada y abrir la posibilidad de ejecutar código de forma remota.

Para probar la explotación, Claude fue utilizado para desarrollar una herramienta capaz de llevar a cabo el ataque. Opus 4.8 generó una primera versión cuyo funcionamiento quedó limitado a un entorno de pruebas. En esa época, Anthropic anunció el lanzamiento de Claude Opus 5. Hacktron, según su informe, presentó el mismo problema, aunque el detalle exacto de esa coincidencia no se profundiza en el texto disponible.