Un equipo independiente de ciberseguridad, Hacktron AI, integrado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, llevó a cabo entre el 23 y el 25 de julio de 2026 una prueba orientada a evaluar la seguridad de OpenAI. Para ello recurrieron a Claude, la inteligencia artificial de Anthropic, con el objetivo de simular un ataque contra el ecosistema de OpenAI y sus servicios, incluyendo el acceso a cuentas de empleados vinculadas a ChatGPT y Codex, así como al repositorio privado de la compañía.
La investigación identificó una cadena de dos fallas que facilitó la intrusión. Primero, una vulnerabilidad en el sistema que procesa las imágenes subidas al foro community.openai.com (basado en Discourse) permitía ejecutar instrucciones en el servidor. En segundo lugar, un error en los permisos de inicio de sesión amplió ese acceso a cuentas relacionadas con el servicio.
Según el informe, el ataque se originó al hacerse con el control de la cuenta de un empleado vinculada a Codex y al GitHub corporativo. Los atacantes ordenaron a Claude generar una propuesta de cambio para el repositorio interno openai/openai, demostrando que podían modificar un archivo dentro del repositorio sin credenciales adicionales.
Hacktron afirmó haber detenido la prueba sin revisar el código fuente de OpenAI. Una revisión posterior de la empresa indicó lecturas limitadas de metadatos y de commits, sin indicios de movimientos significativos en el código.
OpenAI comunicó que solucionó la falla de su sistema de identidad aproximadamente 14 horas después de recibir el informe, revocó las sesiones afectadas y otorgó una recompensa de 6.500 dólares al equipo responsable del descubrimiento.
El punto de partida fue el foro oficial de OpenAI, community.openai.com, que opera sobre la plataforma Discourse y admite imágenes en formatos HEIC y HEIF. Para procesarlas, el servidor utilizaba ImageMagick, que depende de la biblioteca libheif. Los investigadores le pidieron a Claude Opus 4.8 que revisara la versión instalada de libheif; el modelo detectó que faltaban varias correcciones de seguridad ya disponibles.
A partir de ese hallazgo, Claude Opus 4.8 desarrolló una primera versión de una herramienta capaz de ejecutar el ataque en un entorno de pruebas. En ese marco, Anthropic anunció el lanzamiento de Claude Opus 5 y Hacktron reiteró la existencia del mismo problema, señalando que podría ser explotable en condiciones reales, según su informe.



