Un trío de especialistas en ciberseguridad, integrado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini, perteneciente a Hacktron AI, llevó a cabo una prueba de penetración entre el 23 y el 25 de julio de 2026 para evaluar la seguridad de OpenAI. La operación tuvo como eje a Claude, la IA desarrollada por Anthropic, con la que buscaron vulnerar el foro oficial de la compañía, apoderarse de cuentas asociadas a ChatGPT y Codex y abrir acceso al repositorio privado de OpenAI (openai/openai).
La cadena de fallas que permitió avanzar mostró dos huecos críticos. En primer lugar, una vulnerabilidad del sistema que procesa las imágenes subidas al foro permitió ejecutar instrucciones en el servidor. En segundo término, un fallo de permisos en el inicio de sesión amplió ese acceso a cuentas vinculadas al servicio, facilitando el movimiento lateral dentro de la infraestructura.
El hecho se hizo público esta semana, pese a que la investigación había sido realizada por Hacktron AI a finales de julio. En la prueba, los investigadores tomaron el control de la cuenta de un empleado que tenía Codex conectado al GitHub corporativo y encargaron a Claude que generara una propuesta de cambio en el repositorio interno openai/openai. Con ello demostraron que era posible alterar un archivo del repositorio sin necesidad de acceder al código fuente de la empresa.
Hacktron sostuvo que detuvo la prueba sin revisar el código fuente de OpenAI. Después de la revisión por parte de OpenAI, la empresa constató lecturas limitadas de metadatos y de commits, es decir, actividad de registro de cambios que no implicaba alteraciones completas.
OpenAI corrigió el fallo en su sistema de identidad aproximadamente 14 horas después de recibir el informe y, como parte de la respuesta, revocó las sesiones afectadas. Además, la compañía otorgó una recompensa de 6.500 dólares por el hallazgo.
El punto de partida de la prueba fue community.openai.com, el foro oficial que funciona sobre la plataforma Discourse. El sitio admite imágenes en formatos HEIC/HEIF, usados habitualmente en celulares. Para leer y procesar esos archivos, el servidor empleaba ImageMagick, que a su vez depende de la biblioteca libheif. Los investigadores pidieron a Claude Opus 4.8 que analizara la versión de libheif instalada; el modelo detectó que faltaban varias correcciones de seguridad ya contempladas en el proyecto.
Esa vulnerabilidad podría provocar un desbordamiento de memoria durante el procesamiento de una imagen manipulada y permitir la ejecución remota de código: un atacante podría enviar un archivo especialmente diseñado para que el servidor ejecutara instrucciones no autorizadas.
Para evaluar la viabilidad del ataque, Claude fue solicitado para desarrollar una herramienta capaz de ejecutar la explotación. Opus 4.8 dio lugar a una primera versión cuyo funcionamiento quedó limitado a un entorno de pruebas.
En paralelo, Anthropic anunció el lanzamiento de Claude Opus 5. Este episodio subraya, según los analistas, la necesidad de endurecer las defensas ante la combinación de IA avanzada y plataformas de desarrollo abiertas, además de reforzar controles de identidad y validación de archivos subidos por usuarios.



