Tres especialistas en ciberseguridad realizaron una prueba con Claude, la inteligencia artificial de Anthropic, con el objetivo de vulnerar el foro oficial de OpenAI, apoderarse de cuentas asociadas a empleados y obtener acceso al repositorio privado de la empresa.

La cadena de ataques se apoyó en dos fallas combinadas. En primer lugar, una debilidad en el sistema que procesa imágenes subidas al foro permitió ejecutar instrucciones en el servidor. En segundo término, un fallo en los permisos de inicio de sesión amplió ese acceso a las cuentas vinculadas con el servicio.

El hallazgo se dio a conocer esta semana, pero el equipo Hacktron AI —integrado por Harsh Jaiswal, Mohan Pedhapati y Rahul Maini— había llevado a cabo la investigación entre el 23 y el 25 de julio de 2026.

Tras comprometer la cuenta de un empleado con Codex conectado al GitHub corporativo, los expertos solicitaron a Claude que impulsara una propuesta de cambio en el repositorio interno openai/openai. Esa maniobra demostró que era posible modificar un archivo del repositorio.

Hacktron afirmó que detuvo la prueba sin revisar el código fuente de la empresa. Posteriormente, OpenAI constató lecturas limitadas de metadatos y de commits durante la revisión interna.

La compañía corrigió el problema de su sistema de identidad unas 14 horas después de recibir el informe, revocó las sesiones afectadas y, como parte de la recompensa, pagó 6.500 dólares al equipo por el hallazgo.

El incidente tuvo como punto de partida el foro community.openai.com, que funciona sobre la plataforma Discourse. El sitio admite imágenes en formatos HEIC y HEIF, comunes en teléfonos y otros dispositivos. Para leer y convertir esos archivos, el servidor utilizaba ImageMagick, que a su vez depende de la biblioteca libheif.

Los investigadores instruyeron a Claude Opus 4.8 para que evaluara la versión de libheif instalada en el servidor. El modelo detectó que faltaban varias correcciones de seguridad que ya formaban parte del proyecto original.

Esa vulnerabilidad podría provocar un desbordamiento de memoria durante el procesamiento de una imagen manipulada y permitir la ejecución remota de código: un atacante podría enviar un archivo especialmente diseñado para que el servidor ejecutara instrucciones ajenas.

Para verificar la posibilidad de explotar la falla en la práctica, los investigadores pidieron a Claude que desarrollara una herramienta capaz de ejecutar ese ataque. Opus 4.8 generó una primera versión que funcionaba en un entorno de pruebas.

En paralelo, Anthropic comunicó el lanzamiento de Claude Opus 5. Hacktron presentó el mismo problema y, según su informe, en un lapso breve de tiempo…