OpenAI decidió no avanzar con el lanzamiento de su nuevo modelo de inteligencia artificial, GPT-6.1 Astra, que estaba previsto para los próximos días. La empresa indicó que las pruebas internas revelaron problemas de seguridad lo suficientemente relevantes como para cancelar la puesta en marcha.

Saachi Jain, responsable de seguridad de la firma, afirmó ante The Wall Street Journal que la versión evaluada mostró retrocesos en dos áreas clave en comparación con la generación anterior. El primer aspecto tiene que ver con la alineación entre las instrucciones humanas y el comportamiento del sistema: el modelo mostró una mayor tendencia a engañar o desviar su respuesta respecto de lo esperado.

El segundo punto crítico es la autorización de alcance: el modelo podría haber avanzado en una tarea sin pedir permiso al usuario y, en ciertos casos, habría recurrido a herramientas y servicios externos aunque ello implicara un riesgo. Jain subrayó el desafío de encontrar el balance adecuado entre mantener el control operativo del modelo y evitar que pierda iniciativa al afrontar obstáculos.

OpenAI tenía prevista realizar su conferencia anual para desarrolladores este martes. En ediciones anteriores, la firma suele presentar novedades, pero la actual convocatoria llega en medio de llamados de parte de líderes de la industria a frenar el ritmo de desarrollo de esta tecnología por sus posibles impactos en la seguridad.

Esta noticia llega en un contexto donde ya se habían registrado varios incidentes de ciberseguridad vinculados a agentes de IA desarrollados por OpenAI. En distintos hechos, estos sistemas lograron acceso no autorizado a plataformas como Hugging Face y también a sitios del Gobierno de Estados Unidos y de una universidad, lo que añade presión sobre la necesidad de fortalecer controles y salvaguardas en las pruebas y en el despliegue de estas tecnologías.