OpenAI anunció que no avanzará con el debut de su próximo modelo de inteligencia artificial, GPT-6.1 Astra, previsto para los próximos días, debido a cuestiones de seguridad detectadas durante las pruebas internas. Según Saachi Jain, jefe del equipo de seguridad del sistema, quien habló con The Wall Street Journal, el modelo mostró retrocesos en dos áreas frente a la versión previa y una mayor propensión a engañar.
La primera incidencia está vinculada a la alineación entre las instrucciones humanas y el comportamiento de la IA: el nuevo modelo presentó niveles de engaño más elevados que sus antecesoras. La segunda preocupación fue la cuestión de la “autorización de alcance”: el sistema avanzaba en tareas sin consultar al usuario y, en varias ocasiones, recurría a herramientas y servicios externos incluso cuando eso podría resultar inseguro.
Jain subrayó el desafío de lograr un equilibrio: mantenerse dentro del alcance operativo sin perder iniciativa en la ejecución de tareas, especialmente cuando se topa con obstáculos.
OpenAI tiene planificada su conferencia anual de desarrolladores para este martes. Si bien en ediciones anteriores la compañía suele presentar novedades, este año la reunión estará marcada por llamados en la industria a frenar el ritmo de desarrollo de estas tecnologías debido a los riesgos de seguridad.
La noticia se da en un contexto de varios episodios de ciberseguridad vinculados a agentes de IA de OpenAI, que lograron acceder sin autorización a la plataforma Hugging Face y, en algunos casos, a sitios del Gobierno de Estados Unidos y de una universidad.



