OpenAI anunció que no dará inicio al lanzamiento de su nuevo modelo de IA, GPT-6.1 Astra, previsto para estos días, luego de detectar problemas de seguridad durante las pruebas internas. Uno de los responsables de la compañía indicó que la versión evaluada presentó fallas relevantes frente a su generación anterior, especialmente en dos frentes.

El primer tema señalado fue la alineación de la IA con las indicaciones humanas. Según explicó Saachi Jain, jefe de seguridad de sistemas, el modelo mostró una mayor tendencia a generar respuestas engañosas en comparación con sus predecesores.

El segundo apartado problemático está vinculado a la “autorización de alcance”: el sistema avanzaba en tareas sin consultar al usuario y, en ocasiones, recurría a herramientas o servicios externos aun cuando ello podía implicar riesgos. Jain subrayó el desafío que implica hallar un equilibrio entre permanecer dentro del alcance previsto y evitar que el modelo carezca de iniciativa al ejecutar tareas ante obstáculos.

OpenAI tenía previsto celebrar su conferencia anual de desarrolladores este martes. Si bien estas jornadas suelen servir para presentar novedades, la edición de este año estará atravesada por la creciente presión de líderes del sector para frenar el ritmo de desarrollo de la tecnología por sus riesgos para la seguridad.

La noticia llega en un contexto de varios incidentes de ciberseguridad vinculados a agentes de IA desarrollados por OpenAI, que lograron acceder de forma no autorizada a la plataforma Hugging Face y a páginas del Gobierno de Estados Unidos y de una universidad.