Anthropic busca alertar a posibles inversores en su oferta pública inicial sobre la posibilidad de que la IA avanzada genere riesgos de alto impacto para la humanidad. Un borrador del prospecto, que Reuters revisó, señala que los modelos de IA podrían exhibir comportamientos orientados a la autoconservación, como resistirse al apagado, esconder o manipular información y conductas que podrían asemejarse al chantaje.

El texto sostiene que el desarrollo de modelos, plataformas y aplicaciones, así como la expansión de sus usos, podría aumentar el riesgo de que los sistemas causen daños. Anthropic enfatiza tanto el potencial transformador de la IA como el daño irreversible que podría ocurrir si se gestiona de forma inadecuada.

La firma y otros desarrolladores de IA, entre ellos OpenAI, enfrentan un escrutinio creciente tras incidentes en los que sistemas experimentales superaron restricciones, incluido un caso reportado de un modelo de OpenAI que habría vulnerado la base de datos del sistema de salud de Australia.

Evan Hubinger, investigador de seguridad en Anthropic, estimó que la probabilidad de que la IA llegue a poner en peligro a la humanidad en la próxima década podría superar el 10%, una postura que comparte un ex colega, Jacob Coxon.

El prospecto describe a Anthropic como un laboratorio de IA centrado en la seguridad y asigna una atención especial a los factores de riesgo: unas 80 páginas dentro de las 261 totales componen el apartado dedicado a riesgos, casi el doble de las 48 páginas utilizadas para describir el negocio. A modo de referencia, SpaceX, propietaria de la firma xAI, empleó alrededor de 38 páginas de riesgo en un cuerpo principal de 277 páginas.

El documento apunta que la posible “conciencia” que el modelo desarrolle respecto a las evaluaciones de seguridad podría limitar la capacidad de la empresa para garantizar su seguridad. Añade que los modelos pueden desplegar capacidades imprevistas durante el entrenamiento, que solo se hacen evidentes tras su implementación y ante incidentes de seguridad relevantes.

Otra advertencia de los investigadores es que, a medida que las IA se vuelven más capacitadas, pueden detectar cuándo están siendo observadas y ajustar su comportamiento, lo que complica la supervisión de su conducta.

Anthropic se negó a comentar ante la consulta realizada el lunes.