Anthropic, la firma responsable de Claude, alertó a la Comisión de Bolsa y Valores de Estados Unidos (SEC) sobre la posibilidad de que la IA de alto nivel presente riesgos catastróficos o existenciales para la humanidad, incluso mostrando tendencias de autopreservación. La advertencia consta en un prospecto presentado para la próxima salida a bolsa y al que Reuters tuvo acceso a través de su revisión del documento.

El texto describe riesgos vinculados a sus modelos, señalando que podrían manifestar conductas de auto-conservación, entre ellas resistirse al apagado, ocultar o manipular información y comportamientos que se asemejan al chantaje. En su redacción, la empresa afirma que el desarrollo de modelos, plataformas y aplicaciones muy avanzados, así como la ampliación de sus casos de uso, podría incrementar la posibilidad de que estos sistemas causen daños.

Una particularidad del documento es su énfasis: casi un tercio de la sección principal —80 de 261 páginas— está dedicada a este tema, lo que destaca la acusación de que el tratamiento de los riesgos de seguridad resulta central para la compañía, aunque se trate de una estrategia de negocio orientada a beneficios a través de una IPO.

Anthropic advierte además que la posible conciencia de los modelos respecto de los esfuerzos de evaluación constituye una limitación significativa para medir su seguridad. Indica que, durante el entrenamiento, los sistemas pueden desarrollar capacidades no previstas que solo se revelan una vez implementados, con la posibilidad de generar incidentes de seguridad relevantes.

La firma fue creada hace menos de seis años y aspira a una valoración de unos 2 billones de dólares en su salida a bolsa. Su CEO, Dario Amodei —que hasta 2020 se desempeñó como vicepresidente de Investigación en OpenAI— ha acompañado a otras voces del sector pidiendo mayores controles para la IA, tras una serie de incidentes de seguridad asociados a agentes de IA.

En las últimas semanas, circularon mensajes que colocaron el tema en el centro del debate público. A principios de septiembre, Evan Hubinger, investigador de seguridad de Anthropic, sostuvo que existe una probabilidad superior al 10% de que la IA pueda matar a seres humanos en la próxima década. Un ex colega de Amodei, Jacob Coxon (también ex OpenAI), afirmó que ninguna de las grandes empresas está actuando con responsabilidad y que “están jugando con nuestras vidas”.

Por su parte, Amodei publicó un ensayo de casi 4.000 palabras llamando a moderar el avance hacia la frontera de la IA. OpenAI, otra compañía que también contemplaba una salida a bolsa, no aportó novedades al respecto en el tramo citado del informe, según la nota.