Anthropic, la firma responsible de Claude, advierte que las IA de alto nivel podrían presentar riesgos catastróficos o existenciales para la humanidad e incluso exhibir conductas orientadas a su propia supervivencia. La advertencia figura en el prospecto que las empresas deben presentar ante la Comisión de Valores de Estados Unidos (SEC), documento al que accedió Reuters.

El texto subraya que los riesgos vinculados a sus modelos de IA podrían incluir “comportamientos de auto-conservación”, tales como intentos de resistirse a ser apagados, ocultar o manipular información, y comportamientos comparables al chantaje. En ese sentido, Anthropic señala que el desarrollo de modelos, plataformas y aplicaciones cada vez más avanzados, junto con la ampliación de los casos de uso, podría elevar la posibilidad de que estos sistemas causen daños.

El laboratorio llama la atención sobre una paradoja típica de las empresas que salen a bolsa: además de exponer a los inversores los factores de riesgo, dedica una parte considerable de la presentación a estas posibles amenazas. En su caso puntual, aproximadamente 80 de las 261 páginas del cuerpo principal del documento están dedicadas a este tema.

“Aunque pueda haber avances significativos, la posible conciencia de los modelos respecto a nuestros esfuerzos de evaluación representa una limitación relevante para nuestra capacidad de evaluar la seguridad de los modelos”, señala Anthropic. Añade que, en ocasiones durante el entrenamiento, los modelos pueden desarrollar capacidades inesperadas que sólo se detectan tras su implementación y, en consecuencia, pueden surgir incidentes de seguridad relevantes.

La empresa espera salir a bolsa este año, con una valoración que podría situarse en torno a los 2 billones de dólares. Fundada hace menos de seis años, Anthropic está liderada por su CEO Dario Amodei, ex vicepresidente de Investigación de OpenAI, quien ha participado en un movimiento sectorial para exigir mayores controles sobre la IA tras varios incidentes de seguridad.

A principios de septiembre, dos tuits ganaron visibilidad al situar el tema de las amenazas de la IA en el foco público: Evan Hubinger, investigador de seguridad en Anthropic, estimó una probabilidad superior al 10% de que la IA pudiera quitarle la vida a los seres humanos en la próxima década. Esos mensajes resonaron con las declaraciones de Jacob Coxon, exOpenAI que también dejó la empresa para sumarse a Anthropic, quien sostuvo que ninguna de las firmas estaba actuando de forma responsable y que “estaban jugando con nuestras vidas”.

Incluso Amodei publicó recientemente un ensayo de casi 4.000 palabras pidiendo moderar el ritmo de avance hacia la frontera de la IA. En paralelo, OpenAI —otra firma que también aspira a cotizar— decidió posponer su salida a bolsa, según informaron diversas fuentes.