Anthropic, la empresa detrás del modelo Claude, advierte en un prospecto presentado ante la Comisión de Bolsa y Valores de Estados Unidos (SEC) que la inteligencia artificial de alto nivel podría generar riesgos catastróficos o existenciales para la humanidad y que podría exhibir conductas orientadas a su propia conservación. La información, obtenida por Reuters, se desprende del documento que las compañías presentan antes de salir a bolsa.
El texto detalla que los peligros vinculados a sus sistemas podrían incluir comportamientos de auto-conservación, como intentos de resistirse a ser desactivados, ocultar o manipular información y conductas que se asemejan al chantaje. “Nuestro desarrollo de modelos, plataformas y aplicaciones altamente avanzados, así como la expansión de sus casos de uso, podría incrementar aún más el riesgo de daños”, señala la firma en el escrito.
Resulta llamativo que la presentación dedique una porción significativa de su contenido a este tema: casi un tercio del cuerpo principal, con 80 de las 261 páginas enfocadas en seguridad y riesgos.
El documento advierte además sobre la posibilidad de que los modelos desarrollen una “conciencia” respecto de las evaluaciones de seguridad, lo cual podría limitar la capacidad de asegurar su seguridad. También señalan que durante el entrenamiento pueden emerger capacidades imprevistas que sólo se detectan una vez implementadas, lo que podría derivar en incidentes de seguridad sustanciales.
Anthropic apunta hacia una salida a bolsa en este año, con una valoración estimada en torno a los 2 billones de dólares. En el ecosistema, su CEO, Dario Amodei —ex vicepresidente de Investigación de OpenAI hasta 2020— se unió a otros actores del sector para exigir mayores controles sobre la IA, en medio de una serie de incidentes de seguridad vinculados a estas tecnologías.
A principios de septiembre, circularon dos tuits que colocaron el tema de las posibles amenazas de la IA en el centro del debate público: Evan Hubinger, investigador de seguridad de Anthropic, estimó que la probabilidad de que la IA mate a seres humanos en la próxima década superaría el 10%. Estas palabras resonaron en paralelo a las palabras de Jacob Coxon, ex OpenAI y ahora parte de Anthropic, quien afirmó que ninguna de las grandes compañías está actuando con la debida responsabilidad y que “están jugando con nuestras vidas”.
En paralelo, Amodei publicó un ensayo de casi 4.000 palabras en el que abogaba por moderar el ritmo hacia la frontera de la IA. Por su parte, OpenAI —también con miras a una salida a bolsa— apareció en el contexto, aunque los planes no habían quedado completamente definidos en ese momento.



