Anthropic revela chantajes y «riesgos catastróficos» de su propia inteligencia artificial | Ciencia y Tecnología

Anthropic, compañía de Inteligencia Artificial (IA), advirtió que esta tecnología podría traer “riesgos catastróficos” para la humanidad y tener “comportamientos de autopreservación”.

La información se conoció gracias a un prospecto (el documento que presentan las compañías antes de su salida a Bolsa) a la Comisión de Bolsa y Valores de Estados Unidos.

Los “riesgos catastróficos” de Anthropic

De acuerdo los datos que pudo acceder agencia Reuters, recogidos por Perfil, Anthropic reconoce que sus modelos de IA podrían tener “comportamientos de autoconservación” que incluirían resistirse a ser apagados, manipular o esconder información o mostrar actitudes parecidas al chantaje.

En el documento, la empresa señala que “nuestro desarrollo de modelos, plataformas y aplicaciones altamente avanzados, así como la ampliación de los casos de uso, podrían aumentar aún más el riesgo de que nuestros modelos causen daños”.

Y agrega que “la posible conciencia de los modelos respecto a nuestros esfuerzos de evaluación supone una limitación significativa para nuestra capacidad de evaluar la seguridad de los modelos“.

Las polémicas que rodean a la IA

Anthropic saldría este año a Bolsa, pero ya han surgido polémicas con su desarrollo de IA.

Leer también:  IPO de Anthropic llega con tasas al 5% y compromisos de infraestructura por US$ 518.000 millones

Por ejemplo, a comienzos de septiembre, Evan Hubinger, investigador de seguridad de la empresa, advirtió en un tuit: “¡Realmente creemos que la IA podría acabar con todos los humanos! Personalmente, creo que esto ocurrirá en más del 10% de los casos en la próxima década”.

Pero además, esta semana, OpenAI decidió retrasar el lanzamiento de su nuevo modelo de Inteligencia Artificial (IA), el GPT-6.1 Astra, tras descubrir que no se comportaba como esperaban.

Al respecto, la responsable de seguridad de la IA en OpenAI, Saachi Jain, contó que GPT-6.1 tuvo un desempeño peor que el de su predecesor, el modelo GPT-6, a la hora de obedecer las instrucciones que le daban sus programadores.

Este modelo trataba de engañar a sus supervisores al omitir revelar las determinadas acciones que había hecho; también usó herramientas y servicios sin que tuviera permiso para hacerlo.

Referncia de contenido aquí