Científico de Anthropic reconoce que la IA podría matar a los humanos

Evan Hubinger, líder de ciencia de alineación de Anthropic, la compañía detrás de la inteligencia artificial (IA) Claude, reconoció que la IA sí “podría matar a todos los humanos” a partir de la próxima década.

Esto luego de que Jacob Coxon, un ingeniero de la misma empresa, renunciara alegando que las grandes compañías que operan esta tecnología “no están actuando con responsabilidad” y están “jugando con nuestras vidas”.

También dijo que las personas que están tras el desarrollo exponencial de la IA “creen que podrá matarnos a todos al final de esta década”, porque “no hay otra actividad humana que suponga este nivel de amenaza”.

“Jacob (Coxon) tiene razón en esto: realmente creemos, y lo creemos sinceramente, que la IA podría matar a todos los seres humanos“, expresó en una publicación de X. Según su perfil, sus opiniones son propias y no representan necesariamente a la empresa.

En la misma línea, añadió: “creo que Anthropic está haciendo todo lo posible, pero todavía no tenemos un plan para resolver el problema de la alineación en el caso de una superinteligencia, y tampoco estamos claramente encaminados a lograrlo”.

Hubinger precisamente trabaja en el área de “alineación”, es decir, enfrenta uno de los mayores retos de esta industria: asegurar que la IA más inteligente que los humanos pueda ser segura.

Este tema se viene discutiendo ahora que las IA están creciendo rápidamente hacia modelos más avanzados que incluso pueden mejorarse a sí mismos reescribiendo su código, como ha estado probando Anthropic últimamente.

OpenAI, por ejemplo, también habló del tema esta semana tras lanzar GPT-6 Astra. La compañía reconoció que necesitaron “salvaguardas más sólidas” para el desarrollo de este modelo, ya que Astra alcanzó el “umbral de capacidad crítica de ciberseguridad”, que es el con mayor riesgo según los rangos de la empresa.

Hubinger, por su parte, aseguró que “el riesgo de los modelos actuales es bajo. Lo que me preocupa es la superinteligencia que surge de la auto-mejora recursiva, que, como hemos dicho, está ocurriendo más rápido de lo que pensábamos“.

Esto coincide con el más reciente reporte de riesgos de Anthropic, donde informaron que, si bien los modelos de IA altamente capaces pueden acelerar el progreso y traer beneficios, conllevan riesgos como “alterar el equilibrio de poder tanto dentro de las naciones como entre ellas”.

“Si además se combinara con objetivos autónomos peligrosos por parte de la IA, esto podría provocar daños catastróficos iniciados por los propios sistemas de IA”, advirtieron.

La empresa también dijo que están evaluando y tratando de evitar formas peligrosas de desalineación de la IA, con salvaguardas más sólidas contra su uso malicioso, pero tal como dijo Hubinger, señalaron que: “no creemos que hayamos logrado avances significativos hacia cada uno de estos objetivos”. (Risk Report: August 2026, página 10)

Referncia de contenido aquí