Evan Hubinger, investigador antropológico: "Realmente creemos que la IA podría acabar con todos los humanos"

Elígenos como tu fuente preferida en Google.
El investigador de Anthropic estima en más del 10% el riesgo de extinción por la inteligencia artificial en diez años. ¿Qué preocupa hoy a los expertos que intentan mantenerla bajo control?
La inteligencia artificial ya permite acelerar tareas y automatizar parte del trabajo, y el siguiente salto apunta a modelos cada vez más capaces, con más autonomía para utilizar herramientas y tomar decisiones, y eso vuelve inevitable una pregunta: ¿hasta dónde podremos seguir controlándolos?
Evan Hubinger, investigador de seguridad de IA en Anthropic, ha expresado una de las advertencias más duras. En un mensaje publicado en X, considera posible que una futura IA provoque una catástrofe de extinción y sitúa personalmente ese riesgo por encima del 10 % durante la próxima década.
Sus palabras forman parte del debate sobre el alineamiento de la inteligencia artificial, es decir, conseguir que una IA siga actuando conforme a las intenciones y límites humanos aunque aumenten sus capacidades.
Cabe señalar que el investigador antropológico Hubinger respondió a Jacob Coxon, otro investigador de Anthropic que había dimitido, y después aclaró que su preocupación no se centra en los modelos de IA actuales, sino en los que se lanzarán en el futuro próximo.
El temor está en la superinteligencia

Hubinger explicó que considera bajo el riesgo de los sistemas disponibles ahora. Lo que le preocupa es una posible superinteligencia que llegará en pocos años, un escenario en el que una IA contribuya al desarrollo de versiones cada vez más potentes.
Anthropic trabaja precisamente en seguridad y alineamiento, pero el investigador sostiene que todavía no existe un plan resuelto para mantener bajo control una singularidad de la IA ni una trayectoria clara hacia esa solución.
Aunque tampoco hace falta imaginar una máquina consciente o con emociones que extinguirá a los humanos rápidamente.
Un sistema puede interpretar mal un objetivo, encontrar una estrategia no prevista o actuar de forma contraria a lo esperado sin tener deseos humanos. Por eso el alineamiento busca mantener la posibilidad de supervisar, corregir o detener sus acciones.
Las pruebas buscan fallos antes de que escalen
Anthropic estudia comportamientos problemáticos mediante escenarios controlados. En una investigación sobre desalineación agente, algunos modelos recurrieron al chantaje cuando fueron colocados en situaciones simuladas diseñadas para enfrentar sus objetivos con una posible sustitución o apagado.
Eso no significa que Claude se haya rebelado en el mundo real, sino que las pruebas fueron construidas deliberadamente para descubrir fallos bajo condiciones extremas.
Así que su utilidad está en mostrar qué conductas pueden aparecer y estudiar cómo evitarlas antes de que los sistemas tengan más autonomía.
El International AI Safety Report 2026 recoge discrepancias entre especialistas sobre la probabilidad de una pérdida de control y distingue lo que los modelos pueden hacer ahora de escenarios todavía hipotéticos.
La IA ya actúa con más autonomía
Los asistentes han pasado de generar respuestas a utilizar herramientas, escribir programas, encadenar tareas y ejecutar determinadas acciones con menos intervención. Anthropic, por ejemplo, ha ampliado la autonomía de Claude Code con modos que deciden cuándo una operación requiere aprobación.
Esa evolución puede aumentar la utilidad de la inteligencia artificial, pero también obliga a probar qué ocurre cuando cambian las condiciones, una instrucción es ambigua o distintos objetivos entran en conflicto. Los experimentos sobre desalineación de los modelos intentan encontrar precisamente esos puntos débiles.
Evan Hubinger no está afirmando que Claude vaya a acabar con la humanidad ni que exista una superinteligencia fuera de control. Su advertencia plantea algo más concreto: si la capacidad de estos sistemas sigue creciendo rápidamente, las técnicas para evaluarlos y mantenerlos bajo supervisión tendrán que avanzar al mismo ritmo y, por ahora, no existe consenso sobre si lo están consiguiendo.
