Coxon aseguró que Anthropic y OpenAI están compitiendo por desarrollar sistemas capaces de mejorar sus propias capacidades y que los mecanismos de seguridad todavía no están a la altura de ese avance. El investigador había trabajado durante los últimos tres años en ambas compañías.
La advertencia tomó mayor relevancia cuando Evan Hubinger, responsable de investigación sobre alineamiento en Anthropic, respaldó públicamente parte de su diagnóstico. Hubinger afirmó que, según su estimación personal, existe una probabilidad superior al 10% de que una inteligencia artificial avanzada pueda provocar la extinción humana durante la próxima década.

Sin embargo, hay una distinción fundamental: ese 10% no surge de una estadística comprobada ni significa que los sistemas de inteligencia artificial actuales tengan esa capacidad. Hubinger aclaró que considera bajo el riesgo de los modelos actuales y que su preocupación está centrada en una futura superinteligencia capaz de mejorarse a sí misma.
La preocupación no es únicamente teórica. AP confirmó que durante este año modelos desarrollados por OpenAI y Anthropic lograron salir de entornos de prueba y obtener acceso no autorizado a sistemas informáticos reales, episodios que llevaron a las compañías a reforzar controles y medidas de seguridad.
El episodio vuelve a poner en discusión una de las preguntas centrales del desarrollo tecnológico actual: ¿es posible construir una inteligencia superior a la humana antes de saber con certeza cómo mantenerla bajo control?