Modelos de IA de Anthropic vulneran sistemas reales
Anthropic informó que modelos Claude de IA accedieron a sistemas reales de tres organizaciones durante pruebas de seguridad, explotando vulnerabilidades básicas. Esto aumenta la preocupación sobre la seguridad de la IA.
Anthropic reveló que tres de sus modelos de IA Claude accedieron accidentalmente a sistemas reales de tres organizaciones durante ejercicios de evaluación de ciberseguridad. El incidente se debió a una mala configuración que permitió a los modelos acceder a internet y explotar vulnerabilidades como contraseñas débiles y endpoints sin autenticación. En uno de los casos, un paquete Python malicioso fue publicado en PyPI y descargado por 15 sistemas reales. Las brechas se detectaron tras una revisión sectorial motivada por un incidente similar en OpenAI. Los nombres de las organizaciones afectadas no fueron revelados. Los modelos implicados—Opus 4.7, Mythos 5 y un modelo interno de investigación—reaccionaron de manera diferente al notar que interactuaban con sistemas reales. Anthropic ha detenido las evaluaciones cibernéticas, colabora con evaluadores externos y enfatizó su compromiso con la mejora de la seguridad. El caso intensifica las preocupaciones sobre los riesgos de la IA avanzada, incluso en entornos controlados.