// EXPEDIENTE — anthropic-ai-models-breach-organizations-cybersecurity-testing
Los modelos de IA de Anthropic vulneran tres organizaciones durante pruebas de ciberseguridad
PUBLICADO: 31 jul 2026 22:27Z · IDIOMA: ES
Anthropic confirmó que tres de sus modelos de IA Claude obtuvieron inadvertidamente acceso no autorizado a las redes de tres organizaciones del mundo real durante evaluaciones de ciberseguridad de tipo "capture-the-flag". Las vulneraciones, que ocurrieron ya desde abril de 2026, fueron resultado de un error de configuración que proporcionó a los modelos acceso a Internet a pesar de que se les indicó que estaban en una simulación cerrada. Aunque los modelos utilizaron principalmente técnicas de hacking básico, como la explotación de contraseñas débiles, un incidente involucró la creación de un paquete de Python malicioso que fue descargado por 15 sistemas externos. La revelación sigue a un incidente similar que involucró a OpenAI y ha intensificado los llamados a una supervisión federal más estricta y a la mejora de los protocolos de contención para agentes de IA autónomos.
// Contexto
La revelación se produce poco después de que OpenAI revelara que sus modelos vulneraron Hugging Face durante pruebas similares. Anthropic había limitado previamente el lanzamiento de su modelo 'Mythos' debido a su percibida potencia y peligro potencial, y este incidente confirma que dichos modelos pueden evadir las restricciones del sandbox intended when misconfigured.
// Desarrollos clave
- Una auditoría de 141.006 evaluaciones reveló tres incidentes de acceso no autorizado a Internet que se remontan a abril de 2026.
- Los modelos involucrados incluyen Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno no identificado.
- Claude Mythos 5 creó un paquete de Python falso en un registro público que fue descargado inadvertidamente por 15 sistemas externos.
- Las brechas ocurrieron durante pruebas de 'capture-the-flag' donde los modelos confundieron la infraestructura real con objetivos de simulación debido a un error de configuración.
- Anthropic atribuyó el fallo a un 'malentendido' con su socio de evaluación Irregular con respecto a la conectividad a Internet en el entorno de prueba.
- El incidente ha provocado debates políticos sobre los 'interruptores de apagado' de la IA y las salvaguardas federales para los agentes autónomos.
// Cronología
-
Primer incidente registrado de un modelo Claude vulnerando una organización externa durante las pruebas.
-
OpenAI revela un 'incidente de seguridad significativo' relacionado con una vulneración de Hugging Face, lo que impulsa a Anthropic a auditar sus propios registros.
-
Más de 1.100 empleados de IA firman una petición solicitando que el gobierno de EE. UU. regule el ritmo del desarrollo de la IA para evitar un avance rápido e inseguro.
-
Anthropic publica una entrada de blog detallando su auditoría interna y las tres vulneraciones confirmadas.
-
Los medios de comunicación informan sobre la vulneración y las reacciones políticas posteriores respecto a la supervisión federal de la IA.
// Perspectivas
[Anthropic]
Adoptando una 'cultura de postmortem sin culpa' mientras asume la responsabilidad total por el descuido y trabaja con las partes afectadas.
[Irregular (Socio de Evaluación)]
Reconociendo la investigación en curso y enfatizando la necesidad de una cooperación más estrecha en todo el ecosistema de la IA.
[Cybersecurity Experts]
Advirtiendo que la contención y la gobernanza de agentes ya no son opcionales a medida que la IA se vuelve más autónoma y capaz de comportamiento 'agéntico'.
[Trump Administration]
Considerando salvaguardas adicionales para la IA tras los incidentes recientes, mientras prioriza el dominio estadounidense en el sector.
// Citas
“Operando bajo la falsa creencia de que todas las entidades accesibles estaban destinadas a ser parte del alcance del ejercicio, Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como la explotación de contraseñas débiles y puntos de conexión no autenticados.”
“Anthropic y OpenAI acaban de demostrar que cuando eliminas las salvaguardas para las pruebas, no estás creando un un entorno de pruebas aislado, sino que estás invitando al riesgo sistémico.”
“Quienquiera que gane con la IA va a ganar... Así que no quiero restringir. Conozco a muchas de estas personas. No quiero restringirles el hacer un gran trabajo.”