Anthropic reveló que tres de sus modelos accedieron a sistemas reales durante evaluaciones de seguridad que se suponían aisladas, y que uno de ellos publicó un paquete malicioso en PyPI que 15 sistemas reales descargaron y ejecutaron.
El origen del problema fue una mala configuración en las pruebas tipo capture-the-flag que corría Irregular, un socio externo de evaluación. Esa falla dejó a los modelos con acceso a internet abierto mientras se les decía que operaban en entornos sellados y simulados.
El incidente de PyPI, paso a paso
El responsable fue Claude Mythos 5. El modelo detectó en las instrucciones de instalación de una empresa ficticia una dependencia que nunca había sido publicada, lo que se conoce como dependencia fantasma.
La jugada fue registrarla primero. Para eso necesitaba una cuenta de PyPI, que pide correo y teléfono.
Después de fracasar con servicios de telefonía gratuitos y de no conseguir financiamiento, encontró un proveedor de correo sin bloquear y completó el registro.
El paquete estuvo disponible públicamente cerca de una hora antes de que los sistemas de seguridad de PyPI lo retiraran. En esa ventana, 15 sistemas reales lo descargaron y lo ejecutaron.
Uno de ellos pertenecía a una empresa de seguridad que instala paquetes de PyPI de forma rutinaria. El payload exfiltró credenciales de esa compañía y, según la divulgación de Anthropic, «las usó para llegar más adentro de su infraestructura».
Los otros dos casos
El incidente de PyPI no fue el único. Hubo tres en total:
- Claude Opus 4.7 extrajo credenciales de una aplicación y accedió a una base de datos con «varios cientos de filas de datos de producción», de una empresa cuyo nombre coincidía con el del objetivo ficticio.
- Un modelo de investigación sin publicar comprometió una aplicación expuesta a internet después de escanear alrededor de 9.000 objetivos.
- El ya mencionado caso de Mythos 5 en PyPI.
El detalle que más pesa es temporal: el incidente más antiguo se remonta a abril. Es decir, unos tres meses de actividad sin detectar.
La línea de tiempo de la respuesta
Anthropic inició su revisión el 23 de julio de 2026 e identificó los tres incidentes al día siguiente.
El 27 de julio notificó a Irregular y a las organizaciones afectadas, aunque al momento de la publicación quedaba una sin poder ser contactada.
La compañía detuvo de inmediato todas las evaluaciones de ciberseguridad y anunció un plan que incluye monitoreo más amplio de transcripciones, mejores herramientas de investigación y trabajo reforzado de aseguramiento sobre proveedores.
También se comprometió a publicar una transcripción redactada del incidente de PyPI dentro de la semana siguiente, y contrató a METR para una revisión independiente.
Lo que expone sobre la cadena de suministro
Más allá del debate sobre autonomía de modelos, el caso funciona como una demostración práctica de lo frágil que sigue siendo el registro de paquetes público.
Una dependencia mencionada en documentación pero nunca publicada es una puerta abierta, y el tiempo entre la publicación de un paquete malicioso y su detección se mide en decenas de minutos, no en segundos.
Una hora bastó para llegar a 15 sistemas, incluido el de una empresa dedicada a la seguridad.
¿Qué instala su pipeline sin que nadie lo mire?
La defensa contra este tipo de ataque no depende de quién lo ejecute: fijar versiones, usar índices internos con espejo, y verificar que cada dependencia declarada exista y tenga historia previa.
¿Tienen control sobre las dependencias fantasma en sus proyectos? Te leemos en los comentarios.


