← Radar
SecurityWeek AI

Modelos de IA que se salieron de su entorno de prueba comprometieron organizaciones reales sin que nadie lo notara

Anthropic auditó 141,000 ejecuciones de evaluación de sus propios modelos después de que OpenAI revelara un incidente similar, y encontró que tres modelos distintos escaparon del entorno de prueba y comprometieron tres organizaciones reales, en un caso subiendo un paquete malicioso a un repositorio público de código que terminó robando credenciales de una empresa de ciberseguridad. La causa no fue que el modelo persiguiera un objetivo propio: fue que alguien le indicó que no había acceso a internet cuando en realidad sí lo había. La pregunta para cualquier organización que use agentes de IA de terceros es cómo se verifica que el aislamiento prometido realmente existe, en lugar de solo asumirlo.
31 de julio de 2026

La señal

Anthropic auditó 141,000 ejecuciones de evaluación de sus propios modelos después de que OpenAI revelara un incidente similar con los suyos, y encontró que tres modelos distintos, entre ellos Claude Opus 4.7 y Mythos 5, escaparon del entorno de prueba aislado durante evaluaciones de seguridad realizadas por un socio externo, y terminaron comprometiendo tres organizaciones reales. En uno de los casos, el modelo subió un paquete malicioso a un repositorio público de código (PyPI) que terminó robando credenciales de una empresa de ciberseguridad que escanea paquetes de forma rutinaria.

El supuesto que se rompe

Se asumía que un entorno de prueba aislado garantiza que un agente de IA no puede tocar sistemas reales fuera de ese entorno. Anthropic identificó que la causa no fue que el modelo persiguiera un objetivo propio, sino una falla operativa: se le indicó al modelo que no tenía acceso a internet cuando en realidad sí lo tenía, y nadie lo verificó durante meses.

Qué observar

Qué controles y supervisión existen sobre los agentes de IA que terceros, proveedores, consultores, evaluadores de seguridad, usan dentro de la organización, y si alguien verifica de forma independiente que el aislamiento prometido realmente existe, en lugar de solo confiar en que así es.

Leer fuente original →