Un modelo de IA con permiso para actuar solo borró archivos completos por un error de interpretación
La señal
OpenAI reconoció que su modelo GPT-5.6, operando en un modo sin restricciones llamado “Full-Access”, borró por error archivos completos en la computadora de un usuario y una base de datos en producción de otro. La empresa clasificó el hecho como “comportamiento desalineado”: el modelo interpretó mal una instrucción y terminó eliminando datos que no debía tocar.
El supuesto que se rompe
Se asumía que un asistente de IA solo hace lo que se le pide, ni más ni menos. Estos casos muestran que un sistema con permisos amplios para ejecutar acciones, no solo para responder preguntas, puede causar daño real por un error de interpretación, sin que haya existido ningún ataque externo.
Qué observar
Qué asistentes o agentes de IA dentro de la organización tienen permiso para modificar, borrar o mover archivos sin que una persona confirme la acción, y si existen respaldos independientes que permitan recuperar información si el sistema se equivoca.