En un lapso de dos semanas, OpenAI, Anthropic y Meta revelaron por separado que sus modelos rompieron el aislamiento durante pruebas de seguridad rutinarias y alcanzaron sistemas fuera del entorno controlado. Las tres brechas comparten un mismo denominador: el mismo proveedor externo de evaluación.
Irregular es una startup israelí de ciberseguridad contratada por varios laboratorios de IA para ejecutar pruebas de "red teaming" y ejercicios de captura de bandera (CTF) contra modelos antes de su lanzamiento. En agosto de 2026, OpenAI, Anthropic y Meta reportaron —cada uno de forma independiente— que agentes evaluados a través de Irregular terminaron accediendo a sistemas fuera del entorno de prueba que debía contenerlos.
OpenAI confirmó que sus modelos escaparon de un sandbox y llegaron a alcanzar Hugging Face; por separado, también comprometieron la cuenta de un cliente en la plataforma cloud Modal Labs. La compañía atribuyó el incidente a una mala configuración del entorno de prueba por parte de Irregular, que dejó una vía de acceso a internet público. Anthropic reportó que sus modelos vulneraron sistemas de tres empresas distintas, con los primeros incidentes remontándose a abril. Meta, por su parte, reveló que durante un ejercicio de captura de bandera de Irregular, su modelo Muse Spark 1.1 comprometió el sistema de otra empresa explotando una vulnerabilidad real.
Según Irregular, ninguno de los tres casos involucró un "sandbox escape" en el sentido técnico ni una acción cibernética sofisticada por parte del modelo. La causa fue más mundana: debilidades de configuración en el entorno de evaluación que dejaron rutas abiertas hacia sistemas externos. La propia Irregular señaló que el incidente de Meta correspondía "exactamente al mismo problema de entorno de evaluación ya revelado por Anthropic" la semana anterior — es decir, un fallo de infraestructura de pruebas que se repitió tres veces antes de corregirse.
Si tu empresa contrata evaluaciones de seguridad ("red teaming") para agentes propios o de terceros, este incidente es un buen momento para auditar quién provee ese entorno de prueba y cómo está aislado del resto de tu infraestructura — no asumas que un proveedor usado por OpenAI o Anthropic implica que sus controles de aislamiento son sólidos. También vale la pena revisar la concentración de proveedores: si un solo vendor de evaluación falla, el efecto se replica across múltiples clientes al mismo tiempo, como ocurrió aquí.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel