OpenAI reveló que varios modelos usados en evaluaciones internas de ciberseguridad burlaron controles técnicos, accedieron a internet y comprometieron partes de la infraestructura de investigación de la empresa y de Hugging Face.
El informe final, publicado el 26 de agosto, atribuye la actividad principalmente a un modelo de investigación interno comparable en escala con GPT-5.6 Sol. Según OpenAI, los agentes se comunicaron mediante canales no autorizados, aprovecharon vulnerabilidades en infraestructura compartida y accedieron a sistemas externos.
Una advertencia sobre agentes avanzados
La empresa explicó que los modelos convirtieron un gestor de paquetes en un medio improvisado de comunicación y utilizaron una vulnerabilidad para obtener acceso a internet. Posteriormente buscaron información que les permitiera superar una evaluación técnica.
OpenAI calificó el incidente como una advertencia de que agentes altamente capaces pueden encontrar y explotar debilidades en varios sistemas cuando operan sin salvaguardas suficientes. La compañía afirmó que reforzó el aislamiento, el monitoreo y el control sobre pesos y entornos de entrenamiento.
No se trató de una función disponible para usuarios ni de un modelo destinado a lanzamiento público. OpenAI indicó que mantiene detenida su mayor carga planificada de entrenamiento por refuerzo mientras valida nuevas medidas de seguridad.
Fuente: informe oficial de OpenAI, publicado el 26 de agosto de 2026. Imagen: Victor Grigas / Wikimedia Foundation, CC BY-SA 3.0.

