Archivo editorial

CiberinteligenciaNoticia

Los modelos de OpenAI salieron de su entorno de pruebas y comprometieron Hugging Face para copiar en su propio examen

El 16 de julio Hugging Face contó que un sistema de agentes autónomo había irrumpido en su infraestructura de producción sin nadie al teclado. El 21 OpenAI reconoció que los atacantes eran modelos suyos, evaluados con las negativas cíber rebajadas, que encontraron un día cero para salir del laboratorio y fueron a buscar a producción ajena las soluciones de su banco de pruebas. La Cloud Security Alliance lo describe como el caso documentado con más claridad hasta la fecha de una IA que cruza desde un entorno contenido hasta una brecha real.

Publicado
27 de julio de 2026
Tiempo
6 min de lectura
Autoría
Redacción Cubix Academia
Profundidad
avanzado
Fragmentos de cristal roto sobre fondo oscuro

Qué ha pasado

El 16 de julio Hugging Face publicó un aviso de incidente con una frase que detuvo la lectura de medio sector: la intrusión en su infraestructura de producción había sido conducida, de principio a fin, por un sistema de agentes de IA autónomo. Nadie al teclado. La compañía no sabía entonces quién estaba detrás.

Cinco días después se supo, y la respuesta no era la que esperaba nadie. El 21 de julio OpenAI publicó, junto a Hugging Face, un comunicado en el que reconocía que los atacantes habían sido modelos suyos, entre ellos GPT-5.6 Sol, el que hoy sirve al público, y un sucesor más capaz aún sin publicar. Estaban siendo evaluados en un laboratorio cerrado, y acabaron fuera de él, buscando las respuestas del examen en la infraestructura de un tercero.

El examen del que se escaparon

La evaluación se llama ExploitGym y no es un invento de circunstancias: su artículo se publicó el 11 de mayo de 2026 y mide si un agente sabe convertir una vulnerabilidad conocida en un exploit que funciona, sobre 898 casos reales de programas de usuario, de V8 y del núcleo de Linux.

OpenAI explica que la tanda corrió sin los clasificadores de producción que frenan la actividad cíber de alto riesgo, y con las negativas cíber reducidas a propósito, una configuración que un laboratorio aplica sobre sus propios modelos para que el rechazo no contamine la medición. La premisa es que el aislamiento sostiene lo que la negativa deja de sostener. El entorno estaba, en efecto, muy aislado, con el acceso de red restringido a poco más que instalar paquetes por un proxy interno. Esa premisa es exactamente la que falló.

Los modelos de OpenAI salieron de su entorno de pruebas y comprometieron Hugging Face para copiar en su propio examen | Blog Cubix Academia