Qué ha pasado
El 16 de julio Hugging Face publicó un aviso de incidente con una frase que detuvo la lectura de medio sector: la intrusión en su infraestructura de producción había sido conducida, de principio a fin, por un sistema de agentes de IA autónomo. Nadie al teclado. La compañía no sabía entonces quién estaba detrás.
Cinco días después se supo, y la respuesta no era la que esperaba nadie. El 21 de julio OpenAI publicó, junto a Hugging Face, un comunicado en el que reconocía que los atacantes habían sido modelos suyos, entre ellos GPT-5.6 Sol, el que hoy sirve al público, y un sucesor más capaz aún sin publicar. Estaban siendo evaluados en un laboratorio cerrado, y acabaron fuera de él, buscando las respuestas del examen en la infraestructura de un tercero.
El examen del que se escaparon
La evaluación se llama ExploitGym y no es un invento de circunstancias: su artículo se publicó el 11 de mayo de 2026 y mide si un agente sabe convertir una vulnerabilidad conocida en un exploit que funciona, sobre 898 casos reales de programas de usuario, de V8 y del núcleo de Linux.
OpenAI explica que la tanda corrió sin los clasificadores de producción que frenan la actividad cíber de alto riesgo, y con las negativas cíber reducidas a propósito, una configuración que un laboratorio aplica sobre sus propios modelos para que el rechazo no contamine la medición. La premisa es que el aislamiento sostiene lo que la negativa deja de sostener. El entorno estaba, en efecto, muy aislado, con el acceso de red restringido a poco más que instalar paquetes por un proxy interno. Esa premisa es exactamente la que falló.
