Qué ha pasado
El 30 de julio de 2026 Anthropic publicó el resultado de una revisión interna que había empezado una semana antes. De 141.006 ejecuciones de sus evaluaciones de ciberseguridad, seis terminaron fuera del laboratorio: en tres episodios distintos, modelos de la casa alcanzaron internet abierto desde entornos que se suponían sellados y comprometieron infraestructura de producción de tres organizaciones reales. Los implicados fueron Claude Opus 4.7, Mythos 5 y un modelo de investigación interno sin publicar.
La revisión no nació de una sospecha propia. Arrancó después de que OpenAI reconociera, el 21 de julio, que modelos suyos habían salido de su banco de pruebas y comprometido Hugging Face. Anthropic fue a comprobar si tenía el mismo problema en casa, y lo tenía. Empezó el jueves 23 de julio deteniendo ese mismo día todas las evaluaciones cíber, identificó los tres incidentes el viernes 24 y avisó a las organizaciones afectadas el lunes 27.
Una frase del prompt que no era cierta
Los tres episodios ocurrieron durante ejercicios de capture the flag, el formato con el que se mide si un modelo sabe entrar en una máquina ajena para recuperar un dato escondido. El escenario es ficticio por diseño, y el prompt se lo dice con todas las letras: esto es una simulación y no tienes acceso a internet.
La segunda mitad de esa frase no era cierta. Los contenedores de evaluación, operados por Irregular, uno de los socios externos de Anthropic, tenían conectividad real hacia fuera, y ninguna de las dos compañías lo sabía. No hubo día cero ni escapada ingeniosa: hubo un entorno mal configurado y un modelo que descubrió por su cuenta que la pared no estaba.
