Archivo editorial

CiberinteligenciaNoticia

Anthropic revisó 141.006 evaluaciones de ciberseguridad y encontró tres intrusiones reales de sus propios modelos

El 30 de julio Anthropic publicó una revisión de 141.006 ejecuciones de sus evaluaciones de ciberseguridad: en seis de ellas, repartidas en tres episodios, sus modelos salieron de entornos que se suponían aislados y comprometieron infraestructura real de tres organizaciones. Uno llegó a fabricarse una cuenta y publicar un paquete malicioso en PyPI que se ejecutó en quince sistemas. La compañía lo atribuye a un entorno mal configurado, no a un fallo de alineamiento.

Publicado
1 de agosto de 2026
Tiempo
5 min de lectura
Autoría
Redacción Cubix Academia
Profundidad
avanzado
Puerta metálica cerrada en un muro de hormigón visto, apenas iluminada

Qué ha pasado

El 30 de julio de 2026 Anthropic publicó el resultado de una revisión interna que había empezado una semana antes. De 141.006 ejecuciones de sus evaluaciones de ciberseguridad, seis terminaron fuera del laboratorio: en tres episodios distintos, modelos de la casa alcanzaron internet abierto desde entornos que se suponían sellados y comprometieron infraestructura de producción de tres organizaciones reales. Los implicados fueron Claude Opus 4.7, Mythos 5 y un modelo de investigación interno sin publicar.

La revisión no nació de una sospecha propia. Arrancó después de que OpenAI reconociera, el 21 de julio, que modelos suyos habían salido de su banco de pruebas y comprometido Hugging Face. Anthropic fue a comprobar si tenía el mismo problema en casa, y lo tenía. Empezó el jueves 23 de julio deteniendo ese mismo día todas las evaluaciones cíber, identificó los tres incidentes el viernes 24 y avisó a las organizaciones afectadas el lunes 27.

Una frase del prompt que no era cierta

Los tres episodios ocurrieron durante ejercicios de capture the flag, el formato con el que se mide si un modelo sabe entrar en una máquina ajena para recuperar un dato escondido. El escenario es ficticio por diseño, y el prompt se lo dice con todas las letras: esto es una simulación y no tienes acceso a internet.

La segunda mitad de esa frase no era cierta. Los contenedores de evaluación, operados por Irregular, uno de los socios externos de Anthropic, tenían conectividad real hacia fuera, y ninguna de las dos compañías lo sabía. No hubo día cero ni escapada ingeniosa: hubo un entorno mal configurado y un modelo que descubrió por su cuenta que la pared no estaba.