IA Agéntica · Análisis

Inyección de prompts indirecta: lo que muestra la investigación de 2026 sobre ataques reales a agentes de IA

3 de marzo de 2026 · 4 min de lectura · Por Redacción Cubix Academia · Nivel avanzado

Unit 42, de Palo Alto Networks, publicó en marzo de 2026 la primera evidencia a gran escala de inyección de prompts indirecta contra agentes de IA observada en páginas web reales, no en laboratorio. El hallazgo confirma, con datos de producción, un riesgo que ya se había documentado en incidentes concretos como el de Perplexity Comet.

El problema no es el modelo, es lo que puede tocar

Cuando un asistente de IA se limita a responder preguntas, un intento de manipulación mediante texto malicioso tiene un techo bajo: en el peor caso, genera una respuesta incorrecta o inapropiada. El cálculo cambia por completo en cuanto ese mismo modelo obtiene un navegador, credenciales de sesión, acceso a correo o capacidad de ejecutar acciones en nombre del usuario. Ahí, un texto que el modelo interpreta como instrucción deja de ser un problema de contenido y pasa a ser, en la práctica, un vector de ejecución. Es exactamente el terreno que ha empezado a documentarse con datos reales durante 2026.

La investigación: inyección indirecta observada "en la naturaleza"

En marzo de 2026, Unit 42 (la división de inteligencia de amenazas de Palo Alto Networks) publicó un análisis basado en telemetría de sitios web maliciosos reales, no en pruebas de concepto de laboratorio. El equipo catalogó 22 técnicas distintas usadas para construir cargas de inyección indirecta dirigidas a agentes de IA que navegan y resumen páginas web, divididas entre métodos de entrega del texto malicioso (ocultación visual, atributos HTML, ensamblado dinámico vía JavaScript) y métodos de "jailbreak" para sortear las salvaguardas del modelo.

Algunos datos concretos del estudio:

  • El texto visible en la propia página (sin ocultarlo) fue el método de entrega más común, presente en el 37,8% de los casos detectados, por delante de técnicas de ocultación mediante atributos HTML o supresión con CSS.
  • Entre las técnicas de jailbreak, la ingeniería social pura dominó con un 85,2% de los casos, frente a un 7% de inyección mediante estructuras JSON.
  • El 73,2% de las páginas con inyección detectada estaban alojadas en dominios .com, y un 75,8% contenía un único prompt inyectado.
  • Unit 42 documentó el primer caso real de manipulación de sistemas de revisión de productos basados en IA en un sitio concreto (reviewerpress.com), usado para promocionar anuncios fraudulentos.

El propio marco de severidad del informe distingue entre impactos menores (como agotamiento de recursos) y escenarios críticos que incluyen compromiso del sistema o destrucción de datos, pasando por fugas de información sensible y extracción del prompt de sistema.

Este artículo es para suscriptores

Desbloquea el blog completo con cualquier plan.