Prompt injection indirecto: el ataque que se esconde en el contenido que tu agente lee

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

No hace falta hackear tu modelo de IA si podés esconder las instrucciones maliciosas en la página web que ese modelo va a leer por vos. Ese es el prompt injection indirecto, y en 2026 ya dejó de ser teórico.

Cómo funciona, en concreto

El prompt injection indirecto esconde instrucciones encubiertas dentro de contenido ordinario — una página web, un email, un comentario de código — esperando a que un agente de IA lo lea y ejecute las órdenes de quien las escondió. A diferencia del prompt injection directo (donde el atacante le habla directamente al modelo), acá el atacante nunca interactúa con el sistema — solo deja una trampa en algún lugar que el agente eventualmente va a visitar.

Por qué es más peligroso que la versión directa

Un agente manipulado produce una acción mala, ejecutada con los permisos que vos le diste, contra sistemas a los que ya tiene acceso legítimo. Esa es la diferencia clave: el daño no depende de que el atacante rompa ninguna barrera de seguridad — depende de que el agente ya tenía el permiso, y la inyección solo lo redirige hacia un uso no autorizado de ese permiso.

Incidentes reales documentados en 2025-2026

La lista de casos reales ya no es hipotética: investigadores demostraron exfiltración de datos "zero-click" desde Microsoft 365 Copilot (EchoLeak, CVE-2025-32711); se documentó envenenamiento de memoria persistente en agentes de Amazon Bedrock que sobrevive entre sesiones distintas; Unit 42 de Palo Alto reportó en diciembre de 2025 el primer caso real documentado de prompt injection indirecto malicioso. Google, monitoreando entre 2,000 y 3,000 millones de páginas rastreadas por mes, observó un aumento relativo de 32% en actividad maliciosa de esta categoría entre noviembre de 2025 y febrero de 2026.

Dónde se esconden las instrucciones maliciosas

Los vectores más comunes son sitios estáticos de apariencia inocente — blogs, foros, secciones de comentarios — exactamente el tipo de contenido que un agente con capacidad de navegación web visita de forma rutinaria como parte de su trabajo normal. No hace falta comprometer un sitio grande: alcanza con que el agente lo visite una sola vez con los permisos equivocados activos.

Cómo mitigarlo en arquitecturas propias

La defensa más efectiva no es intentar que el modelo "reconozca" instrucciones maliciosas de forma perfecta (va a fallar, tarde o temprano) — es limitar qué puede hacer un agente después de leer contenido no confiable: separar explícitamente el contenido que el agente lee de las instrucciones que puede ejecutar, exigir confirmación humana para acciones de alto impacto que se originen después de procesar contenido externo, y tratar cualquier fuente de datos que el agente consuma (web, email, documentos de terceros) como potencialmente hostil por defecto, no como neutral.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com