Un atacante no necesita comprometer tu modelo para manipular las respuestas de tu sistema RAG — le alcanza con lograr que cinco documentos maliciosos entren a tu base de conocimiento entre millones de documentos legítimos.
El prompt injection indirecto en RAG ocurre cuando instrucciones adversariales escondidas dentro de un documento recuperado llegan a la ventana de contexto del modelo y se ejecutan como comandos legítimos, sin que ningún contenido malicioso aparezca en la consulta original del usuario. Investigadores documentaron injection indirecto vía inputs de cara al cliente: un atacante envía inputs cuidadosamente diseñados a través de tickets de soporte, formularios de feedback, o contenido generado por usuarios que alimenta el corpus de RAG — y cuando la consulta de otro usuario dispara la recuperación de ese documento envenenado, las instrucciones inyectadas se ejecutan en el contexto del modelo.
El envenenamiento de base de conocimiento es la amenaza principal específica de RAG: un atacante que puede insertar o modificar documentos en la base de conocimiento puede incrustar instrucciones maliciosas que el LLM va a seguir cuando esos documentos se recuperen. Los adversarios inyectan documentos diseñados para ser simultáneamente relevantes a consultas específicas (así se recuperan con alta probabilidad) y contener instrucciones incrustadas diseñadas para anular el comportamiento del LLM una vez incluidos en el contexto.
Un estudio de USENIX Security 2025 demostró que inyectar solo cinco textos envenenados por pregunta objetivo en una base de conocimiento con millones de documentos puede lograr tasas de éxito de ataque del 90% en múltiples datasets de benchmark y LLMs distintos — una proporción de esfuerzo a impacto que hace de este uno de los vectores de ataque más eficientes contra sistemas de IA conocidos hasta ahora.
Si un atacante compromete la documentación de un proveedor, o puede inyectar contenido en documentación públicamente accesible que termina indexada, gana acceso indirecto al corpus de RAG del objetivo a través de un vector de cadena de suministro que no requiere ningún acceso directo a la organización objetivo — atacar a un tercero cuyo contenido tu sistema RAG indexa es, en la práctica, atacarte a vos sin tocar tu infraestructura.
La mitigación más efectiva no es intentar detectar contenido malicioso de forma perfecta — es limitar qué fuentes pueden contribuir contenido a la base de conocimiento sin revisión, aplicar controles de acceso granulares a nivel de documento (no solo a nivel de índice completo), y tratar cualquier fuente de contenido generado por usuarios o de terceros que alimente un sistema RAG como una superficie de ataque activa, con el mismo rigor que se aplicaría a código de terceros sin auditar.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel