Un modelo sin barreras de contenido es un riesgo legal y reputacional para cualquier empresa. Guardrails for Amazon Bedrock aplica esas barreras a nivel de plataforma, independiente del modelo que use detrás.
Guardrails for Amazon Bedrock es una capa de políticas configurable que se aplica tanto al input del usuario como al output del modelo, independientemente de qué modelo fundacional esté generando la respuesta. Esto es relevante porque las salvaguardas nativas de cada modelo varían en cobertura y en cómo se documentan — Guardrails da a la organización un control centralizado y auditable que no depende de las políticas internas de cada proveedor.
Un guardrail se define una vez y se asocia a múltiples invocaciones (Agents, Knowledge Bases, o llamadas directas a `InvokeModel`), lo que evita reimplementar la misma lógica de moderación en cada aplicación que consume Bedrock.
Bedrock aplica clasificadores de contenido dañino sobre seis categorías: odio, insultos, sexual, violencia, mal uso/criminal (misconduct) y prompt injection (jailbreak). Para cada categoría se configura un umbral de severidad (bajo, medio, alto) tanto para el filtrado de entrada como de salida, permitiendo, por ejemplo, ser más estricto con el output que se muestra a usuarios finales que con el input que un empleado interno puede escribir.
Además de las categorías genéricas de daño, Guardrails permite definir "denied topics" específicos del negocio — por ejemplo, un banco que quiere impedir que su asistente dé asesoría de inversión no regulada, o una aseguradora que no quiere que el modelo confirme coberturas sin validación humana. Cada tema denegado se define con una descripción en lenguaje natural y ejemplos de frases representativas, que el propio Bedrock usa para entrenar el clasificador de bloqueo.
Los filtros de palabras (word filters) complementan esto con listas explícitas de términos prohibidos o marcas de la competencia que no deben mencionarse, útil para casos donde el bloqueo debe ser determinístico y no depender de la interpretación semántica de un clasificador.
Guardrails detecta y puede enmascarar o bloquear información personal identificable — números de tarjeta de crédito, direcciones de correo, números de seguro social, direcciones físicas, y varias entidades más — tanto configurando el comportamiento por tipo de entidad (bloquear la solicitud completa vs. reemplazar con una etiqueta como `{EMAIL}`) de forma independiente para entrada y salida. Esto es central para cumplir con regulaciones de protección de datos personales en Latinoamérica que exigen minimización de exposición de datos sensibles en logs y en las respuestas del modelo.
Cuando el guardrail se usa junto con una Knowledge Base, el chequeo de contextual grounding compara la respuesta generada contra el contexto recuperado y calcula un score de fundamentación (grounding score) y un score de relevancia. Si la respuesta se aparta demasiado de lo que dicen los documentos fuente — es decir, si el modelo está alucinando o extrapolando — el guardrail puede bloquear o reemplazar la respuesta antes de que llegue al usuario.
Este mecanismo es particularmente valioso en sectores regulados (salud, banca, seguros) donde una respuesta no fundamentada en la documentación oficial puede tener consecuencias legales directas.
Un guardrail se asocia a una invocación pasando `guardrailIdentifier` y `guardrailVersion` en la llamada a `Converse` o `InvokeModel`. Cada intervención del guardrail (bloqueo o modificación) se registra y puede monitorearse vía CloudWatch Metrics y logs de invocación, lo que permite a equipos de compliance auditar cuántas solicitudes fueron bloqueadas, por qué categoría y con qué frecuencia — información esencial para reportes de auditoría interna o regulatoria. Publique estas métricas en un dashboard y revíselas mensualmente: los patrones de bloqueo suelen revelar tanto intentos de abuso como fricciones legítimas de usuarios que el guardrail está sobre-restringiendo.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel