Una cadena de IA en producción sin trazabilidad es una caja negra que falla en silencio. LangSmith resuelve esto con tracing nativo, datasets de evaluación y alertas sobre métricas de calidad.
Cuando una cadena de RAG con 4-5 pasos (reescritura de consulta, recuperación, re-ranking, generación) produce una respuesta incorrecta, la pregunta operativa es "¿en qué paso se rompió?". Sin trazabilidad estructurada, la única opción es reproducir el caso con logs de `print()` dispersos. LangSmith captura automáticamente cada invocación de cada `Runnable` en la cadena —inputs, outputs, latencia, tokens, costo— y los organiza en un árbol de ejecución navegable.
La instrumentación básica no requiere cambios de código, solo variables de entorno:
El campo `LANGCHAIN_PROJECT` es clave para separar entornos: en nuestros despliegues usamos un proyecto distinto para `dev`, `staging` y `prod`, lo que evita que trazas de pruebas contaminen las métricas de producción.
Para lógica que no es un `Runnable` nativo —por ejemplo, una función de post-procesamiento con reglas de negocio antes de devolver la respuesta al usuario— el decorador `@traceable` la integra al mismo árbol de traza:
Esto es especialmente útil en sectores regulados donde el pipeline incluye pasos de compliance que no son llamadas a modelo pero sí deben quedar auditados.
LangSmith permite construir datasets de pares pregunta-respuesta esperada a partir de trazas reales marcadas por un revisor humano, y correr evaluaciones automáticas contra ellos usando evaluadores LLM-as-judge o métricas determinísticas:
Correr esto en el pipeline de CI antes de cada despliegue permite detectar regresiones de calidad —por ejemplo, tras cambiar el modelo o el prompt— antes de que lleguen a producción, algo que consideramos no negociable para cualquier cadena que toque decisiones de negocio.
Cada traza incluye tokens de entrada/salida y costo estimado por invocación, agregables por proyecto, por tag o por usuario final si se pasa metadata en el `RunnableConfig` (`configurable={"user_id": "..."}`). Esto convierte a LangSmith en una herramienta de FinOps además de debugging: hemos usado esta vista para detectar que un prompt mal optimizado triplicaba el consumo de tokens en el 5% de las consultas más largas, un hallazgo que sin trazas agregadas hubiera pasado desapercibido en la factura mensual del proveedor.
LangSmith permite configurar reglas de alerta sobre métricas agregadas (tasa de error, latencia P95, score de evaluadores en línea) que notifican vía webhook cuando se cruza un umbral. En despliegues críticos recomendamos conectar esto a Slack o PagerDuty, de forma que una degradación de calidad del modelo —por ejemplo, tras un cambio silencioso del proveedor— dispare una alerta antes de que el equipo de soporte reciba las quejas de los usuarios.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel