Si nunca mediste la calidad de tu cadena con algo más riguroso que "probé unos prompts a mano y se veía bien", no tenés un sistema de evaluación — tenés una impresión.
La evaluación offline corre contra datasets curados durante el desarrollo para atrapar regresiones antes del despliegue, y funciona como unit tests para tu aplicación de LLM. Las evaluaciones offline se usan para testing previo al despliegue, incluyendo benchmarking, testing de regresión, unit testing, y backtesting — apuntan a ejemplos de datasets: casos de prueba curados con outputs de referencia que definen qué significa "bueno" para tu caso específico.
La evaluación online corre en producción y evalúa continuamente las interacciones reales de usuarios a medida que ocurren, para monitorear calidad sobre datos en vivo. Las evaluaciones online pueden identificar problemas para agregar a los datasets offline — cerrando el loop: lo que falla en producción se convierte en el próximo caso de prueba offline, evitando que el mismo problema se repita sin detección.
LangSmith permite evaluar la calidad del output con datasets offline y evaluadores online de tipo LLM-as-judge — usar un LLM para juzgar la calidad de la respuesta de otro LLM, contra criterios definidos explícitamente, es lo que hace viable evaluar a escala sin que un humano revise cada caso individualmente.
A 2026, LangSmith se expandió más allá de la observabilidad pura hacia un stack completo de operaciones de agentes — incluyendo LangSmith Fleet (antes Agent Builder) para despliegue, una vista de costo unificada a través de flujos de trabajo completos de agentes, y disponibilidad en AWS Marketplace para procurement empresarial. Ya no es solo una herramienta de debugging, es la capa de gestión operativa completa para agentes en producción.
No hace falta un programa de evaluación exhaustivo desde el día uno — empezá con un dataset offline pequeño (10-20 casos representativos de los fallos reales que ya viste), corré evaluación offline antes de cada cambio significativo a tu cadena, y agregá evaluación online solo cuando ya tengas tráfico de producción real que valga la pena monitorear continuamente.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel