LangGraph checkpointing: por qué MemorySaver no sobrevive a producción

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Un agente que pierde su estado cada vez que el proceso se reinicia no es un agente en producción — es una demo con suerte de que nadie lo reinicie en mal momento.

Qué hace un checkpointer, exactamente

Un checkpointer es un mecanismo de persistencia de estado que usa LangGraph para guardar el estado actual de un grafo, almacenar memoria entre nodos, permitir reanudar la ejecución después de una falla, y mantener continuidad de conversación a través de múltiples requests. LangGraph guarda el estado de tu grafo después de cada ejecución de nodo individual — no solo al final, sino después de cada paso.

MemorySaver: solo para tests

Los sistemas de producción requieren un backend duradero (SqliteSaver para cargas de trabajo de un solo proceso, PostgresSaver o un saver respaldado por Redis para despliegues multi-proceso) para que el estado sobreviva a través del ciclo de vida completo del proceso. MemorySaver guarda todo en memoria del proceso — funciona perfecto para desarrollo local y tests, y se pierde por completo en el primer reinicio o al escalar a más de una réplica.

PostgreSQL: el backend duradero estándar

La librería `langgraph-checkpoint-postgres` te da un backend de checkpointing production-grade — duradero, escalable, y observable. Es la opción natural si tu arquitectura ya usa Postgres para el resto de la aplicación, evitando sumar una pieza de infraestructura nueva solo para esto.

Redis: cuando la latencia importa más

RedisSaver es rápido, distribuido, escalable, y se usa en despliegues reales para sistemas empresariales. Redis ofrece operaciones de lectura/escritura ultra rápidas (menos de 1ms de latencia) para guardar el estado del agente, con escalado lineal para despliegues de producción con necesidades de memoria crecientes — la opción correcta cuando la latencia del checkpoint en sí es parte del presupuesto de latencia total de la respuesta.

Cómo elegir según tu topología de despliegue

El backend de checkpointing correcto depende de la topología de despliegue: MemorySaver únicamente en tests; PostgresSaver o Redis para cualquier despliegue multi-proceso o en contenedores. Si ya corrés Postgres, empezá ahí — migrar a Redis después, si la latencia del checkpoint se vuelve un cuello de botella medible, es más fácil que migrar de MemorySaver a cualquiera de los dos bajo presión de un incidente en producción. ===ARTICLE_END">

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com