Tipos de memoria en LangChain: buffer, summary, y vectorial — cuándo usar cada uno

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Más memoria no siempre es mejor memoria — a veces es solo más tokens facturados sin mejorar la calidad de la respuesta.

Buffer memory: todo, tal como pasó

Conversation Buffer Memory guarda el historial de conversación completo exactamente como ocurrió, manteniendo todos los mensajes de forma secuencial — aunque puede volverse ineficiente en conversaciones largas por límites de tokens y consideraciones de costo. Conversation Buffer Window Memory retiene una cantidad determinada (2*k) de piezas de conversación como historial, fijando un valor de k — una variante que acota el crecimiento sin perder el contexto más reciente.

Summary memory: resumen en vez de transcripción completa

Conversation Summary Memory resume el registro de conversación histórico pasado en resúmenes para almacenamiento, donde la memoria usada es el resumen, no los datos de diálogo completos. Conversation Summary Buffer Memory guarda datos de historial de conversación sin exceder un `max_token_limit`, y para las partes que exceden ese límite, la información se extrae y se resume — un híbrido entre buffer y summary que balancea fidelidad reciente con compresión de lo antiguo.

Vector memory: recuperar solo lo relevante

Vector Store-Backed Memory usa similitud vectorial para recuperar documentos semánticamente relevantes de un almacén, mejorando la recuperación de contexto. Para recuperación factual específica, se usa VectorStoreRetrieverMemory — en vez de cargar todo el historial o un resumen genérico, esta variante busca activamente qué parte del historial es relevante para la pregunta actual.

La recomendación práctica de 2026

Empezá con ConversationBufferMemory o ConversationBufferWindowMemory para casos de uso básicos, y si la memoria se vuelve un cuello de botella o demasiado costosa, explorá ConversationSummaryMemory o ConversationBufferWindowMemory con un valor de k más chico — la progresión recomendada va de lo simple a lo complejo, no al revés, evitando sobre-ingeniería antes de confirmar que realmente hace falta.

Cómo elegir para tu caso de uso

Para conversaciones cortas de soporte al cliente: buffer window memory con k pequeño. Para asistentes de largo plazo con conversaciones extensas: summary buffer memory. Para agentes que necesitan recordar hechos específicos mencionados hace muchos turnos, sin cargar todo el historial: vector memory. La decisión correcta depende de si lo que importa es la conversación reciente completa, el contexto general resumido, o hechos puntuales específicos.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com