Un modelo de 70B parámetros en precisión completa no cabe en casi ninguna GPU disponible. La quantización lo comprime — la pregunta es qué formato conviene según dónde lo vas a correr.
Un parámetro en precisión FP16 ocupa 2 bytes; un modelo de 70B parámetros en FP16 necesita ~140GB solo para los pesos, antes de contar el contexto de inferencia. Quantizar reduce la precisión numérica de los pesos (a 8, 4 o incluso menos bits por parámetro) para que el mismo modelo quepa en una fracción de esa memoria, a cambio de una pérdida de calidad que en la práctica suele ser pequeña si el método de quantización es bueno. Los tres formatos que dominan el ecosistema open-source en 2026 — GGUF, AWQ y GPTQ — resuelven este problema con enfoques distintos, optimizados para escenarios distintos.
GGUF (sucesor de GGML) es el formato del proyecto llama.cpp, diseñado desde el inicio para correr modelos eficientemente en CPU y en GPUs de consumo con memoria limitada, incluyendo Apple Silicon (Metal). Empaqueta los pesos quantizados junto con metadata del modelo (tokenizer, arquitectura, parámetros) en un solo archivo portable, lo cual simplifica distribución — puedes descargar un `.gguf` y correrlo directo sin depender del framework original de entrenamiento.
La ventaja de GGUF es la accesibilidad: corre en una laptop sin GPU dedicada. La desventaja es que su throughput en GPUs de servidor de alta gama no compite con formatos optimizados específicamente para ese hardware.
GPTQ aplica quantización post-entrenamiento (PTQ) usando un pequeño dataset de calibración para decidir qué pesos son más sensibles a la pérdida de precisión y ajustar el error de cuantización capa por capa, en vez de redondear todos los pesos de forma uniforme. Esto le permite llegar a 4 bits o menos con una degradación de calidad menor que un redondeo ingenuo, y está bien soportado en GPU vía kernels optimizados (ExLlama, AutoGPTQ), lo cual lo hace popular para correr modelos grandes en una sola GPU de consumo con VRAM limitada (ej. una RTX de 24GB).
AWQ (Activation-aware Weight Quantization) parte de una observación distinta: no todos los pesos importan igual, pero lo que determina cuáles proteger no es solo la magnitud del peso sino cómo interactúa con las activaciones reales del modelo durante inferencia. AWQ identifica ese pequeño porcentaje de canales de peso "salientes" (los que más afectan la salida dado el patrón de activaciones) y los protege con mayor precisión, quantizando el resto agresivamente. El resultado suele preservar mejor la calidad que GPTQ en benchmarks de generación, y su diseño lo hace más rápido de integrar con motores de serving de producción como vLLM y TGI.
Para correr un modelo localmente en una laptop o servidor sin GPU dedicada, GGUF vía llama.cpp u Ollama (que usa GGUF internamente) es la opción más directa y con mejor ecosistema de herramientas. Para maximizar la calidad en una sola GPU de consumo con memoria limitada, GPTQ sigue siendo una opción sólida y ampliamente soportada. Para servir un modelo en producción a través de vLLM u otro motor de inferencia a escala, AWQ suele dar el mejor balance entre calidad preservada y throughput, y es el formato que más motores de serving modernos priorizan soportar bien.
Ningún formato de quantización recupera capacidad que el modelo base no tenía — comprimen lo que ya existe, no lo mejoran. Y la pérdida de calidad no es uniforme entre tareas: tareas de generación de texto libre toleran quantización agresiva razonablemente bien, mientras que tareas que dependen de precisión numérica exacta (cálculos, seguir instrucciones muy específicas de formato) degradan más notablemente a 4 bits o menos. Vale la pena evaluar con tus propios prompts representativos antes de decidir el nivel de quantización para producción, no solo confiar en benchmarks genéricos publicados por cada formato.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel