Quantización de modelos: GGUF, AWQ y GPTQ explicados

By Carlos Montiel | Especialista en IA Empresarial
Read in English →
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~5 minutos

Un modelo de 70B parámetros en precisión completa no cabe en casi ninguna GPU disponible. La quantización lo comprime — la pregunta es qué formato conviene según dónde lo vas a correr.

Por qué quantizar

Un parámetro en precisión FP16 ocupa 2 bytes; un modelo de 70B parámetros en FP16 necesita ~140GB solo para los pesos, antes de contar el contexto de inferencia. Quantizar reduce la precisión numérica de los pesos (a 8, 4 o incluso menos bits por parámetro) para que el mismo modelo quepa en una fracción de esa memoria, a cambio de una pérdida de calidad que en la práctica suele ser pequeña si el método de quantización es bueno. Los tres formatos que dominan el ecosistema open-source en 2026 — GGUF, AWQ y GPTQ — resuelven este problema con enfoques distintos, optimizados para escenarios distintos.

GGUF: el formato para correr en CPU y hardware de consumo

GGUF (sucesor de GGML) es el formato del proyecto llama.cpp, diseñado desde el inicio para correr modelos eficientemente en CPU y en GPUs de consumo con memoria limitada, incluyendo Apple Silicon (Metal). Empaqueta los pesos quantizados junto con metadata del modelo (tokenizer, arquitectura, parámetros) en un solo archivo portable, lo cual simplifica distribución — puedes descargar un `.gguf` y correrlo directo sin depender del framework original de entrenamiento.

# Correr un modelo GGUF con llama.cpp ./llama-cli -m modelo-7b-Q4_K_M.gguf -p "Explica RAG en dos oraciones" # Variantes comunes de quantización GGUF: # Q8_0 -> casi sin pérdida, poco ahorro de memoria # Q4_K_M -> buen balance calidad/memoria, la más usada # Q2_K -> máxima compresión, pérdida de calidad notable

La ventaja de GGUF es la accesibilidad: corre en una laptop sin GPU dedicada. La desventaja es que su throughput en GPUs de servidor de alta gama no compite con formatos optimizados específicamente para ese hardware.

GPTQ: quantización post-entrenamiento calibrada

GPTQ aplica quantización post-entrenamiento (PTQ) usando un pequeño dataset de calibración para decidir qué pesos son más sensibles a la pérdida de precisión y ajustar el error de cuantización capa por capa, en vez de redondear todos los pesos de forma uniforme. Esto le permite llegar a 4 bits o menos con una degradación de calidad menor que un redondeo ingenuo, y está bien soportado en GPU vía kernels optimizados (ExLlama, AutoGPTQ), lo cual lo hace popular para correr modelos grandes en una sola GPU de consumo con VRAM limitada (ej. una RTX de 24GB).

AWQ: activation-aware, pensado para servir en producción

AWQ (Activation-aware Weight Quantization) parte de una observación distinta: no todos los pesos importan igual, pero lo que determina cuáles proteger no es solo la magnitud del peso sino cómo interactúa con las activaciones reales del modelo durante inferencia. AWQ identifica ese pequeño porcentaje de canales de peso "salientes" (los que más afectan la salida dado el patrón de activaciones) y los protege con mayor precisión, quantizando el resto agresivamente. El resultado suele preservar mejor la calidad que GPTQ en benchmarks de generación, y su diseño lo hace más rápido de integrar con motores de serving de producción como vLLM y TGI.

Cuál elegir según el caso de uso

Para correr un modelo localmente en una laptop o servidor sin GPU dedicada, GGUF vía llama.cpp u Ollama (que usa GGUF internamente) es la opción más directa y con mejor ecosistema de herramientas. Para maximizar la calidad en una sola GPU de consumo con memoria limitada, GPTQ sigue siendo una opción sólida y ampliamente soportada. Para servir un modelo en producción a través de vLLM u otro motor de inferencia a escala, AWQ suele dar el mejor balance entre calidad preservada y throughput, y es el formato que más motores de serving modernos priorizan soportar bien.

Lo que no cambia entre formatos

Ningún formato de quantización recupera capacidad que el modelo base no tenía — comprimen lo que ya existe, no lo mejoran. Y la pérdida de calidad no es uniforme entre tareas: tareas de generación de texto libre toleran quantización agresiva razonablemente bien, mientras que tareas que dependen de precisión numérica exacta (cálculos, seguir instrucciones muy específicas de formato) degradan más notablemente a 4 bits o menos. Vale la pena evaluar con tus propios prompts representativos antes de decidir el nivel de quantización para producción, no solo confiar en benchmarks genéricos publicados por cada formato.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com