Meta cambió de arquitectura densa a mixture-of-experts con Llama 4, y ese cambio técnico tiene implicaciones directas en qué hardware necesitas y qué licencia estás aceptando realmente.
A diferencia de Llama 2 y 3, que usaban arquitecturas transformer densas (todos los parámetros se activan en cada forward pass), Llama 4 adoptó Mixture of Experts (MoE): el modelo tiene un número grande de parámetros totales, pero solo un subconjunto ("expertos" activados por un router) se usa por token procesado. Esto es la misma familia de técnicas que usan Mixtral de Mistral y (se especula) GPT-4.
La ventaja práctica es que puedes tener un modelo con cientos de miles de millones de parámetros totales pero con un costo de inferencia comparable al de un modelo denso mucho más pequeño, porque solo los parámetros activos consumen cómputo por token. La desventaja es que el modelo completo todavía necesita estar cargado en memoria (VRAM o RAM) aunque no se use todo en cada paso, así que el ahorro es en cómputo, no en footprint de memoria total.
Meta liberó Llama 4 en dos variantes principales orientadas a distinto hardware objetivo. Scout es la variante más ligera en parámetros activos, diseñada para correr en una sola GPU de clase alta (piensa H100), con una ventana de contexto extendida agresivamente — Meta la posicionó con soporte de hasta 10 millones de tokens de contexto, aunque en la práctica el rendimiento efectivo (recall real sobre contexto largo) se degrada mucho antes de llegar a ese límite teórico, un patrón que se repite en casi todos los modelos que anuncian contextos "extremos".
Maverick es la variante de mayor capacidad, con más expertos totales y mejor desempeño en benchmarks de razonamiento y código, pero requiere multi-GPU para correr en FP16/BF16 — no es viable en un solo nodo de consumo, y su despliegue realista requiere paralelismo de tensores across múltiples GPUs con NVLink o interconexión equivalente.
Llama no usa una licencia OSI-aprobada como MIT o Apache 2.0 — usa la "Llama Community License", que impone restricciones específicas: empresas con más de 700 millones de usuarios activos mensuales necesitan una licencia comercial separada de Meta, y hay cláusulas de atribución obligatoria (debes incluir "Built with Llama" en productos derivados). Esto la hace "open-weight" (pesos descargables y modificables) pero no "open-source" en el sentido estricto de la Open Source Initiative, una distinción que sí importa legalmente para empresas que planean redistribuir o servir el modelo comercialmente a gran escala.
Para la inmensa mayoría de empresas en Latinoamérica que usarían Llama 4 internamente o en un producto propio sin alcanzar ese umbral de usuarios, la licencia es permisiva y sin costo — el punto de atención real es solo el fine-tuning y redistribución de pesos derivados, donde las cláusulas de atribución sí aplican.
Comparado con otros modelos open-weight de peso similar en categoría (Qwen2.5/Qwen3 de Alibaba, Mistral Large, DeepSeek-V3), Llama 4 no domina de forma aplastante en todos los benchmarks — la narrativa de "Meta siempre lidera open-weight" se debilitó considerablemente durante 2024-2025 con la fuerte entrada de los modelos chinos (Qwen y DeepSeek), que en varios benchmarks de código y razonamiento matemático superan a las variantes de Llama de tamaño comparable. La elección real hoy depende más del caso de uso específico y del ecosistema de herramientas (fine-tuning, cuantización, soporte de librerías) que de un benchmark único.
Dado el tamaño de las variantes de Llama 4, correrlo localmente en hardware de una sola GPU de consumo solo es viable con cuantización agresiva y probablemente solo para Scout. Para la mayoría de casos empresariales, el camino práctico es: Ollama o vLLM para Scout cuantizado en GGUF sobre una GPU de 24-48GB, o proveedores de inferencia gestionada (Groq, Together AI, Fireworks) para Maverick, donde el costo de infraestructura propia no se justifica frente al precio por token del servicio.
Llama 4 tiene sentido cuando ya tienes infraestructura Meta-adjacent (uso de PyTorch, familiaridad con el ecosistema de herramientas de fine-tuning como torchtune), cuando necesitas contexto extendido genuino para documentos muy largos, o cuando la garantía de soporte a largo plazo de un actor como Meta pesa en tu decisión de riesgo. Para la mayoría de proyectos RAG o de agentes con documentos de tamaño normal, modelos más pequeños y eficientes (Qwen2.5 14B-32B, Mistral Small) suelen dar mejor relación costo-beneficio que desplegar la familia Llama 4 completa.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel