No hace falta salir de Vertex AI para usar un modelo de pesos abiertos — Google ya integró Gemma, Llama, y Mistral en el mismo Model Garden donde vive Gemini.
Seis laboratorios grandes ya despliegan modelos open-weight competitivos: Google (Gemma 4), Alibaba (Qwen 3.6 Plus), Meta (Llama 4), Mistral (Small 4), OpenAI (gpt-oss-120b), y Zhipu AI (GLM-5). En la mayoría de los benchmarks que importan para cargas de trabajo de producción, el ecosistema open-weight ya cerró o redujo sustancialmente la brecha con los modelos de frontera cerrados.
Gemma 4 es la familia open-weight más pensada específicamente para despliegue on-device y edge, con una línea que va desde una variante de 2B apta para dispositivos móviles hasta un flagship de 270B — dentro del mismo Vertex AI, podés elegir el punto exacto de la línea que corresponde a tu restricción de recursos específica.
En 2026, las familias con licencia más permisiva incluyen Mistral (gran parte de su línea bajo Apache 2.0), DeepSeek y Microsoft Phi (ambos bajo MIT), y muchos modelos Qwen de Alibaba (Apache 2.0) — antes de comprometerte con un modelo open-weight para uso comercial, la licencia específica de esa versión puede importar tanto como su desempeño en benchmarks.
Existen configuraciones de despliegue verificadas para cerca de 400 modelos de generación de texto de Hugging Face —incluyendo google/gemma-7b-it, meta-llama/Llama-2-7b-chat-hf, y mistralai/Mistral-7B-v0.1— directamente en Vertex AI, lo que significa que el despliegue no requiere salir del ecosistema de GCP ni gestionar infraestructura de inferencia propia.
Tiene sentido cuando necesitás control total sobre los pesos (fine-tuning profundo, auditoría del modelo, requisitos de soberanía de datos que exigen que el modelo mismo, no solo los datos, permanezca bajo control verificable), o cuando un modelo open-weight específico supera a Gemini en tu benchmark propio para una tarea de nicho. Para la mayoría de los casos de uso generales, Gemini sigue siendo la opción de menor fricción dentro de Vertex AI — la opción open-weight es la respuesta a una necesidad específica, no el punto de partida por defecto.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel