"Modo JSON" suena a garantía. No lo es — el modelo puede seguir saltándose campos obligatorios o inventando otros nuevos. La garantía real viene de una tecnología distinta, más profunda: constrained decoding.
El modo JSON fuerza JSON sintácticamente válido, pero el modelo todavía puede saltarse campos requeridos, inventar campos nuevos, o devolver los tipos incorrectos. En contraste, Structured Outputs garantiza que cada campo del schema definido va a aparecer en el output exactamente como se definió, sin sorpresas — la diferencia entre "es JSON válido" y "es el JSON que pediste, con la forma exacta que pediste".
El decoding restringido por gramática excluye tokens específicos en posiciones determinadas del output — evitando palabras dañinas o forzando adherencia a una gramática de salida definida por el usuario para lenguajes como JSON o SQL. El decoding restringido aplica validez durante la generación misma, enmascarando tokens inválidos en cada paso — no valida después de generar, previene la generación inválida desde el principio.
XGrammar es el backend de generación estructurada por defecto de vLLM, SGLang, y TensorRT-LLM desde marzo de 2026, logrando menos de 40 microsegundos por token con overhead casi nulo en generación de JSON. llguidance, de Microsoft, usa un parser Earley basado en Rust a aproximadamente 50 microsegundos por token con costos de arranque insignificantes — la preocupación histórica de que la salida estructurada era "más lenta" prácticamente desapareció.
OpenAI soporta salida estructurada nativa desde agosto de 2024, Google Gemini desde 2024 (expandido en 2026), Anthropic en beta desde noviembre de 2025 con disponibilidad general a inicios de 2026, y Cohere y xAI (Grok) también lo soportan — para 2026, ya no es una característica exclusiva de un proveedor, es un estándar de facto entre los labs de frontera.
JSON mode alcanza para casos de bajo riesgo donde un campo faltante ocasional es tolerable. Function calling tiene sentido cuando la salida estructurada representa una llamada a una herramienta específica con un schema ya definido por esa herramienta. Structured Outputs con garantía real de schema es la opción correcta cuando el output alimenta directamente un sistema downstream (una base de datos, otro servicio) donde un campo faltante o mal tipado rompe algo más allá del LLM mismo.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel