Los tres proveedores dentro de Bedrock cotizan por millón de tokens — pero comparar solo ese número sin considerar cached tokens, batch pricing, y provisioned throughput te puede hacer pagar 2-3x más de lo necesario por el mismo trabajo.
Amazon Nova Micro cotiza a $0.035 por millón de tokens de entrada y $0.14 de salida; Nova Lite a $0.06/$0.24; Nova Pro a $0.80/$3.20. Meta Llama 4 8B cuesta $0.18 de entrada / $0.24 de salida por millón de tokens; Llama 4 70B, $0.65/$0.86; Llama 4 405B, $1.95/$2.56. Claude Sonnet 5 en Bedrock cotiza a $2/$10 por millón de tokens de entrada/salida hasta el 31 de agosto de 2026 como tarifa promocional, subiendo a $3/$15 después.
Los tokens de entrada cacheados cuestan aproximadamente 10% de la tarifa base — para arquitecturas con un system prompt largo o contexto repetido entre llamadas (como un agente que reenvía historial de conversación en cada turno), activar caching puede reducir el costo efectivo de esa porción del prompt en 90%, sin cambiar absolutamente nada del comportamiento del modelo.
El pricing por lotes (batch) ofrece 50% de descuento sobre las tarifas estándar — la condición es que el trabajo no necesite respuesta en tiempo real. Para tareas como clasificación masiva de un dataset histórico, generación de reportes nocturnos, o cualquier pipeline que no esté en el camino crítico de una interacción de usuario, el batch pricing es, literalmente, la mitad del costo por el mismo trabajo.
El throughput aprovisionado ofrece entre 15% y 30% de ahorro en cargas de trabajo predecibles de alto volumen, a cambio de un compromiso de uno o seis meses — tiene sentido cuando ya tenés un patrón de uso estable y conocido, no durante la fase de experimentación donde el volumen todavía es incierto.
El número de "$X por millón de tokens" en la página de precios rara vez es el costo real que vas a pagar — la comparación honesta necesita simular el patrón de uso real de tu aplicación específica (¿cuánto contexto se repite y podría cachearse? ¿el trabajo tolera batch? ¿el volumen es predecible?) antes de decidir qué familia de modelo es más barata para tu caso, en vez de comparar solo el precio de lista.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel