Comparativa de costos en Bedrock: Claude vs. Llama vs. Nova para la misma tarea

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Los tres proveedores dentro de Bedrock cotizan por millón de tokens — pero comparar solo ese número sin considerar cached tokens, batch pricing, y provisioned throughput te puede hacer pagar 2-3x más de lo necesario por el mismo trabajo.

Los precios base, familia por familia

Amazon Nova Micro cotiza a $0.035 por millón de tokens de entrada y $0.14 de salida; Nova Lite a $0.06/$0.24; Nova Pro a $0.80/$3.20. Meta Llama 4 8B cuesta $0.18 de entrada / $0.24 de salida por millón de tokens; Llama 4 70B, $0.65/$0.86; Llama 4 405B, $1.95/$2.56. Claude Sonnet 5 en Bedrock cotiza a $2/$10 por millón de tokens de entrada/salida hasta el 31 de agosto de 2026 como tarifa promocional, subiendo a $3/$15 después.

El descuento que casi nadie aprovecha: cached tokens

Los tokens de entrada cacheados cuestan aproximadamente 10% de la tarifa base — para arquitecturas con un system prompt largo o contexto repetido entre llamadas (como un agente que reenvía historial de conversación en cada turno), activar caching puede reducir el costo efectivo de esa porción del prompt en 90%, sin cambiar absolutamente nada del comportamiento del modelo.

Batch pricing: 50% de descuento si podés esperar

El pricing por lotes (batch) ofrece 50% de descuento sobre las tarifas estándar — la condición es que el trabajo no necesite respuesta en tiempo real. Para tareas como clasificación masiva de un dataset histórico, generación de reportes nocturnos, o cualquier pipeline que no esté en el camino crítico de una interacción de usuario, el batch pricing es, literalmente, la mitad del costo por el mismo trabajo.

Provisioned throughput: ahorro a cambio de compromiso

El throughput aprovisionado ofrece entre 15% y 30% de ahorro en cargas de trabajo predecibles de alto volumen, a cambio de un compromiso de uno o seis meses — tiene sentido cuando ya tenés un patrón de uso estable y conocido, no durante la fase de experimentación donde el volumen todavía es incierto.

Cómo armar la comparación real para tu caso de uso

El número de "$X por millón de tokens" en la página de precios rara vez es el costo real que vas a pagar — la comparación honesta necesita simular el patrón de uso real de tu aplicación específica (¿cuánto contexto se repite y podría cachearse? ¿el trabajo tolera batch? ¿el volumen es predecible?) antes de decidir qué familia de modelo es más barata para tu caso, en vez de comparar solo el precio de lista.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com