Activar extended thinking sin pensarlo dos veces puede multiplicar tu factura de Claude por 6 en la misma tarea, sin necesariamente mejorar la respuesta. La clave es saber en qué tareas realmente compra algo.
Los tokens de pensamiento se facturan a la tarifa de salida. Un request típico de thinking extendido puede usar entre 5,000 y 20,000 tokens de pensamiento más 1,000-4,000 tokens de respuesta, costando aproximadamente entre $0.09 y $0.36 por solicitud, comparado con $0.015-$0.06 en modo estándar — hasta seis veces más caro por la misma pregunta. Con Opus, una solicitud de pensamiento intenso (50,000 tokens de pensamiento) cuesta cerca de $3.75 solo en tokens de razonamiento.
Activá extended thinking para tareas de razonamiento genuinamente complejas: matemática de nivel competitivo (AIME), problemas de programación con múltiples restricciones simultáneas, análisis extenso con evidencia contradictoria. Evitalo para tareas de generación directa (resumen, clasificación, preguntas y respuestas simples) donde el overhead agrega costo y latencia sin mejorar la calidad del resultado — es exactamente el mismo principio de "no uses un martillo para todo" que aplica a elegir entre modelos.
El campo `budget_tokens` se lanzó en marzo de 2026: le ponés un tope a cuánto puede pensar Claude antes de tener que responder. El modelo asigna ese presupuesto como quiera — simplemente no puede excederlo. Es la primera vez que Anthropic le dio al desarrollador control directo sobre el gasto de thinking, en vez de dejarlo enteramente a discreción del modelo.
La recomendación práctica: presupuestá entre 5,000 y 10,000 tokens de pensamiento para la mayoría de casos de uso, y 20,000+ solo para problemas genuinamente difíciles. Es una decisión que conviene tomar por tipo de tarea, no globalmente para toda la aplicación — un endpoint de clasificación no necesita el mismo presupuesto de thinking que un endpoint de análisis legal complejo.
La recomendación más importante es construir heurísticas propias basadas en evidencia sobre cuándo el costo vale la pena — corriendo el mismo conjunto de tareas representativas con y sin thinking extendido, y midiendo si la diferencia de calidad justifica la diferencia de costo para tu caso de uso específico, en vez de activar thinking extendido "por si acaso" en toda la aplicación.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel