Whisper: transcripción de voz open-source de OpenAI

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~5 minutos

Whisper es probablemente el modelo open-weight más subestimado de OpenAI: transcribe voz con precisión casi humana en decenas de idiomas y es gratis de correr en tu propia infraestructura.

Qué es y por qué importa

Whisper es un modelo encoder-decoder tipo Transformer entrenado por OpenAI con 680,000 horas de audio multilingüe supervisado, liberado en 2022 con pesos abiertos bajo licencia MIT. A diferencia de GPT, aquí OpenAI sí liberó los pesos completos — desde el modelo `tiny` (39M parámetros) hasta `large-v3` (1.55B parámetros) — lo que permite correrlo localmente sin límites de API ni costo por minuto.

Su arquitectura hace algo más que transcribir: en el mismo forward pass puede detectar el idioma hablado, traducir a inglés, y segmentar por timestamps, porque fue entrenado multi-tarea desde el inicio en vez de ser un modelo de transcripción puro adaptado después.

pip install openai-whisper whisper audio.mp3 --model large-v3 --language Spanish --output_format srt

Precisión real: qué esperar por idioma

El benchmark oficial de OpenAI muestra WER (Word Error Rate) muy competitivo en inglés (~3-4% en large-v3 sobre datasets estándar), pero la precisión cae de forma desigual en otros idiomas según cuánto audio de ese idioma existía en el corpus de entrenamiento. Español tiene buena cobertura y funciona bien incluso con acentos latinoamericanos variados, pero notamos degradación notable en: audio con ruido de fondo significativo (call centers, ambientes industriales), superposición de hablantes, y jerga o terminología técnica muy específica de dominio (nombres de medicamentos, términos legales locales).

Para este último problema, la técnica de "prompting" de Whisper — pasar un `initial_prompt` con vocabulario esperado — mejora la precisión en terminología de dominio sin necesidad de fine-tuning, aunque su efecto es limitado comparado con un fine-tune real.

faster-whisper: la variante que se usa en producción

El Whisper original de OpenAI en PyTorch es lento y consume mucha VRAM para uso a escala. faster-whisper, una reimplementación usando CTranslate2 (el mismo motor de inferencia optimizado que usa OpUS-MT), da entre 4x y 8x más velocidad con menor uso de memoria y prácticamente la misma precisión, porque usa cuantización INT8 y kernels optimizados sin tocar la arquitectura del modelo.

from faster_whisper import WhisperModel model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16") segments, info = model.transcribe("audio.mp3", language="es") for s in segments: print(f"[{s.start:.1f}s -> {s.end:.1f}s] {s.text}")

Para casi cualquier despliegue de producción, faster-whisper (o su envoltorio como servidor, whisper.cpp para CPU/edge, o el servidor de inferencia de faster-whisper vía WhisperX) es la opción correcta sobre el paquete original.

WhisperX: diarización y alineamiento de palabras

Whisper por sí solo no hace "speaker diarization" (identificar quién habló qué) y sus timestamps a nivel de palabra son poco precisos porque fueron entrenados a nivel de segmento, no de palabra. WhisperX resuelve ambos problemas: alinea el output de Whisper con un modelo de reconocimiento fonético forzado (wav2vec2) para timestamps precisos por palabra, y añade diarización usando pyannote.audio.

Esto es crítico para casos de uso reales como transcripción de reuniones, entrevistas o llamadas de call center donde necesitas saber "quién dijo qué y cuándo", no solo el texto plano.

Consideraciones de despliegue a escala

Para transcripción a volumen (miles de horas de audio al mes), las decisiones de arquitectura que más impactan costo son: batching de audio (procesar múltiples archivos en paralelo aprovechando VRAM disponible), el tamaño de modelo correcto para el caso de uso (large-v3 no siempre es necesario — `medium` da buena precisión en español con la mitad de cómputo), y VAD (voice activity detection) previo para no gastar cómputo transcribiendo silencio, algo que WhisperX y faster-whisper integran de forma nativa con modelos como Silero VAD.

En un despliegue reciente para un cliente que transcribe llamadas de ventas para análisis posterior con un LLM, usamos faster-whisper con `medium` cuantizado en INT8 sobre una GPU compartida, procesando ~200 horas de audio diarias con latencia de transcripción menor al tiempo real del audio (transcribir 1 hora de audio toma 8-12 minutos).

Cuándo usar la API en vez de self-hosting

Si tu volumen es bajo (unas pocas horas al mes) o esporádico, la API de OpenAI (o alternativas como Groq, que sirve Whisper con hardware LPU a velocidades muy altas) puede ser más barata que mantener infraestructura con GPU dedicada. El punto de quiebre económico típico está alrededor de las 50-100 horas de audio mensuales, dependiendo del costo de tu infraestructura GPU disponible vs. el precio por minuto de la API.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com