Google lanza Gemini 3.5 Transcribe, su modelo de voz a texto más preciso hasta ahora

By Carlos Montiel | Especialista en IA Empresarial
Read in English →
Publicado: 2026-08-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Google DeepMind lanzó el 26 de agosto de 2026 Gemini 3.5 Transcribe, un modelo de voz a texto que la compañía describe como su transcripción más precisa hasta la fecha, con soporte para más de 85 idiomas y una tasa de error de palabra de apenas 2.6% en modo no continuo.

Qué hace distinto a este modelo

A diferencia de un reconocimiento de voz convencional, Gemini 3.5 Transcribe no solo transcribe el audio de forma literal: elimina muletillas ("eh", "este"), limpia autocorrecciones a mitad de frase y busca capturar la intención real de quien habla para entregar texto ya pulido y con formato, según el anuncio oficial de Google. La compañía reporta una tasa de error de palabra de 4.0% en modo streaming y 2.6% en modo no continuo, con una mejora del 70% en el tiempo hasta obtener la transcripción final frente a Chirp 3, su modelo anterior.

Dónde está disponible

El modelo comienza a distribuirse en la app de Gemini para macOS y en la función Rambler de Android, y Google confirmó que próximamente permitirá dictado por voz a texto en cualquier campo web de Chrome. Para desarrolladores, ya está disponible en vista previa pública a través de Google AI Studio y Google Antigravity, lo que habilita su integración vía API en productos propios.

Gemini 3.5 Transcribe — ficha técnica Idiomas soportados: 85+ Tasa de error de palabra: 4.0% (streaming) / 2.6% (no continuo) Mejora de velocidad vs. Chirp 3: 70% más rápido hasta transcripción final Disponibilidad: Gemini App (macOS), Rambler (Android), próximamente Chrome Acceso para desarrolladores: Google AI Studio, Google Antigravity (vista previa pública)
Qué significa esto para empresas con soporte o ventas por voz: un modelo de transcripción con menos de 3% de error y soporte nativo para más de 85 idiomas reduce de forma directa el trabajo de revisión humana en transcripción de llamadas de call center, notas de reuniones comerciales y análisis de calidad de atención al cliente. Para empresas en Guatemala y Latinoamérica que operan centros de contacto multilingües o que atienden mercados en varios países de la región, integrar este tipo de modelo vía API puede convertir horas de audio en texto estructurado y analizable casi en tiempo real, sin depender de servicios de transcripción manual más lentos y costosos.
Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com