Google DeepMind lanzó el 26 de agosto de 2026 Gemini 3.5 Transcribe, un modelo de voz a texto que la compañía describe como su transcripción más precisa hasta la fecha, con soporte para más de 85 idiomas y una tasa de error de palabra de apenas 2.6% en modo no continuo.
A diferencia de un reconocimiento de voz convencional, Gemini 3.5 Transcribe no solo transcribe el audio de forma literal: elimina muletillas ("eh", "este"), limpia autocorrecciones a mitad de frase y busca capturar la intención real de quien habla para entregar texto ya pulido y con formato, según el anuncio oficial de Google. La compañía reporta una tasa de error de palabra de 4.0% en modo streaming y 2.6% en modo no continuo, con una mejora del 70% en el tiempo hasta obtener la transcripción final frente a Chirp 3, su modelo anterior.
El modelo comienza a distribuirse en la app de Gemini para macOS y en la función Rambler de Android, y Google confirmó que próximamente permitirá dictado por voz a texto en cualquier campo web de Chrome. Para desarrolladores, ya está disponible en vista previa pública a través de Google AI Studio y Google Antigravity, lo que habilita su integración vía API en productos propios.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel