Google presentó Gemini 3.5 Transcribe, un nuevo modelo de inteligencia artificial especializado en convertir voz en texto de manera más precisa y natural. La compañía asegura que se trata de su modelo de transcripción más preciso hasta ahora, diseñado no solo para reconocer palabras, sino también para comprender la intención y el estilo de quien habla.
Una de sus principales novedades es que puede transcribir conversaciones en más de 85 idiomas, incluso cuando existen acentos regionales o dialectos. Además, el sistema es capaz de eliminar expresiones de relleno, como “eh” o “ah”, para entregar un texto más limpio y fácil de leer, sin perder el sentido de lo que realmente quiso decir la persona.
La tecnología también está preparada para situaciones más complicadas. Gemini 3.5 Transcribe puede trabajar con audio en ambientes ruidosos, distinguir hasta tres personas diferentes en una grabación e incluir marcas de tiempo para identificar cada intervención. También puede reconocer las autocorrecciones que una persona hace mientras habla y reflejar en el texto la versión final de su mensaje.
Google destaca además una importante mejora en el rendimiento. El modelo registra una tasa promedio de error de palabras del 4 % en transmisiones en tiempo real y del 2,6 % en casos sin transmisión, mientras que la compañía asegura que la transcripción final puede completarse hasta un 70 % más rápido que con el modelo anterior.
Pero la apuesta de Google va más allá de simplemente pasar una grabación a texto. Gemini 3.5 Transcribe se está incorporando a herramientas como Gboard, Gemini, Google AI Studio y Antigravity, permitiendo utilizar la voz para escribir, programar, resumir archivos o ejecutar diferentes tareas tomando en cuenta el contexto de lo que el usuario está haciendo.
La compañía también prepara su llegada a Chrome, donde permitirá dictar directamente en diferentes campos de texto de una página web. El modelo ya está disponible para algunos usuarios y desarrolladores en distintas plataformas, mientras Google continúa ampliando sus funciones para convertir la voz en una forma cada vez más completa de interactuar con sus herramientas de inteligencia artificial.









