El nuevo modelo de transcripción de Google limpia tus mensajes instantáneos y tus cambios de opinión
Gemini 3.5 Transcribe maneja 85 idiomas, elimina las palabras de relleno y corrige cuando dices martes y quieres decir miércoles. Ya está en Gboard en Android y en la aplicación Gemini en macOS.
Google ha lanzado Gemini 3.5 Transcribe, un modelo de voz a texto que hace más que escribir lo que dices. Detecta y transcribe más de 85 idiomas automáticamente, elimina palabras de relleno, da formato al texto por sí solo y corrige silenciosamente las autocorrecciones. Di “quedémonos el martes, no, miércoles” y obtendrás el miércoles, no todo el tropiezo.
Las cifras de precisión, medidas por el equipo independiente Artificial Analysis, son una tasa de error de palabras del 4,0 por ciento para la transmisión en vivo y del 2,6 por ciento para el audio grabado. La tasa de error de palabras es simplemente la proporción de palabras en las que el modelo se equivoca, por lo que cuanto menor sea mejor, y el 2,6 por ciento es aproximadamente un error cada cuarenta palabras. En el punto de referencia multilingüe FLEURS en un conjunto de idiomas principales, las cifras son más altas: 5,50 por ciento en streaming y 5,04 por ciento grabado, que es el número más honesto si no hablas inglés. El tiempo hasta una transcripción final es un 70 por ciento más rápido que Chirp 3, el modelo al que reemplaza. Para audio grabado, puede atribuir voz a hasta tres hablantes con marcas de tiempo a nivel de palabra, y tres o más aún son experimentales.
Hay dos formas de ingresar. La API Live maneja la transmisión en tiempo real con un retraso inferior a un segundo para cosas como asistentes de voz y subtítulos. La API de Interactions maneja archivos grabados, reuniones y registros de llamadas. Ambos están en versión preliminar pública a través de Google AI Studio, con una ruta empresarial a través de Gemini Enterprise Agent Platform.
Qué está pasando realmente aquí: los modelos convencionales de reconocimiento de voz transcriben sonido a texto y se detienen. Este es un modelo de lenguaje que realiza la transcripción, por lo que puede decidir que “um” no era parte de tu oración y que cambiaste de opinión a mitad de la oración. Ese también es el riesgo. Un modelo que edita mientras escucha está tomando decisiones, y para una nota médica, una declaración legal o una entrevista de investigación, es posible que desee conservar los tropiezos exactamente como se dijeron. Actualmente, Google no ofrece un modo textual sin formato como opción de título, así que verifique lo que obtiene antes de crear un flujo de trabajo con él.
Qué significa esto para ti: si estás en Android, ya tienes algo de esto. La función Rambler en Gboard la utiliza para convertir divagaciones habladas en texto formateado, en países e idiomas seleccionados, y que puedes editar con voz. La aplicación Gemini en macOS la tiene en inglés y próximamente será compatible con Chrome, lo que significará dictar en cualquier campo de texto web. Si construye cosas, este es un reemplazo plausible para cualquier servicio de transcripción por el que pague ahora, aunque es una vista previa, así que trátelo como tal. Y si ha evitado el dictado porque limpiar el resultado tomó más tiempo que escribir, esta es la queja específica para la que se creó el modelo. Vale la pena hacer una prueba honesta con tu propio acento antes de comprometerte.
Fuentes
Fuentes: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Granite 4.2 de IBM es gratuito, lo suficientemente pequeño como para ejecutarse localmente y diseñado para pensar primero
Tres modelos abiertos en 3B, 8B y 30B bajo una licencia Apache 2.0, además de un modelo de voz de 470 millones de parámetros que transcribe tres horas de audio en aproximadamente un segundo.