Chirp
La familia anterior de modelos de voz a texto de Google, ahora reemplazada en gran medida por la transcripción integrada directamente en Gemini.
Chirp era el modelo de reconocimiento de voz dedicado de Google, lo que convertía el audio en texto detrás de los productos y las API de la nube. Era un modelo de habla convencional en el sentido de que transcribía lo que oía y se detenía allí.
Aparece en nuestra cobertura principalmente como punto de referencia con el que se miden los modelos más nuevos. Los modelos de transcripción Gemini de Google se comparan con Chirp 3 en cuanto a precisión y cuánto tiempo se espera para obtener una transcripción final, y el cambio de un modelo de voz independiente a un modelo de lenguaje que escucha es lo que permite a los más nuevos limpiar las palabras de relleno y las autocorrecciones a medida que avanzan.