Chirp
La precedente famiglia di modelli di sintesi vocale di Google, ora ampiamente sostituita dalla trascrizione integrata direttamente in Gemini.
Chirp era il modello di riconoscimento vocale dedicato di Google, ciò che trasformava l’audio in testo dietro i prodotti e le API cloud. Era un modello vocale convenzionale, nel senso che trascriveva ciò che sentiva e si fermava lì.
Appare nella nostra copertura principalmente come riferimento rispetto al quale vengono misurati i modelli più recenti. I modelli di trascrizione Gemini di Google vengono confrontati con Chirp 3 sulla precisione e sul tempo di attesa per una trascrizione finale, e il passaggio da un modello vocale autonomo a un modello linguistico che esegue l’ascolto è ciò che consente a quelli più recenti di ripulire le parole di riempimento e le autocorrezioni man mano che procedono.