Chirp
L'ancienne famille de modèles de synthèse vocale de Google, désormais largement remplacée par la transcription intégrée directement dans Gemini.
Chirp était le modèle de reconnaissance vocale dédié de Google, celui qui transformait l’audio en texte derrière les produits et les API cloud. Il s’agissait d’un modèle de parole conventionnel dans le sens où il retranscrivait ce qu’il entendait et s’arrêtait là.
Il apparaît dans notre couverture principalement comme référence par rapport à laquelle les modèles les plus récents sont mesurés. Les modèles de transcription Gemini de Google sont comparés à Chirp 3 en termes de précision et de temps d’attente pour une transcription finale, et le passage d’un modèle de parole autonome à un modèle de langage effectuant l’écoute est ce qui permet aux plus récents de nettoyer les mots de remplissage et les auto-corrections au fur et à mesure.