Reconnaissance vocale
Technologie qui convertit les données audio parlées en texte écrit.
La synthèse vocale, également connue sous le nom d’ASR pour Automatic Speech Recognition, transforme l’audio en texte. C’est derrière les notes de réunion, les sous-titres, les transcriptions de podcasts, la saisie vocale et les assistants vocaux. Les systèmes modernes peuvent gérer plusieurs langues, séparer les locuteurs et utiliser des prénoms ou des termes techniques.
Les modèles par lots traitent souvent les enregistrements terminés plus de trente fois plus rapidement qu’en temps réel. Les modèles de streaming écrivent en parlant sans pouvoir voir l’avenir. Les prix sont désormais de quelques fractions de centime par minute ; Les différences de précision sont souvent moindres que celles de commodité.