Reconnaissance vocale
Technologie qui convertit les données audio parlées en texte écrit.
La synthèse vocale, également connue sous le nom d’ASR pour Automatic Speech Recognition, transforme l’audio en texte. C’est derrière les notes de réunion, les sous-titres, les transcriptions de podcasts, la saisie vocale et les assistants vocaux. Les systèmes modernes peuvent gérer plusieurs langues, séparer les locuteurs et utiliser des prénoms ou des termes techniques.
Les modèles par lots traitent souvent les enregistrements terminés plus de trente fois plus rapidement qu’en temps réel. Les modèles de streaming écrivent en parlant sans pouvoir voir l’avenir. Les prix sont désormais de quelques fractions de centime par minute ; Les différences de précision sont souvent moindres que celles de commodité.
-
Le nouveau modèle de transcription de Google nettoie vos ums et vos changements d'esprit
-
Granite 4.2 d'IBM est gratuit, suffisamment petit pour fonctionner localement et conçu pour penser avant tout
-
Google a transformé un modèle fini en un modèle beaucoup plus rapide et a publié la recette
-
Les nouveaux modèles de transcription d’OpenAI sont plus rapides et 25 % moins chers, mais pas les plus précis