← Glossario Termine
Riconoscimento vocale
Tecnologia che converte i dati audio parlati in testo scritto.
Speech-to-Text, noto anche come ASR per riconoscimento vocale automatico, trasforma l’audio in testo. Si trova dietro le note delle riunioni, i sottotitoli, le trascrizioni dei podcast, la digitazione vocale e gli assistenti vocali. I sistemi moderni possono gestire più lingue, parlanti separati e utilizzare nomi o termini tecnici specifici.
I modelli batch spesso elaborano le registrazioni finite più di trenta volte più velocemente del tempo reale. Le modelle in streaming scrivono mentre parlano senza poter vedere nel futuro. I prezzi sono ora frazioni di centesimo al minuto; Le differenze nell’accuratezza sono spesso minori di quelle nella comodità.
Citato in
-
Il nuovo modello di trascrizione di Google ripulisce i tuoi ums e i tuoi cambiamenti mentali
-
Granite 4.2 di IBM è gratuito, sufficientemente piccolo da poter essere eseguito localmente e progettato per pensare innanzitutto
-
Google ha trasformato un modello finito in uno molto più veloce e ha pubblicato la ricetta
-
I nuovi modelli di trascrizione OpenAI sono più veloci e costano il 25% in meno, ma non sono i più precisi