CourionAI
DE
Newsletter
← Glossar Begriff

Spracherkennung

Technik, die gesprochene Audiodaten in geschriebenen Text umwandelt.

Speech-to-Text, auch ASR für Automatic Speech Recognition, macht aus Audio Text. Es steckt hinter Sitzungsnotizen, Untertiteln, Podcast-Transkripten, Spracheingabe und Sprachassistenten. Moderne Systeme beherrschen mehrere Sprachen, trennen Sprecher und nutzen vorgegebene Namen oder Fachwörter.

Batchmodelle verarbeiten fertige Aufnahmen oft mehr als dreißigmal schneller als Echtzeit. Streamingmodelle schreiben während des Sprechens, ohne in die Zukunft schauen zu können. Preise liegen inzwischen bei Bruchteilen eines Cents pro Minute; Unterschiede bei der Genauigkeit sind oft kleiner als die bei der Bequemlichkeit.