← Glossar Begriff
Spracherkennung
Technik, die gesprochene Audiodaten in geschriebenen Text umwandelt.
Speech-to-Text, auch ASR für Automatic Speech Recognition, macht aus Audio Text. Es steckt hinter Sitzungsnotizen, Untertiteln, Podcast-Transkripten, Spracheingabe und Sprachassistenten. Moderne Systeme beherrschen mehrere Sprachen, trennen Sprecher und nutzen vorgegebene Namen oder Fachwörter.
Batchmodelle verarbeiten fertige Aufnahmen oft mehr als dreißigmal schneller als Echtzeit. Streamingmodelle schreiben während des Sprechens, ohne in die Zukunft schauen zu können. Preise liegen inzwischen bei Bruchteilen eines Cents pro Minute; Unterschiede bei der Genauigkeit sind oft kleiner als die bei der Bequemlichkeit.
Erwähnt in
-
Das neue Transkriptionsmodell von Google bereinigt Ihre Ums und Ihre Meinungsveränderungen
-
Granite 4.2 von IBM ist kostenlos, klein genug, um lokal ausgeführt zu werden, und darauf ausgelegt, zuerst zu denken
-
Google hat aus einem fertigen Modell ein viel schnelleres gemacht und das Rezept veröffentlicht
-
OpenAIs neue Transkriptionsmodelle sind schneller und 25 Prozent günstiger – aber nicht am genauesten
-
Microsoft ersetzt OpenAI und Anthropic in Copilot stillschweigend, um Kosten zu senken