Text-zu-Sprache
Technologie, die geschriebenen Text in gesprochenes Audio umwandelt, das mittlerweile so gut ist, dass man es von einer Aufnahme kaum noch unterscheiden kann.
Text-to-Speech, oft mit TTS abgekürzt, ist das Spiegelbild von Speech-to-Text: Wörter rein, Audio raus. Es gibt es schon seit Jahrzehnten in flacher Roboterform und es ist die Schicht unter Screenreadern, Navigationsanweisungen und Audioversionen von Artikeln. Was sich in letzter Zeit geändert hat, ist die Qualität. Moderne Systeme verarbeiten Pausen, Betonung und Emotionen so gut, dass ein kurzer Clip wirklich schwer von einer vorlesenden Person zu unterscheiden ist.
Durch diese Verbesserung wurde TTS von einer Barrierefreiheitsfunktion zu einem Veröffentlichungsformat. Plattformen generieren mittlerweile automatisch gesprochene Versionen geschriebener Inhalte, und Hörbücher, Podcasts und Videokommentare beginnen zunehmend als Text. Die gleiche Qualität, die es nützlich macht, macht das Klonen von Stimmen auch zu einem echten Problem, weshalb verantwortungsbewusste Produkte synthetische Erzählungen deutlich kennzeichnen.