Das neue Transkriptionsmodell von Google bereinigt Ihre Ums und Ihre Meinungsveränderungen
Gemini 3.5 Transcribe verarbeitet 85 Sprachen, entfernt Füllwörter und behebt das Problem, wenn Sie Dienstag sagen und Mittwoch meinen. Es ist bereits in Gboard auf Android und der Gemini-App auf macOS verfügbar.
Google hat Gemini 3.5 Transcribe veröffentlicht, ein Speech-to-Text-Modell, das mehr kann, als nur aufzuschreiben, was Sie gesagt haben. Es erkennt und transkribiert über 85 Sprachen automatisch, entfernt Füllwörter, formatiert den Text selbstständig und korrigiert Selbstkorrekturen im Stillen. Sagen Sie „Treffen wir uns Dienstag, nein, Mittwoch“ und Sie bekommen Mittwoch, nicht das ganze Stolpern.
Die vom unabhängigen Unternehmen Artificial Analysis gemessenen Genauigkeitszahlen belaufen sich auf eine Wortfehlerrate von 4,0 Prozent für Live-Streaming und 2,6 Prozent für aufgezeichnete Audiodaten. Die Wortfehlerrate ist einfach der Anteil der Wörter, die das Modell falsch macht. Je niedriger desto besser, desto besser ist sie. Bei 2,6 Prozent handelt es sich um etwa einen Fehler in vierzig Wörtern. Beim mehrsprachigen FLEURS-Benchmark in einer Reihe von Top-Sprachen sind die Zahlen höher: 5,50 Prozent Streaming und 5,04 Prozent aufgezeichnet. Dies ist die ehrlichere Zahl, wenn Sie kein Englisch sprechen. Die Zeit bis zum endgültigen Transkript ist 70 Prozent schneller als bei Chirp 3, dem Modell, das es ersetzt. Bei aufgezeichnetem Audio kann Sprache mit Zeitstempeln auf Wortebene bis zu drei Sprechern zugeordnet werden, drei oder mehr sind noch experimentell.
Es gibt zwei Möglichkeiten. Die Live-API verarbeitet Echtzeit-Streaming mit einer Verzögerung von weniger als einer Sekunde für Dinge wie Sprachassistenten und Untertitel. Die Interaktions-API verarbeitet aufgezeichnete Dateien, Besprechungen und Anrufprotokolle. Beide sind über Google AI Studio in der öffentlichen Vorschau verfügbar, mit einer Unternehmensroute über die Gemini Enterprise Agent Platform.
Was hier eigentlich passiert: Herkömmliche Spracherkennungsmodelle übersetzen Ton in Text und stoppen. Hierbei handelt es sich um ein Sprachmodell, das die Transkription durchführt, weshalb es entscheiden kann, dass „um“ nicht Teil Ihres Satzes war und Sie Ihre Meinung mitten im Satz geändert haben. Das ist auch das Risiko. Ein Modell, das redigiert, während es zuhört, trifft Urteile, und für ein ärztliches Attest, eine gerichtliche Aussage oder ein Forschungsinterview möchten Sie möglicherweise, dass die Stolpersteine genau so erhalten bleiben, wie sie gesprochen wurden. Google bietet derzeit keinen rohen Verbatim-Modus als Überschriftenoption an. Überprüfen Sie daher, was Sie erhalten, bevor Sie einen Workflow darauf aufbauen.
Was das für Sie bedeutet: Wenn Sie Android verwenden, haben Sie einiges davon bereits. Die Rambler-Funktion in Gboard nutzt es, um gesprochenes Geschwafel in ausgewählten Ländern und Sprachen in formatierten Text umzuwandeln, den Sie per Spracheingabe bearbeiten können. Die Gemini-App auf macOS bietet sie auf Englisch, und Chrome-Unterstützung kommt, was das Diktieren in jedes Textfeld im Web bedeutet. Wenn Sie Dinge erstellen, ist dies ein plausibler Ersatz für den Transkriptionsdienst, für den Sie derzeit bezahlen, obwohl es sich um eine Vorschau handelt, also behandeln Sie es als solche. Und wenn Sie das Diktieren vermieden haben, weil das Bereinigen der Ausgabe länger dauerte als das Tippen, ist dies die spezifische Beschwerde, für die das Modell entwickelt wurde. Es lohnt sich, einen ehrlichen Test mit Ihrem eigenen Akzent durchzuführen, bevor Sie sich verpflichten.
Quellen
Quellen: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
Granite 4.2 von IBM ist kostenlos, klein genug, um lokal ausgeführt zu werden, und darauf ausgelegt, zuerst zu denken
Drei offene Modelle bei 3B, 8B und 30B unter einer Apache 2.0-Lizenz sowie ein Sprachmodell mit 470 Millionen Parametern, das drei Stunden Audio in etwa einer Sekunde transkribiert.