Chirp
Googles frühere Familie von Speech-to-Text-Modellen, die mittlerweile weitgehend durch die direkt in Gemini integrierte Transkription ersetzt wird.
Chirp war Googles spezielles Spracherkennungsmodell, das hinter Produkten und Cloud-APIs Audio in Text umwandelte. Es war ein konventionelles Sprachmodell in dem Sinne, dass es das Gehörte transkribierte und dort aufhörte.
In unserer Berichterstattung erscheint es hauptsächlich als Basiswert, an dem neuere Modelle gemessen werden. Die Gemini-Transkriptionsmodelle von Google werden mit Chirp 3 hinsichtlich der Genauigkeit und der Wartezeit auf ein endgültiges Transkript verglichen. Der Wechsel von einem eigenständigen Sprachmodell zu einem Sprachmodell, das das Zuhören übernimmt, ermöglicht es den neueren Modellen, Füllwörter und Selbstkorrekturen im Laufe der Zeit zu bereinigen.