Die neuen Sprachmodelle von Google reden weiter, während sie nachdenken
Google hat Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking ausgeliefert, zwei Speech-to-Speech-Modelle, die für Sprachassistenten entwickelt wurden. Der Haupttrick besteht darin, dass der Langsamere gleichzeitig argumentiert und spricht, anstatt zu schweigen.
Google hat gestern zwei neue Sprachmodelle veröffentlicht. In der Branche werden beide als Speech-to-Speech-Modelle bezeichnet. Das heißt, sie hören sich Audio an und antworten direkt mit Audio, ohne Ihre Worte zuerst in Text umzuwandeln und dann ihre Antwort wieder in Ton umzuwandeln. Durch das Weglassen dieser beiden Schritte fühlt sich ein gesprochenes Gespräch wie ein Gespräch an und nicht wie ein Walkie-Talkie-Austausch.
Die günstigere Version, Gemini 3.8 Live, ist für Dinge wie Support-Hotlines und App-Assistenten gedacht, bei denen es auf die Kosten pro Minute ankommt. Die größere Version, Gemini 3.8 Live Extended Thinking, wurde für Anfragen entwickelt, die mehrere Schritte erfordern. Google berichtet, dass Extended Thinking mit einem Wert von 82,6 den Spitzenplatz im Speech-to-Speech-Qualitätsindex von Artificial Analysis einnahm, 68,6 Prozent beim Tau-Voice-Test erreichte, der prüft, ob ein Sprachagent eine Aufgabe tatsächlich erledigt, 35,1 Prozent bei Sierras anspruchsvollerer Banking-Version dieses Tests und 97,7 Prozent bei Big Bench Audio. Artificial Analysis ist ein unabhängiger Bewerter, der mehr wert ist als das eigene Diagramm eines Anbieters, obwohl Google selbst ausgewählt hat, welche Zahlen gedruckt werden sollen. Das kleinere 3.8 Live belegte den zweiten Platz in der Speech Agent Arena, wo Menschen Antworten vergleichen und abstimmen.
Zwei Merkmale stechen über die Partituren hinaus hervor. Die Modelle erkennen und wechseln während eines Gesprächs zwischen 97 Sprachen, sodass Sie auf Deutsch beginnen und ins Englische übergehen können, ohne eine Einstellung zu berühren. Und sie führen Tools im Hintergrund aus, während sie noch mit Ihnen sprechen, verwenden Füllmaterial wie „Lass mich das überprüfen“ und erzählen dann den Fortschritt, anstatt acht Sekunden lang still zu bleiben, während etwas geladen wird. Alle generierten Audiodaten tragen SynthID, Googles unhörbares Wasserzeichen zur Kennzeichnung der KI-Ausgabe.
Was steckt dahinter
Stille ist das, was Sprachassistenten kaputt macht. Ein Text-Chatbot kann fünf Sekunden lang pausieren, ohne dass es jemandem etwas ausmacht, weil Sie sehen können, wie er funktioniert. Beim Sprechen werden fünf Sekunden Nichts als unterbrochener Anruf interpretiert, sodass Assistenten in der Vergangenheit gezwungen waren, oberflächlich und schnell zu bleiben. Mit der Aufteilung der Veröffentlichung in zwei Teile gibt Google zu, dass es keine einzige richtige Antwort gibt: ein Modell für billiges Geschwätz mit hohem Volumen, eines, das gründlicher denkt und die Verzögerung überbrückt, indem es darüber redet. Das ist weniger ein Forschungsdurchbruch als vielmehr ein ehrliches Stück Produktdesign, und deshalb ist die Zeile „Gründe und spricht gleichzeitig“ wichtiger als jeder Benchmark auf der Seite.
Was das für Sie bedeutet: Wenn Sie eher neugierig sind als etwas zu bauen, ist Search Live der kürzeste Weg, wo das günstigere Modell jetzt für jedermann verfügbar ist. Gemini Live plus Docs, Gmail und Keep erhalten die intelligentere Version, für die Workspace-Teile ist jedoch ein Google AI Pro- oder Ultra-Abonnement erforderlich. Erwarten Sie, dass im Laufe des nächsten Jahres immer mehr Kundendienstanrufe beunruhigend natürlich klingen, und bedenken Sie, dass eine fließende Stimme kein Beweis für eine richtige Antwort ist. Wenn Sie Dinge erstellen, sind beide Modelle heute in der Gemini API und Google AI Studio live und die Unternehmensversion ist immer noch eine private Vorschau.
Quellen
Google stellt wieder Laptops her, und dieses Mal ist der Assistent das Verkaufsargument
Googlebook ist eine neue Laptop-Kategorie, die von Acer, Asus, Dell, HP und Lenovo rund um Googles Gemini Intelligence entwickelt wurde. Vorbestellungen beginnen in den USA am 21. September, die Auslieferung der Geräte erfolgt im Herbst.