I nuovi modelli vocali di Google continuano a parlare mentre pensano
Google ha distribuito Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, due modelli di sintesi vocale realizzati per gli assistenti vocali. Il trucco del titolo è che quello più lento ragiona e parla allo stesso tempo invece di tacere.
Google ha rilasciato ieri due nuovi modelli vocali. Entrambi sono ciò che l’industria chiama modelli di sintesi vocale, nel senso che ascoltano l’audio e rispondono direttamente con l’audio, senza prima trasformare le parole in testo e poi trasformare la risposta in suono. Eliminare questi due passaggi è ciò che fa sembrare una conversazione parlata una conversazione piuttosto che uno scambio di walkie-talkie.
Quello più economico, Gemini 3.8 Live, è rivolto a cose come le linee di supporto e gli assistenti in-app dove il costo al minuto è importante. Quello più grande, Gemini 3.8 Live Extended Thinking, è progettato per richieste che richiedono diversi passaggi. Google riferisce che Extended Thinking ha preso il primo posto nell’indice Speech to Speech Quality Index di Artificial Analysis con un punteggio di 82,6, ha ottenuto il 68,6% nel test tau-Voice per verificare se un agente vocale completa effettivamente un’attività, il 35,1% nella versione bancaria più difficile di Sierra di quel test e il 97,7% su Big Bench Audio. L’analisi artificiale è un valutatore indipendente, che vale più del grafico di un fornitore, sebbene Google abbia scelto quali numeri stampare. Il più piccolo 3.8 Live è arrivato secondo nella Speech Agent Arena, dove le persone confrontano le risposte e votano.
Due caratteristiche risaltano oltre i punteggi. I modelli rilevano e cambiano tra 97 lingue nel corso di una conversazione, così puoi iniziare in tedesco e passare all’inglese senza toccare un’impostazione. Ed eseguono strumenti in background mentre continuano a parlarti, utilizzando riempitivi come “Fammi controllare” e poi raccontando i progressi, invece di rimanere in silenzio per otto secondi mentre qualcosa viene caricato. Tutto l’audio generato porta SynthID, la filigrana non udibile di Google per contrassegnare l’output dell’intelligenza artificiale.
Cosa c’è dietro tutto questo?
Il silenzio è la cosa che rompe gli assistenti vocali. Un chatbot di testo può fermarsi per cinque secondi e nessuno se ne preoccupa, perché puoi vederlo funzionare. Nel parlato, cinque secondi di nulla vengono letti come una chiamata interrotta, quindi gli assistenti sono stati storicamente costretti a rimanere superficiali e veloci. Dividendo il rilascio in due, Google ammette che non esiste un’unica risposta giusta: un modello per chiacchiere economiche e ad alto volume, uno che pensa più intensamente e copre il ritardo parlandoci. Questo non è tanto un progresso nella ricerca quanto un pezzo onesto di progettazione del prodotto, ed è per questo che la frase “ragiona e parla simultaneamente” conta più di qualsiasi benchmark sulla pagina.
Che cosa significa per te: Se sei curioso invece di costruire qualcosa, il percorso più breve è Cerca dal vivo, dove il modello più economico è ora disponibile per tutti. Gemini Live più Docs, Gmail e Keep ottengono il modello più intelligente, sebbene le parti Workspace richiedano un abbonamento Google AI Pro o Ultra. Aspettatevi che più linee del servizio clienti sembrino inquietantemente naturali nel corso del prossimo anno e tenete presente che una voce fluente non è la prova di una risposta corretta. Se costruisci oggetti, entrambi i modelli sono attivi nell’API Gemini e in Google AI Studio oggi e la versione aziendale è ancora in anteprima privata.
Fonti
Google sta producendo di nuovo laptop e questa volta il punto di forza è l'assistente
Googlebook è una nuova categoria di laptop creata da Acer, Asus, Dell, HP e Lenovo attorno a Gemini Intelligence di Google. I preordini apriranno il 21 settembre negli Stati Uniti, con la spedizione dei dispositivi questo autunno.