CourionAI
FR
Newsletter
← Toutes les actus
google 3 min de lecture

Les nouveaux modèles vocaux de Google continuent de parler pendant qu'ils réfléchissent

Google a livré Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, deux modèles de synthèse vocale conçus pour les assistants vocaux. L’astuce du titre est que le plus lent raisonne et parle en même temps au lieu de se taire.

Bulles superposées fusionnant en un ruban continu avec des roues dentées tournant à l'intérieur

Google a publié hier deux nouveaux modèles vocaux. Les deux sont ce que l’industrie appelle des modèles de parole, ce qui signifie qu’ils écoutent l’audio et répondent directement avec l’audio, sans d’abord transformer vos mots en texte, puis transformer leur réponse en son. Supprimer ces deux étapes est ce qui donne l’impression qu’une conversation parlée ressemble plus à une conversation qu’à un échange de talkie-walkie.

Le moins cher, Gemini 3.8 Live, est destiné à des éléments tels que les lignes d’assistance et les assistants d’application où le coût par minute est important. Le plus gros, Gemini 3.8 Live Extended Thinking, est conçu pour les requêtes qui comportent plusieurs étapes. Google rapporte qu’Extended Thinking a pris la première place dans l’indice de qualité vocale de l’analyse artificielle avec un score de 82,6, a obtenu 68,6 % au test tau-Voice visant à déterminer si un agent vocal accomplit réellement une tâche, 35,1 % sur la version bancaire la plus difficile de Sierra de ce test et 97,7 % sur Big Bench Audio. Artificial Analysis est un évaluateur indépendant, qui vaut plus que le propre graphique d’un fournisseur, bien que Google ait choisi les chiffres à imprimer. Le plus petit 3.8 Live est arrivé deuxième dans la Speech Agent Arena, où les gens comparent les réponses et votent.

Au-delà des partitions, deux traits ressortent. Les modèles détectent et basculent entre 97 langues au milieu d’une conversation, vous pouvez donc commencer en allemand et passer à l’anglais sans toucher à un paramètre. Et ils exécutent des outils en arrière-plan tout en continuant à vous parler, en utilisant des éléments de remplissage comme “Laissez-moi vérifier ça”, puis en racontant la progression, plutôt que de rester silencieux pendant huit secondes pendant que quelque chose se charge. Tout l’audio généré porte SynthID, le filigrane inaudible de Google pour marquer la sortie de l’IA.

Qu’est-ce qu’il y a derrière ça

Le silence est ce qui brise les assistants vocaux. Un chatbot textuel peut s’arrêter pendant cinq secondes et personne ne s’en soucie, car vous pouvez le voir fonctionner. Dans la parole, cinq secondes sans rien se lisent comme un appel interrompu, de sorte que les assistants ont toujours été contraints de rester superficiels et rapides. En divisant la version en deux, Google admet qu’il n’y a pas une seule bonne réponse : un modèle pour des discussions bon marché et à volume élevé, un qui réfléchit plus fort et couvre le retard en parlant à travers lui. Il s’agit moins d’une percée en recherche que d’un élément honnête de conception de produit, et c’est pourquoi la ligne « raisonne et parle simultanément » est plus importante que n’importe quelle référence sur la page.

Ce que cela signifie pour vous : Si vous êtes curieux plutôt que de construire quoi que ce soit, le chemin le plus court est Search Live, où le modèle le moins cher est désormais accessible à tous. Gemini Live plus Docs, Gmail et Keep obtiennent le modèle le plus intelligent, bien que les parties Workspace nécessitent un abonnement Google AI Pro ou Ultra. Attendez-vous à ce que davantage de lignes de service client semblent d’un naturel troublant au cours de la prochaine année, et gardez à l’esprit qu’une voix fluide ne constitue pas une preuve d’une réponse correcte. Si vous créez des éléments, les deux modèles sont aujourd’hui disponibles dans l’API Gemini et Google AI Studio, et la version entreprise est toujours en aperçu privé.

Sources

Sources: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

Article suivant

Google fabrique à nouveau des ordinateurs portables, et cette fois, l'argument de vente est l'assistant

Googlebook est une nouvelle catégorie d'ordinateurs portables construite par Acer, Asus, Dell, HP et Lenovo autour de Gemini Intelligence de Google. Les précommandes ouvrent le 21 septembre aux États-Unis et les appareils seront expédiés cet automne.

Un ordinateur portable ouvert sur un socle de musée avec une forme géométrique lumineuse sortant de son écran