CourionAI
FR
Newsletter
← Toutes les actus
openai 3 min de lecture

Le nouveau mode vocal de ChatGPT peut écouter et parler en même temps

GPT-Live d’OpenAI utilise une architecture en duplex intégral pour rendre les conversations vocales plus humaines, et transmet discrètement les questions difficiles à GPT-5.5 en arrière-plan.

Deux visages de profil en risographie discutent, tandis que des ondes sonores circulent dans les deux sens entre eux

OpenAI a lancé GPT-Live, une nouvelle génération de modèles vocaux pour ChatGPT capables d’écouter et de parler en même temps, comme le font réellement les humains. Jusqu’à présent, l’IA vocale fonctionnait comme un talkie-walkie : vous parlez, elle attend, puis elle répond. GPT-Live utilise ce que les ingénieurs appellent une architecture en duplex intégral, les deux sens de la conversation restent ouverts simultanément, comme lors d’un appel téléphonique normal.

Deux versions sont déployées dans le monde entier. GPT-Live-1 est destiné aux utilisateurs payants des formules Go, Plus et Pro ; GPT-Live-1 mini accompagne les comptes gratuits. Les deux fonctionnent sur iOS, Android et chatgpt.com, et un accès par API est prévu pour les développeurs. Plusieurs fois par seconde, le modèle décide s’il doit parler, continuer d’écouter, marquer une pause ou interrompre. Il emploie même de petits sons d’acquiescement comme « mhm » pour indiquer qu’il suit la conversation, et vous pouvez lui couper la parole au milieu d’une phrase sans rien perturber.

L’aspect le plus ingénieux se dissimule en arrière-plan. Historiquement, les modèles vocaux en direct étaient rapides, mais peu brillants, très à l’aise pour discuter, beaucoup moins pour traiter des faits. GPT-Live corrige ce problème par la délégation : lorsqu’une question nécessite une recherche sur le web ou un véritable raisonnement, il transmet discrètement la tâche à GPT-5.5 tout en poursuivant la conversation. Les chiffres sont saisissants. Sur GPQA, un test de raisonnement scientifique, GPT-Live-1 obtient 84,2 %, contre 45,3 % pour l’ancien mode vocal avancé. Sur BrowseComp, une évaluation de recherche sur le web, l’écart est de 75,2 % contre 0,7 %.

Voici ce qui se cache derrière cette approche : OpenAI divise le travail en deux. Un modèle prend en charge le rythme et la dimension sociale de la conversation, un autre assure la réflexion. Cela reflète l’évolution de l’ensemble du secteur, de petits modèles rapides au premier plan, de grands modèles intelligents derrière le rideau. Nvidia a publié plus tôt cette année un modèle open source comparable appelé PersonaPlex, signe que cette méthode gagne du terrain.

Une réserve légitime : plus une IA semble humaine, plus il devient facile d’oublier qu’elle ne l’est pas. Des recherches ont associé l’usage intensif du mode vocal à une dépendance émotionnelle, et OpenAI fournit elle-même GPT-Live avec des protections supplémentaires, des numéros d’aide en cas de crise, un contrôle parental et la possibilité de mettre fin aux conversations dans les situations à haut risque. La voix accompagnée de vidéo et de partage d’écran n’est pas proposée au lancement, même si OpenAI annonce son arrivée prochaine.

Ce que cela signifie pour vous : Si les modes vocaux de l’IA vous ont paru maladroits, cette pause rigide, ce dialogue robotique où chacun attend son tour, cette mise à jour pourrait vous faire changer d’avis. Les utilisateurs gratuits disposent de la version mini, tout le monde peut donc l’essayer. Elle se révèle réellement utile lorsqu’il faut garder les mains libres : en cuisinant, en conduisant ou en réfléchissant à voix haute à un problème. Les utilisateurs avancés bénéficient d’une interface vocale enfin capable de mener de vraies recherches en pleine conversation. Gardez simplement une chose en tête : sa voix paraît désormais plus humaine, mais le logiciel sous-jacent reste de même nature.

Sources

Sources: https://openai.com/index/introducing-gpt-live/

Article suivant

Là où le réseau s’arrête, la petite IA prend le relais : de minuscules modèles sauvent des vies hors ligne

IEEE Spectrum explique comment des modèles d’IA tenant dans un téléphone authentifient des médicaments, repèrent les maladies des cultures et réalisent des ECG dans des régions dépourvues de haut débit et de centres de données.

Illustration en risographie d’un smartphone analysant un comprimé avec des faisceaux lumineux, devant des collines rurales et un drone