CourionAI
FR
Newsletter
← Toutes les actus
google 3 min de lecture

Le nouveau modèle de transcription de Google nettoie vos ums et vos changements d'esprit

Gemini 3.5 Transcribe gère 85 langues, supprime les mots de remplissage et les corrige lorsque vous dites mardi et signifiez mercredi. Il est déjà présent dans Gboard sur Android et dans l'application Gemini sur macOS.

Un enchevêtrement d'ondes sonores griffonnées à gauche se dénouant en barres soignées et régulièrement espacées à droite.

Google a publié Gemini 3.5 Transcribe, un modèle de synthèse vocale qui fait plus que simplement écrire ce que vous avez dit. Il détecte et transcrit automatiquement plus de 85 langues, supprime les mots de remplissage, formate le texte lui-même et corrige silencieusement les autocorrections. Dites « rencontrons-nous mardi, non, mercredi » et vous obtenez mercredi, pas tout le trébuchement.

Les chiffres de précision, mesurés par l’organisme indépendant Artificial Analysis, représentent un taux d’erreur de mots de 4,0 % pour la diffusion en direct et de 2,6 % pour l’audio enregistré. Le taux d’erreur sur les mots est simplement la proportion de mots pour lesquels le modèle se trompe, donc plus bas est mieux et 2,6 pour cent équivaut à environ une erreur sur quarante mots. Sur le benchmark multilingue FLEURS dans un ensemble de langues principales, les chiffres sont plus élevés, 5,50 pour cent en streaming et 5,04 pour cent enregistrés, ce qui est le chiffre le plus honnête si vous ne parlez pas anglais. Le temps nécessaire pour obtenir une transcription finale est 70 % plus rapide que Chirp 3, le modèle qu’il remplace. Pour l’audio enregistré, il peut attribuer la parole à jusqu’à trois locuteurs avec des horodatages au niveau des mots, et trois ou plus sont encore expérimentaux.

Il existe deux manières d’y accéder. L’API Live gère la diffusion en temps réel avec un délai inférieur à la seconde pour des éléments tels que les assistants vocaux et les sous-titres. L’API Interactions gère les fichiers enregistrés, les réunions et les journaux d’appels. Les deux sont en préversion publique via Google AI Studio, avec une route d’entreprise via la plateforme d’agent Gemini Enterprise.

Que se passe-t-il réellement ici : les modèles de reconnaissance vocale conventionnels transcrivent le son en texte et s’arrêtent. Celui-ci est un modèle de langage qui effectue la transcription, c’est pourquoi il peut décider que « euh » ne faisait pas partie de votre phrase et que vous avez changé d’avis en cours de phrase. C’est aussi le risque. Un modèle qui édite pendant qu’il écoute émet son jugement, et pour une note médicale, une déposition légale ou un entretien de recherche, vous souhaiterez peut-être que les trébuchements soient conservés exactement tels qu’ils sont prononcés. Google ne propose actuellement pas de mode verbatim brut comme option de titre, alors vérifiez ce que vous obtenez avant de créer un flux de travail dessus.

Ce que cela signifie pour vous : si vous utilisez Android, vous disposez déjà de certaines fonctionnalités. La fonctionnalité Rambler de Gboard l’utilise pour transformer une divagation orale en texte formaté, dans des pays et des langues sélectionnés, et vous pouvez le modifier vocalement. L’application Gemini sur macOS l’a en anglais et la prise en charge de Chrome arrive, ce qui signifie dicter dans n’importe quel champ de texte Web. Si vous construisez des choses, il s’agit d’un remplacement plausible du service de transcription pour lequel vous payez actuellement, bien qu’il s’agisse d’un aperçu, alors traitez-le comme tel. Et si vous avez évité la dictée parce que le nettoyage de la sortie prenait plus de temps que la saisie, c’est la plainte spécifique pour laquelle le modèle a été conçu. Cela vaut la peine de faire un test honnête avec votre propre accent avant de vous engager.

Sources

Sources: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/

Article suivant

Granite 4.2 d'IBM est gratuit, suffisamment petit pour fonctionner localement et conçu pour penser avant tout

Trois modèles ouverts à 3B, 8B et 30B sous licence Apache 2.0, plus un modèle vocal de 470 millions de paramètres qui transcrit trois heures d'audio en une seconde environ.

Trois blocs de pierre de taille décroissante empilés sur un bureau ordinaire à côté d'un cadenas ouvert