Les nouveaux modèles de transcription d’OpenAI sont plus rapides et 25 % moins chers, mais pas les plus précis
GPT Transcribe et GPT Live Transcribe abaissent le prix à 0,0045 dollar par minute et atteignent un taux d’erreur de 3,31 %. ElevenLabs, Google et Mistral font mieux.
OpenAI met à disposition deux nouveaux modèles de reconnaissance vocale par son API : GPT Transcribe pour les enregistrements et GPT Live Transcribe pour les flux en temps réel. Tous deux convertissent la parole en texte, la technologie utilisée pour les comptes rendus de réunion, les sous-titres, les transcriptions de podcasts et les assistants vocaux. La version destinée aux fichiers traite l’audio environ 34 fois plus vite que sa durée réelle : une heure d’enregistrement demande moins de deux minutes.
Les résultats sont solides, sans être extraordinaires. D’après Artificial Analysis, organisme indépendant de benchmarks, GPT Transcribe atteint un taux d’erreur sur les mots de 3,31 %. Souvent abrégé WER, ce chiffre désigne simplement la part de mots mal reconnus : plus il est bas, mieux c’est. Le gain est de 0,7 point par rapport à GPT-4o Transcribe, son prédécesseur vieux d’un an. Le prix baisse simultanément de 25 %, à 0,0045 dollar la minute. Les deux modèles acceptent du contexte supplémentaire : un texte, une liste de mots-clés ou plusieurs langues d’entrée peuvent améliorer la reconnaissance des noms et du jargon.
OpenAI ne domine pas le classement de précision. ElevenLabs Scribe v2 affiche 2,3 %, Gemini 3 Pro de Google 2,9 % et Voxtral Small de Mistral 3 %. Mistral casse aussi les prix avec Voxtral Transcribe V2, proposé à partir de 0,003 dollar la minute, soit un tiers de moins que le nouveau tarif d’OpenAI.
La transcription était autrefois un produit spécialisé acheté à un fournisseur spécialisé. Elle est devenue une commodité que chaque grand laboratoire vend comme une ligne de son catalogue. La compétition ne porte plus sur son fonctionnement, mais sur des fractions de pourcentage et de centime. Bonne nouvelle pour les acheteurs, beaucoup moins pour les entreprises dont toute l’activité reposait sur la transcription. Cela explique aussi pourquoi OpenAI associe ces modèles à sa génération Realtime récemment annoncée, qui comprend GPT-Realtime-Whisper pour la transcription en continu : la valeur se déplace du texte transcrit vers les services qui l’entourent.
Ce que cela signifie pour vous : Pour transcrire occasionnellement un entretien, un cours ou une vidéo de famille, tous ces modèles feront correctement le travail et un dixième de centime d’écart par minute restera invisible sur votre facture. Si vous construisez un service à partir de la transcription ou traitez des milliers d’heures, le classement devient important : OpenAI n’est actuellement le meilleur choix ni pour la précision ni pour le prix. Nuance nécessaire, les taux d’erreur sont des moyennes sur des jeux de test. Vos accents, bruits de fond et termes spécialisés peuvent modifier l’ordre. Testez vos propres enregistrements avant de choisir.
Sources
1 200 salariés de laboratoires d’IA demandent à Washington un frein que personne ne sait encore fabriquer
Dario Amodei, Jakub Pachocki et John Schulman ont signé Pacing the Frontier. Le texte ne réclame pas une pause, mais la possibilité de ralentir, sans accord entre les signataires sur la méthode.