CourionAI
ES
Boletín
← Todas las noticias
openai 3 min de lectura

Los nuevos modelos de transcripción de OpenAI son más rápidos y un 25% más baratos, pero no los más precisos

GPT Transcribe y GPT Live Transcribe reducen el precio a 0,0045 dólares por minuto y alcanzan una tasa de error por palabra del 3,31%. ElevenLabs, Google y Mistral obtienen mejores resultados.

Risografía de una cinta de ondas de audio que, junto a un cronómetro, se estrecha hasta formar una pila ordenada de líneas impresas

OpenAI ha incorporado a su API dos nuevos modelos de reconocimiento de voz: GPT Transcribe para archivos de audio grabados y GPT Live Transcribe para emisiones en tiempo real. Ambos convierten la voz en texto, la tecnología que permite generar notas de reuniones, subtítulos, transcripciones de pódcast y asistentes de voz. La versión para archivos procesa el audio unas 34 veces más rápido que la velocidad real: termina una grabación de una hora en menos de dos minutos.

Las cifras son buenas, aunque no espectaculares. En las mediciones del servicio independiente Artificial Analysis, GPT Transcribe obtiene una tasa de error por palabra del 3,31%. Esta métrica, conocida por las siglas WER, indica simplemente qué proporción de palabras se reconoce de manera incorrecta; cuanto más baja, mejor. Frente a GPT-4o Transcribe, presentado hace un año, supone una mejora de 0,7 puntos porcentuales. A la vez, el precio baja un 25%, hasta 0,0045 dólares por minuto de audio. Los dos modelos también aceptan contexto adicional: un texto, una lista de términos o varios idiomas de entrada pueden ayudar a reconocer nombres propios y vocabulario especializado.

OpenAI no encabeza la clasificación por precisión. En la misma tabla, ElevenLabs Scribe v2 alcanza un 2,3%, Gemini 3 Pro de Google un 2,9% y Voxtral Small de Mistral un 3%. Con Voxtral Transcribe V2, Mistral también mejora el precio de sus rivales: desde 0,003 dólares por minuto, cuesta un tercio menos que la nueva oferta de OpenAI.

La transcripción fue en otro tiempo un producto especializado de proveedores especializados. Hoy todos los grandes laboratorios la incluyen como una línea más de su catálogo, y la competencia ya no gira en torno a «¿funciona?», sino a fracciones de punto porcentual y de céntimo. Es una buena noticia para quienes compran el servicio y una bastante peor para las empresas cuyo negocio entero era transcribir. También explica por qué OpenAI presenta los nuevos modelos junto a su generación Realtime anunciada recientemente, que incluye el modelo de transcripción en streaming GPT-Realtime-Whisper: el valor se está desplazando desde la transcripción hacia los servicios que la rodean.

Qué significa esto para ti: Si necesitas de vez en cuando transcribir una entrevista, una clase o un vídeo familiar, cualquiera de estos modelos hará bien el trabajo. Una diferencia de una décima de céntimo por minuto nunca destacará en tu factura. Si desarrollas un producto basado en transcripción o procesas miles de horas, la clasificación sí importa, y ahora mismo OpenAI no es la mejor opción ni por precisión ni por precio. Una cautela: las tasas de error de los benchmarks son promedios calculados sobre conjuntos de prueba. Los acentos, el ruido de fondo y el vocabulario técnico de tus grabaciones pueden cambiar el orden. Prueba los servicios con tu propio material antes de decidir.

Fuentes

Fuentes: https://developers.openai.com/api/docs/changelog

Siguiente artículo

Más de 1.200 empleados de laboratorios de IA piden en Washington un freno que todavía nadie sabe construir

Dario Amodei, Jakub Pachocki y John Schulman figuran entre los firmantes de Pacing the Frontier. No reclaman una pausa, sino la capacidad de reducir el ritmo si fuera necesario; sobre cómo hacerlo, admiten su desacuerdo.

Risografía de dos manos con guantes que aprietan las manetas de freno de un manillar bajo una fina línea de horizonte abierta