CourionAI
ES
Boletín
← Todas las noticias
openai 3 min de lectura

El nuevo modo de voz de ChatGPT puede escuchar y hablar al mismo tiempo

GPT-Live de OpenAI utiliza una arquitectura full-duplex para que las conversaciones de voz resulten humanas y, en segundo plano, deriva discretamente las preguntas difíciles a GPT-5.5.

Dos rostros de perfil en estilo risografía conversan mientras las ondas de sonido fluyen en ambas direcciones entre ellos

OpenAI ha lanzado GPT-Live, una nueva generación de modelos de voz para ChatGPT que pueden escuchar y hablar al mismo tiempo, como hacemos las personas en una conversación real. Hasta ahora, la IA de voz funcionaba como un walkie-talkie: tú hablas, espera y luego responde. GPT-Live utiliza lo que los ingenieros denominan una arquitectura full-duplex, lo que significa que ambas direcciones de la conversación permanecen abiertas de forma simultánea, como en una llamada telefónica normal.

Se están desplegando dos versiones en todo el mundo. GPT-Live-1 está destinado a usuarios de pago de los planes Go, Plus y Pro; GPT-Live-1 mini viene incluido con las cuentas gratuitas. Ambos funcionan en iOS, Android y chatgpt.com, y está previsto ofrecer acceso mediante API a los desarrolladores. El modelo decide varias veces por segundo si debe hablar, seguir escuchando, hacer una pausa o interrumpir. Incluso utiliza pequeños sonidos de asentimiento como «mhm» para indicar que sigue la conversación, y puedes cortarlo a mitad de una frase sin que nada deje de funcionar.

La parte más ingeniosa permanece oculta en segundo plano. Históricamente, los modelos de voz en tiempo real han sido rápidos, pero no demasiado inteligentes: resultaban estupendos para conversar y malos con los datos. GPT-Live lo soluciona delegando. Cuando una pregunta requiere una búsqueda en la web o un razonamiento real, deriva discretamente la tarea a GPT-5.5 mientras mantiene la conversación. Las cifras llaman la atención. En GPQA, una prueba de razonamiento científico, GPT-Live-1 alcanza un 84,2 por ciento, mientras que el antiguo Advanced Voice Mode se quedaba en el 45,3. En BrowseComp, una prueba de investigación web, la diferencia es del 75,2 por ciento frente al 0,7.

Esto es lo que hay detrás: OpenAI divide el trabajo en dos. Un modelo se ocupa del ritmo y los matices sociales de la conversación, mientras que otro realiza el razonamiento. Refleja el rumbo de todo el sector: modelos pequeños y rápidos en primer plano, modelos grandes e inteligentes entre bastidores. Nvidia presentó a comienzos de este año un modelo similar de código abierto llamado PersonaPlex, así que el enfoque está ganando adeptos.

Una salvedad razonable: cuanto más humana suena una IA, más fácil resulta olvidar que no lo es. Algunos estudios han relacionado un uso intenso del modo de voz con la dependencia emocional, y la propia OpenAI distribuye GPT-Live con capas adicionales de seguridad: líneas de atención para crisis, controles parentales y la capacidad de poner fin a conversaciones en situaciones de alto riesgo. En el lanzamiento no admite voz con vídeo ni compartir pantalla, aunque OpenAI afirma que estas funciones llegarán.

Qué significa esto para ti: Si los modos de voz de la IA te parecían incómodos, esa pausa rígida y los turnos robóticos, esta es la actualización que podría hacerte cambiar de opinión. Los usuarios gratuitos reciben la versión mini, así que cualquiera puede probarla. Resulta realmente útil en momentos en los que no tienes las manos libres: al cocinar, conducir o pensar un problema en voz alta mientras caminas. Los usuarios avanzados obtienen una interfaz de voz capaz, por fin, de investigar de verdad durante la conversación. Solo debes recordar una cosa: ahora suena más humana, pero sigue siendo el mismo tipo de software por dentro.

Fuentes

Fuentes: https://openai.com/index/introducing-gpt-live/

Siguiente artículo

Donde termina la red, comienza la pequeña IA: modelos diminutos salvan vidas sin conexión

IEEE Spectrum explica cómo modelos de IA del tamaño de un teléfono autentican medicamentos, detectan enfermedades en cultivos y realizan electrocardiogramas en lugares sin banda ancha ni centros de datos.

Ilustración en estilo risografía de un smartphone que escanea una pastilla con haces de luz, con colinas rurales y un dron al fondo