CourionAI
ES
Boletín
← Todas las noticias
google 3 min de lectura

Los nuevos modelos de voz de Google siguen hablando mientras piensan

Google envió Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz a voz creados para asistentes de voz. El truco del titular es que el más lento razona y habla al mismo tiempo en lugar de quedarse en silencio.

Burbujas de discurso superpuestas que se fusionan en una cinta continua con ruedas dentadas girando en su interior

Google lanzó ayer dos nuevos modelos de voz. Ambos son lo que la industria llama modelos de voz a voz, lo que significa que escuchan audio y responden con audio directamente, sin convertir primero las palabras en texto y luego volver a convertir su respuesta en sonido. Eliminar esos dos pasos es lo que hace que una conversación hablada parezca una conversación en lugar de un intercambio de walkie talkie.

El más económico, Gemini 3.8 Live, está dirigido a líneas de soporte y asistentes de aplicaciones donde el costo por minuto importa. El más grande, Gemini 3.8 Live Extended Thinking, está diseñado para solicitudes que requieren varios pasos. Google informa que Extended Thinking ocupó el primer lugar en el índice de calidad de voz a voz de Artificial Analysis con una puntuación de 82,6, obtuvo un 68,6 por ciento en la prueba tau-Voice de si un agente de voz realmente completa una tarea, un 35,1 por ciento en la versión bancaria más difícil de Sierra de esa prueba y un 97,7 por ciento en Big Bench Audio. Artificial Analysis es un evaluador independiente, que vale más que el propio gráfico de un proveedor, aunque Google eligió qué números imprimir. El 3.8 Live, más pequeño, quedó en segundo lugar en Speech Agent Arena, donde la gente compara respuestas y vota.

Dos características destacan más allá de las partituras. Los modelos detectan y cambian entre 97 idiomas en medio de una conversación, por lo que puedes comenzar en alemán y pasar al inglés sin tocar una configuración. Y ejecutan herramientas en segundo plano mientras siguen hablando contigo, usando rellenos como “Déjame comprobar eso” y luego narrando el progreso, en lugar de quedarse en silencio durante ocho segundos mientras se carga algo. Todo el audio generado lleva SynthID, la marca de agua inaudible de Google para marcar la salida de IA.

¿Qué hay detrás de esto?

El silencio es lo que rompe a los asistentes de voz. Un chatbot de texto puede pausarse durante cinco segundos y a nadie le importa, porque puedes verlo funcionando. En el habla, cinco segundos sin nada se interpretan como una llamada cortada, por lo que históricamente los asistentes se han visto obligados a ser superficiales y rápidos. Al dividir el lanzamiento en dos, Google admite que no existe una única respuesta correcta: un modelo para charlas baratas y de alto volumen, otro que piensa más y cubre el retraso hablando sobre ello. Esto no es tanto un avance en la investigación como un fragmento honesto de diseño de producto, y es por eso que la línea “razona y habla simultáneamente” es más importante que cualquier punto de referencia en la página.

Qué significa esto para ti: Si tienes curiosidad en lugar de crear algo, el camino más corto es Search Live, donde el modelo más económico ya está disponible para todos. Gemini Live plus Docs, Gmail y Keep obtienen el modelo más inteligente, aunque las partes de Workspace necesitan una suscripción a Google AI Pro o Ultra. Espere que más líneas de servicio al cliente suenen inquietantemente naturales durante el próximo año y tenga en cuenta que una voz fluida no es evidencia de una respuesta correcta. Si construye cosas, ambos modelos están disponibles en Gemini API y Google AI Studio hoy, y la versión empresarial aún es una vista previa privada.

Fuentes

Fuentes: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

Siguiente artículo

Google vuelve a fabricar computadoras portátiles y esta vez el punto de venta es el asistente

Googlebook es una nueva categoría de portátiles creada por Acer, Asus, Dell, HP y Lenovo en torno a Gemini Intelligence de Google. Los pedidos anticipados se abren el 21 de septiembre en EE. UU. y los dispositivos se enviarán este otoño.

Una computadora portátil abierta sobre el pedestal de un museo con una forma geométrica brillante que emerge de su pantalla