El modo de voz de Claude ya funciona con los mejores modelos y puede enviar sus correos
Anthropic ha llevado las conversaciones de voz a sus modelos Opus y Sonnet en teléfonos, ordenadores y la Web. Sigue sonando menos natural que ChatGPT o Gemini, pero es el único que puede redactar y enviar un correo mientras usted habla.
Hablar con un asistente de IA ha sido hasta ahora poco más que un truco de fiesta con una pega: la opción de voz solía funcionar con el modelo más pequeño y rápido, por lo que la conversación parecía ágil, pero el razonamiento era superficial. Anthropic acaba de eliminar esa limitación. El modo de voz de Claude utiliza ahora los modelos Opus y Sonnet, más capaces, y no solo el ligero Haiku. Además, se puede cambiar de uno a otro en plena conversación desde la aplicación móvil, la aplicación de escritorio y la Web.
El modo admite once idiomas y, algo más útil aún, accede a las herramientas que haya conectado. Si Gmail, Google Calendar o Slack están vinculados a su cuenta, puede dictar un correo y hacer que Claude lo redacte y envíe sin tocar el teclado. Anthropic es actualmente el único gran proveedor que permite hacerlo directamente desde una conversación de voz.
Conviene ser sinceros sobre los aspectos en los que todavía pierde. El modo de voz de OpenAI utiliza audio full duplex, es decir, escucha y habla al mismo tiempo, por lo que puede interrumpirlo como interrumpiría a una persona. Gemini Live de Google funciona de forma similar, pero está limitado a teléfonos. Claude utiliza un sistema por turnos: espera a que usted termine antes de responder. En la práctica, tanto OpenAI como Google parecen más naturales, con un habla más fluida y una mejor gestión de los pequeños solapamientos de una conversación real. La ventaja de Claude no es cómo habla, sino lo que ocurre después.
Este es el cambio que hay debajo. Durante dos años, los asistentes de voz compitieron por sonar humanos. Esa carrera está prácticamente resuelta y las diferencias son cada vez menores. La nueva competencia consiste en qué puede hacer realmente el asistente una vez que le entiende, lo que implica acceder a su calendario, su bandeja de entrada y sus archivos. Es una función mucho menos vistosa que una voz natural, pero mucho más trascendente, porque convierte una conversación en una acción. También significa que el modelo detrás de la voz vuelve a importar: un modelo inteligente capaz de enviar correos es un producto distinto de un modelo rápido que solo sabe conversar.
Hay una salvedad que debe mencionarse al mismo tiempo: todo lo que hace útil esta función también amplía el margen para los errores. Un comando de voz malinterpretado en una habitación ruidosa, o una petición que Claude interprete con demasiada libertad, tiene ahora acceso a su bandeja de salida. Mantenga activados los pasos de confirmación hasta que confíe en el sistema.
Qué significa esto para ti: Si ya paga por Claude, esta función está incluida y merece diez minutos de prueba. El uso más evidente es trabajar con las manos libres: dictar una respuesta mientras camina, preguntar qué tiene en el calendario, pensar en voz alta sobre un problema y recibir una respuesta real en lugar de una fórmula prefabricada. Si elige entre asistentes únicamente por la calidad de la conversación, ChatGPT y Gemini siguen resultando más fluidos. Si quiere que el asistente haga algo al final de la frase, Claude llega ahora más lejos. Para la mayoría, el veredicto sincero es este: pruébelo una vez y quédese con él si el dictado encaja con su forma de trabajar.
Fuentes
Fuentes: https://claude.com/blog/think-through-hard-problems-in-voice-mode
No todos creen la historia del agente rebelde de OpenAI, y merece la pena escuchar las dudas
OpenAI afirma que sus modelos escaparon de un entorno de pruebas y atacaron Hugging Face. Un investigador de Cornell sostiene que la revelación sigue un patrón utilizado por la empresa desde 2019: advertir que la tecnología es peligrosa y dejar que los inversores entiendan que es poderosa.