El nuevo modelo de Alibaba mira y escucha, y no cobra casi nada por ello
Qwen3.8-Omni-Flash maneja texto, imágenes, audio y video en un modelo con un contexto de un millón de tokens. Alibaba informa que los costos de ingesta de audio por hora cayeron más del 98 por ciento. Sin pesos abiertos en el lanzamiento.
El equipo Qwen de Alibaba lanzó Qwen3.8-Omni-Flash el 18 de septiembre, un modelo que reúne texto, imágenes, audio y vídeo en lugar de utilizar sistemas especializados separados. “Omnimodal” es la palabra de marketing, y lo que significa en la práctica es que el modelo escucha una grabación como sonido en lugar de recibir una transcripción producida primero por otra herramienta. Contiene un millón de tokens de contexto, suficientes para horas de material a la vez, y Alibaba informa una mejora promedio de más del 26 por ciento en aproximadamente 30 evaluaciones en comparación con el Qwen3.5-Omni-Plus anterior.
Los precios son la parte que vale la pena anotar. Alibaba enumera 0,8 RMB por millón de tokens de entrada y 2,7 RMB por millón de tokens de salida en Alibaba Cloud Model Studio, y dice que el costo de ingerir una hora de audio se ha reducido en más del 98 por ciento, con la entrada mixta de audio y video bajada en más del 93 por ciento. En tareas de vídeo estilo agente, informa que se utilizan un 45,7 por ciento menos de tokens. El modelo es solo API, está disponible a través de QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, sin pesos descargables anunciados en el lanzamiento. Ese último punto es un punto de partida para un equipo que ha construido gran parte de su reputación en lanzamientos abiertos.
¿Qué hay detrás de esto?
La forma más antigua de hacer que una IA entendiera un vídeo era una carrera de relevos: un modelo transcribe el discurso, otro describe los fotogramas, un tercero lee tanto las descripciones como las razones sobre ellos. Cada traspaso pierde información, y las cosas que se pierden son exactamente las que tienen significado. El tono de voz, si alguien parecía inseguro, lo que había en la pantalla en el momento en que se dijo una frase, nada de eso sobrevive a la transcripción. Un solo modelo que toma las transmisiones sin procesar mantiene esos detalles en juego, razón por la cual “nativo” es la palabra que los laboratorios siguen buscando.
El colapso de los costos es lo que lo convierte en algo más que una curiosidad de investigación. Cuando procesar una hora de audio era costoso, solo lo hacías con material que ya sabías que importaba. A estos precios resulta razonable apuntar un modelo a todo y buscar después, lo cual es un tipo de herramienta completamente diferente. Sin embargo, vale la pena mantener las expectativas firmes: la cifra del 26 por ciento es propia de Alibaba, comparada con el modelo anterior de Alibaba, y la evaluación independiente de los sistemas omnimodales aún es escasa.
Qué significa esto para usted: Si tiene un montón de grabaciones, reuniones, entrevistas, conferencias, llamadas de soporte técnico que han sido demasiado costosas o demasiado tediosas para hacer algo con ellas, esta clase de modelo es la razón por la que está cambiando. Lo encontrará a través de productos en lugar de la API. Para cualquiera que esté construyendo algo, la nota honesta son los pesos abiertos que faltan: un modelo solo API significa que su audio y video van a los servidores de Alibaba, lo cual es una cuestión sencilla de si el material es suyo para enviar.
Fuentes
Fuentes: https://technode.com/2026/09/18/alibabas-qwen-releases-qwen3-8-omni-flash-with-1m-token-context/
Xiaomi ahora tiene el modelo abierto más potente del mundo y puedes descargarlo
El fabricante de teléfonos y automóviles lanzó MiMo-V2.6-Pro y Flash bajo una licencia del MIT el lunes. El evaluador externo Artificial Analysis obtuvo una puntuación Pro de 46, la puntuación más alta que haya alcanzado cualquier modelo descargable.