Le nouveau modèle d'Alibaba regarde et écoute, et ne facture presque rien pour cela
Qwen3.8-Omni-Flash gère le texte, les images, l'audio et la vidéo dans un seul modèle avec un contexte d'un million de jetons. Alibaba rapporte que les coûts horaires d'ingestion audio ont diminué de plus de 98 %. Pas de poids ouverts au lancement.
L’équipe Qwen d’Alibaba a lancé Qwen3.8-Omni-Flash le 18 septembre, un modèle qui regroupe le texte, les images, l’audio et la vidéo plutôt que via des systèmes spécialisés séparés. “Omnimodal” est le mot marketing, et ce qu’il signifie en pratique, c’est que le modèle entend un enregistrement comme un son plutôt que de recevoir une transcription produite en premier par un autre outil. Il contient un million de jetons de contexte, suffisamment pour des heures de contenu à la fois, et Alibaba rapporte une amélioration moyenne de plus de 26 % sur environ 30 évaluations par rapport au précédent Qwen3.5-Omni-Plus.
Les prix sont la partie qui mérite d’être notée. Alibaba répertorie 0,8 RMB par million de jetons d’entrée et 2,7 RMB par million de jetons de sortie sur Alibaba Cloud Model Studio, et affirme que le coût de l’ingestion d’une heure d’audio a diminué de plus de 98 pour cent, avec une entrée audio et vidéo mixte en baisse de plus de 93 pour cent. Sur les tâches vidéo de type agent, il signale 45,7 % de jetons utilisés en moins. Le modèle est uniquement API, disponible via QwenCloud, Alibaba Cloud Model Studio et Qwen Studio, sans poids téléchargeables annoncés au lancement. Ce dernier point est un départ pour une équipe qui a bâti une grande partie de sa réputation sur les versions ouvertes.
Qu’est-ce qu’il y a derrière ça
L’ancienne façon de faire comprendre une vidéo à une IA était une course de relais : un modèle transcrit le discours, un autre décrit les images, un troisième lit à la fois les descriptions et les raisons les concernant. Chaque transfert fait perdre des informations, et les éléments perdus sont exactement ceux qui ont un sens. Le ton de la voix, le fait que quelqu’un ait l’air incertain, ce qui était à l’écran au moment où une phrase a été prononcée, rien de tout cela n’a survécu à une transcription. Un modèle unique prenant en compte les flux bruts maintient ces détails en jeu, c’est pourquoi « natif » est le mot que les laboratoires continuent de rechercher.
L’effondrement des coûts est ce qui en fait plus qu’une curiosité de recherche. Lorsque le traitement d’une heure d’audio coûtait cher, vous ne le faisiez que pour du matériel dont vous saviez déjà qu’il était important. À ces prix, il devient raisonnable de pointer un modèle vers tout et de chercher ensuite, ce qui est un tout autre type d’outil. Il convient toutefois de garder les attentes fondées : le chiffre de 26 % est celui d’Alibaba, mesuré par rapport au modèle précédent d’Alibaba, et l’évaluation indépendante des systèmes omnimodaux est encore mince.
Ce que cela signifie pour vous : Si vous avez une pile d’enregistrements, de réunions, d’entretiens, de conférences, d’appels d’assistance, qui ont été trop coûteux ou trop fastidieux pour faire quoi que ce soit, cette classe de modèle est la raison qui change. Vous y parviendrez via des produits plutôt que via l’API. Pour quiconque construit quelque chose, la remarque honnête concerne les poids ouverts manquants : un modèle API uniquement signifie que votre audio et votre vidéo sont envoyés aux serveurs d’Alibaba, ce qui est une question simple de savoir si le matériel vous appartient.
Sources
Sources: https://technode.com/2026/09/18/alibabas-qwen-releases-qwen3-8-omni-flash-with-1m-token-context/
Xiaomi possède désormais le modèle ouvert le plus puissant au monde et vous pouvez simplement le télécharger
Le constructeur de téléphones et de voitures a publié lundi MiMo-V2.6-Pro et Flash sous licence MIT. L'analyse comparative tierce, Artificial Analysis, a obtenu un score Pro de 46, le niveau le plus élevé jamais atteint par un modèle téléchargeable.