Alibabas neues Modell schaut und hört zu und verlangt dafür fast nichts
Qwen3.8-Omni-Flash verarbeitet Text, Bilder, Audio und Video in einem Modell mit einem Millionen-Token-Kontext. Alibaba meldet einen Rückgang der stündlichen Kosten für die Audioaufnahme um mehr als 98 Prozent. Keine offenen Gewichte beim Start.
Das Qwen-Team von Alibaba veröffentlichte am 18. September Qwen3.8-Omni-Flash, ein Modell, das Text, Bilder, Audio und Video zusammen erfasst und nicht über separate Spezialsysteme. „Omnimodal“ ist das Marketingwort und bedeutet in der Praxis, dass das Model eine Aufnahme als Ton hört, anstatt ein Transkript zu erhalten, das zuerst von einem anderen Tool erstellt wurde. Es enthält eine Million Kontext-Token, genug für stundenlanges Material auf einmal, und Alibaba meldet eine durchschnittliche Verbesserung von mehr als 26 Prozent in etwa 30 Bewertungen im Vergleich zum vorherigen Qwen3.5-Omni-Plus.
Es lohnt sich, die Preise aufzuschreiben. Alibaba listet im Alibaba Cloud Model Studio 0,8 RMB pro Million Eingabe-Tokens und 2,7 RMB pro Million Ausgabe-Tokens auf und gibt an, dass die Kosten für die Aufnahme einer Stunde Audio um mehr als 98 Prozent gesunken sind, wobei die gemischte Audio- und Video-Eingabe um mehr als 93 Prozent gesunken ist. Bei Videoaufgaben im Agentenstil werden 45,7 Prozent weniger Token verwendet. Das Modell ist nur eine API und über QwenCloud, Alibaba Cloud Model Studio und Qwen Studio verfügbar. Zum Start werden keine herunterladbaren Gewichte angekündigt. Dieser letzte Punkt stellt einen Abschied für ein Team dar, das einen Großteil seines Rufs auf offenen Veröffentlichungen aufgebaut hat.
Was steckt dahinter
Der ältere Weg, einer KI ein Video verständlich zu machen, war ein Staffellauf: Ein Modell transkribiert die Rede, ein anderes beschreibt die Frames, ein drittes liest sowohl Beschreibungen als auch Begründungen dazu vor. Bei jeder Übergabe gehen Informationen verloren, und die Dinge, die verloren gehen, sind genau diejenigen, die eine Bedeutung haben. Der Tonfall der Stimme, ob jemand unsicher klang, was in dem Moment auf dem Bildschirm zu sehen war, als ein Satz gesagt wurde, nichts davon überlebt ein Transkript. Ein einzelnes Modell, das die Rohdatenströme übernimmt, behält diese Details im Spiel, weshalb „nativ“ das Wort ist, nach dem die Labore immer wieder greifen.
Der Kostenverfall macht es zu mehr als einer Forschungskuriosität. Als die Bearbeitung einer Stunde Audiomaterial teuer war, tat man dies nur für Material, von dem man bereits wusste, dass es wichtig war. Bei diesen Preisen ist es sinnvoll, ein Modell auf alles zu richten und anschließend zu suchen, was eine ganz andere Art von Werkzeug ist. Es lohnt sich jedoch, die Erwartungen auf dem Boden zu halten: Der Wert von 26 Prozent ist Alibabas eigener Wert, gemessen am Vorgängermodell von Alibaba, und die unabhängige Bewertung omnimodaler Systeme ist immer noch dürftig.
Was das für Sie bedeutet: Wenn Sie einen Stapel von Aufzeichnungen, Besprechungen, Interviews, Vorträgen und Supportanrufen haben, der zu teuer oder zu mühsam war, um etwas damit zu tun, ist diese Modellklasse der Grund für die Änderung. Sie werden dies über Produkte und nicht über die API erreichen. Der ehrliche Hinweis für jeden, der etwas erstellt, sind die fehlenden offenen Gewichte: Ein reines API-Modell bedeutet, dass Ihre Audio- und Videodaten an die Server von Alibaba gesendet werden, was eine einfache Frage ist, ob das Material Ihnen gehört, das Sie senden möchten.
Quellen
Quellen: https://technode.com/2026/09/18/alibabas-qwen-releases-qwen3-8-omni-flash-with-1m-token-context/
Xiaomi hat jetzt das stärkste offene Modell der Welt und Sie können es einfach herunterladen
Der Telefon- und Autohersteller hat am Montag MiMo-V2.6-Pro und Flash unter einer MIT-Lizenz veröffentlicht. Der Drittanbieter-Benchmarker Artificial Analysis erzielte eine Pro-Bewertung von 46, die höchste Punktzahl, die jemals ein herunterladbares Modell erreicht hat.