CourionAI
IT
Newsletter
← Tutte le notizie
models 3 min di lettura

Il nuovo modello di Alibaba guarda e ascolta e non fa pagare quasi nulla

Qwen3.8-Omni-Flash gestisce testo, immagini, audio e video in un unico modello con un contesto da milioni di token. Alibaba segnala che i costi orari di ingestione di audio sono diminuiti di oltre il 98%. Nessun peso aperto al momento del lancio.

Un imbuto che accoglie onde sonore, fotogrammi e fotografie, fondendoli in un unico nastro

Il team Qwen di Alibaba ha rilasciato Qwen3.8-Omni-Flash il 18 settembre, un modello che riunisce testo, immagini, audio e video anziché attraverso sistemi specializzati separati. “Omnimodale” è la parola usata nel marketing, e ciò che significa in pratica è che il modello sente una registrazione come suono invece di ricevere una trascrizione prodotta prima da qualche altro strumento. Contiene un milione di token di contesto, sufficienti per ore di materiale contemporaneamente, e Alibaba segnala un miglioramento medio di oltre il 26% su circa 30 valutazioni rispetto al precedente Qwen3.5-Omni-Plus.

I prezzi sono la parte che vale la pena scrivere. Alibaba elenca 0,8 RMB per milione di token di input e 2,7 RMB per milione di token di output su Alibaba Cloud Model Studio e afferma che il costo di acquisizione di un’ora di audio è diminuito di oltre il 98%, con input audio e video misti in calo di oltre il 93%. Nelle attività video in stile agente segnala il 45,7% in meno di token utilizzati. Il modello è solo API, disponibile tramite QwenCloud, Alibaba Cloud Model Studio e Qwen Studio, senza pesi scaricabili annunciati al momento del lancio. Quest’ultimo punto rappresenta un punto di svolta per un team che ha costruito gran parte della sua reputazione sulle versioni aperte.

Cosa c’è dietro tutto questo?

Il modo più antico per far comprendere un video a un’intelligenza artificiale era una staffetta: un modello trascrive il discorso, un altro descrive i fotogrammi, un terzo legge sia le descrizioni che le ragioni al riguardo. Ogni trasferimento perde informazioni e le cose che si perdono sono esattamente quelle che hanno un significato. Il tono della voce, se qualcuno sembrava insicuro, cosa c’era sullo schermo nel momento in cui veniva pronunciata una frase, niente di tutto ciò sopravvive alla trascrizione. Un singolo modello che prende i flussi grezzi mantiene questi dettagli in gioco, motivo per cui “nativo” è la parola a cui i laboratori continuano a ricorrere.

Il crollo dei costi è ciò che lo rende più di una curiosità di ricerca. Quando elaborare un’ora di audio era costoso, lo facevi solo per il materiale che già sapevi fosse importante. A questi prezzi diventa ragionevole puntare su un modello e poi cercare, il che è uno strumento completamente diverso. Vale la pena però mantenere le aspettative con i piedi per terra: la cifra del 26% appartiene ad Alibaba, misurata rispetto al modello precedente di Alibaba, e la valutazione indipendente dei sistemi omnimodali è ancora scarsa.

Cosa significa per te: Se hai una pila di registrazioni, riunioni, interviste, conferenze, chiamate di supporto, che è stata troppo costosa o troppo noiosa per fare qualsiasi cosa, questa classe di modello è la ragione che sta cambiando. Lo incontrerai attraverso i prodotti anziché tramite l’API. Per chiunque stia costruendo qualcosa, la nota onesta sono i pesi aperti mancanti: un modello solo API significa che il tuo audio e video vanno ai server di Alibaba, il che è una questione semplice per sapere se il materiale è tuo da inviare.

Fonti

Fonti: https://technode.com/2026/09/18/alibabas-qwen-releases-qwen3-8-omni-flash-with-1m-token-context/

Articolo successivo

Xiaomi ora ha il modello aperto più potente al mondo e puoi semplicemente scaricarlo

Lunedì il produttore di telefoni e automobili ha rilasciato MiMo-V2.6-Pro e Flash sotto licenza MIT. Il benchmarker di terze parti Artificial Analysis ha ottenuto un punteggio Pro di 46, il più alto raggiunto da qualsiasi modello scaricabile.

Una cassa di spedizione aperta sul podio di un vincitore, da cui fuoriescono pannelli a strati