CourionAI
IT
Newsletter
← Tutte le notizie
models 3 min di lettura

Un modello di diffusione ora scrive 1.100 parole al secondo e non costa quasi nulla

Inception Labs ha rilasciato Mercury 2.5, un modello linguistico costruito nel modo in cui sono costruiti i generatori di immagini piuttosto che nel modo in cui lo è ChatGPT. Produce 1.107 token al secondo sulle normali schede Nvidia a 20 centesimi per milione di token di input.

Una nuvola sparsa di grano stampato che si risolve tutto in una volta in file di linee di velocità nitide, con una lenta catena di perline che striscia lungo il bordo inferiore

Lunedì Inception Labs ha rilasciato Mercury 2.5 e il numero citato da tutti è di 1.107 token al secondo. I token sono piccoli pezzi di testo che un modello legge e scrive, circa tre quarti di parola ciascuno, quindi si tratta di circa 800 parole al secondo che escono da un singolo modello su hardware Nvidia ampiamente disponibile. Per fare un confronto, la maggior parte dei modelli di chat che usi oggi sono veloci da 50 a 150 token al secondo.

L’azienda afferma che Mercury 2.5 è circa il 40% più potente di Mercury 2 nelle sue misurazioni interne e che si colloca nella stessa fascia di qualità dei livelli economici e veloci dei grandi laboratori: GPT-5.6 Luna con impostazione bassa, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Viene fornito con una finestra di contesto di 260.000 token, ovvero la quantità di testo che il modello può tenere a mente contemporaneamente, oltre a uno sforzo di ragionamento personalizzabile, chiamate a strumenti paralleli e output JSON che segue uno schema definito dall’utente. Il prezzo standard è di 0,20 dollari per milione di token di input e 0,75 per milione di output, con uno sconto di lancio dell’80% che li riduce a 0,04 e 0,15. Inception dichiara inoltre che il tempo per il primo token è inferiore a 170 ms per le pipeline vocali, ovvero il ritardo prima che ritorni la prima parola.

Cosa c’è dietro tutto questo?

Quasi tutti i modelli linguistici che hai utilizzato funzionano da sinistra a destra. Scrive un token, guarda tutto ciò che ha scritto, quindi scrive quello successivo. Questa sequenza è il motivo per cui la generazione ha un limite di velocità: il modello non può letteralmente avviare il token 200 prima che esista il token 199.

Un modello di linguaggio di diffusione funziona allo stesso modo in cui funzionano i generatori di immagini come Stable Diffusion. Si inizia con una bozza approssimativa e rumorosa dell’intera risposta e poi la si rifinisce in passaggi, affinando molti token allo stesso tempo. Poiché il perfezionamento avviene in parallelo, la stessa GPU produce molto più testo al secondo. Storicamente il compromesso è stato la qualità, dal momento che un modello che si impegna precocemente in una forma approssimativa ha difficoltà a dover affrontare lunghe catene di ragionamenti attenti. Mercury 2.5 è la tesi di Inception secondo cui il divario si è ridotto abbastanza da avere importanza per il lavoro quotidiano e, secondo loro, è il modello di linguaggio a più ampia diffusione che chiunque abbia mai formato. Tale affermazione non è stata ancora verificata in modo indipendente, il che vale la pena tenere presente.

Cosa significa per te: Se sei solo curioso riguardo all’intelligenza artificiale, oggi non cambia nulla, ma è utile sapere: velocità e prezzo non sono proprietà fisse dell’intelligenza artificiale, dipendono da come è costruito il modello e qualcuno ha appena trovato una scorciatoia. Se costruisci cose, il caso interessante è tutto ciò in cui il problema è l’attesa piuttosto che l’ingegno: completamento automatico in un editor, un assistente vocale che deve rispondere prima che la pausa diventi imbarazzante, pulizia in massa di poche migliaia di documenti. A 15 centesimi per milione di token di output durante lo sconto di lancio, i lavori che erano troppo costosi per essere gestiti su un intero archivio improvvisamente non lo sono più. Un giusto avvertimento: esegui il tuo confronto prima di cambiare qualcosa di importante, perché “paragonabile al livello economico di un modello di frontiera” è un’affermazione del venditore, non un verdetto sul campo.

Fonti

Fonti: https://www.inceptionlabs.ai/blog/introducing-mercury-2-5

Articolo successivo

Meta smette di valutare gli ingegneri in base alla quantità di intelligenza artificiale che utilizzano

Dopo che il personale si è confrontato su una classifica interna dei token, Meta ha detto agli ingegneri che i dashboard sull'utilizzo dell'intelligenza artificiale e il conteggio dei token non conteranno più nelle revisioni delle prestazioni. L'episodio ora ha un nome: tokenmaxxing.

Una contromacchina meccanica che si avvia e rovescia cumuli di gettoni identici sul pavimento accanto a un misuratore con un ago spezzato