CourionAI
IT
Newsletter
← Tutte le notizie
local-ai 3 min di lettura

Un modello da 125 miliardi di parametri su una normale scheda grafica

Tim Dettmers ha presentato in anteprima la settimana open source del suo laboratorio: un framework di inferenza che esegue Qwen 3.8 Flash Next su una singola GPU da 24 GB, DeepSeek V4.1 su un MacBook e una tecnica di compattazione che, secondo lui, dimezza i costi degli agenti.

Un'enorme sfera compressa e deformabile per entrare in una piccola scatola da scrivania

Tim Dettmers, il ricercatore dietro la libreria di quantizzazione bitsandbytes, ampiamente utilizzata, ha pubblicato lunedì un’anteprima di ciò che il suo laboratorio universitario pubblicherà questa settimana: due progetti open source e quattro articoli, deliberatamente spediti insieme. I numeri in esso contenuti sono del tipo che cambia ciò che è possibile fare con l’hardware che le persone già possiedono. Il suo framework di inferenza esegue Qwen 3.8 Flash Next, un modello da 125 miliardi di parametri, su una singola scheda grafica da 24 GB, del tipo che si trova in un normale desktop. Con una macchina AMD Strix, una Nvidia DGX Spark o un MacBook con 128 GB di memoria, dice che puoi eseguire DeepSeek V4.1 con 550 miliardi di parametri. Su Mac, un modello Qwen 3.6 35B funziona a 450 token al secondo a 1,5 bit per peso.

Quest’ultima cifra merita di essere disimballata. Ogni parametro in un modello è un numero, normalmente memorizzato utilizzando 16 bit di memoria. La quantizzazione comprime questi numeri in meno bit e a 1,5 bit un modello necessita di circa un decimo della memoria che altrimenti avrebbe. Il mestiere è la precisione, ecco perché farlo senza compromettere la qualità dell’output è difficile e perché il nome di Dettmers è legato a gran parte di questo lavoro. L’altro pezzo è CliffCompaction, una tecnica di compattazione automatica che il suo laboratorio utilizza internamente da mesi. La compattazione è il modo in cui un agente continua a lavorare anche dopo che la sua conversazione sarebbe traboccata: riassume ciò che è successo in modo che possa andare avanti. Dice che le sessioni durano milioni di token, alcuni dei suoi ultimi cento milioni, e che questo riduce i costi di circa la metà. Una società partner ha misurato una riduzione del 45% del budget totale dedicato all’IA.

Cosa c’è dietro tutto questo?

Dettmers inquadra l’intero comunicato come una tesi secondo cui la ricerca sull’intelligenza artificiale non appartiene solo a chi possiede più GPU e che i piccoli laboratori universitari sono avvantaggiati proprio perché devono lavorare su problemi che sono economici da attaccare. È un’idea carina, e l’affermazione tecnica più interessante che sta dietro è che il limite massimo per l’intelligenza artificiale locale non è stato rappresentato dai modelli. Pesi aperti abbastanza buoni da essere utili sono scaricabili da un po’. L’ostacolo è stato che un modello da 125 miliardi di parametri non sarebbe stato adatto a una macchina normale, quindi la maggior parte delle persone ha utilizzato modelli di piccole dimensioni e ha concluso che l’intelligenza artificiale locale era deludente.

Il giusto avvertimento: queste sono affermazioni in anteprima da un post sul blog, il codice arriverà nei prossimi giorni e nessuno al di fuori del laboratorio ne ha riprodotto nulla. I risultati della quantizzazione, in particolare, tendono ad avere un aspetto migliore sui benchmark scelti per dimostrarli che sul proprio lavoro.

Che cosa significa per te: Se l’esecuzione di modelli sul tuo computer ti è mai piaciuta, in termini di privacy, costi, lavoro offline, questa è la settimana in cui guardare di nuovo, perché i limiti di dimensione che ricordi potrebbero non essere più applicabili. Per tutti gli altri il numero rilevante è quello del costo. Se una tecnica di compattazione può dimezzare la spesa di un agente e il metodo è pubblico, non rimarrà a lungo una curiosità di ricerca. Gli agenti più economici sono il meccanismo attraverso il quale tutto questo raggiunge i prodotti ordinari.

Fonti

Fonti: https://timdettmers.com/2026/09/21/dlab-open-source-week/

Articolo successivo

Un difetto del Mac consente a qualsiasi app di reindirizzare ciò che imposti all'assistente di Meta

Il ricercatore di sicurezza Patrick Wardle ha rivelato uno zero-day in Meta's Muse per Mac: un'impostazione non documentata che qualsiasi processo locale può modificare, inviando richieste dettate al server di un utente malintenzionato ed esponendo il token dell'account.

Un microfono il cui cavo bypassa la presa a muro e scompare in uno sportello laterale nascosto