AMD acquista Taalas, una startup che integra un intero modello di intelligenza artificiale nel chip
Taalas incide l'architettura e i pesi di un modello direttamente nel silicio. Ciò lo rende estremamente veloce e completamente inflessibile. AMD vuole la tecnologia insieme alle sue GPU Instinct.
AMD sta acquistando Taalas, una piccola startup canadese di chip con un’idea insolita: invece di costruire un chip generico in grado di eseguire qualsiasi modello di intelligenza artificiale, costruire un chip che possa eseguirne esattamente uno, incidendo quel modello direttamente nell’hardware. L’accordo è stato annunciato venerdì ed è soggetto alle consuete approvazioni normative.
Prima un po’ di vocabolario, perché il resto abbia senso. Quando un modello di intelligenza artificiale ti risponde, ciò si chiama inferenza, in contrapposizione all’addestramento, che è in primo luogo il costoso processo una tantum di costruzione del modello. L’inferenza è ciò che accade milioni di volte al giorno, quindi è dove risiede la maggior parte dei costi di gestione. Normalmente una GPU carica i pesi del modello, i miliardi di numeri che codificano ciò che il modello ha imparato, esaurisce la memoria e fa i conti. Mescolare questi numeri avanti e indietro è una parte importante di ciò che lo rende lento e assetato di potere.
Taalas salta questo passaggio inserendo l’architettura e i pesi addestrati nel chip stesso. L’azienda è uscita allo scoperto nel febbraio 2026 con un chip demo che eseguiva Llama 3.1-8B a più di 16.000 token al secondo per utente, molte volte più veloce dell’hardware di inferenza della concorrenza. Un token è più o meno un frammento di parola, quindi quel numero indica che il testo appare molto più velocemente di quanto chiunque possa leggerlo. Il problema sta proprio nel design: quel chip esegue Llama 3.1-8B e nient’altro, per sempre. Nuovo modello, nuovo silicio.
Questo commercio è meno strano di quanto sembri. La progettazione e la produzione dei chip richiedono molti mesi e fino a poco tempo fa un modello sarebbe stato obsoleto prima che arrivasse il suo chip. Ora che i modelli di punta rimangono in servizio più a lungo e la stessa manciata di essi serve enormi volumi di traffico, bloccarne uno nell’hardware inizia a essere eliminato. Secondo quanto riferito, Google sta lavorando allo stesso trucco con un chip integrato nell’architettura di Gemini. AMD afferma che inserirà la tecnologia nella sua roadmap dell’acceleratore e la offrirà insieme alle sue GPU Instinct come prodotto a livello di sistema. Il capo dell’intelligenza artificiale di AMD, Vamsi Boppana, lo ha definito un rafforzamento del portafoglio, e il co-fondatore di Taalas, Ljubisa Bajic, ha affermato che AMD apporta la scala che mancava alla startup.
Cosa significa per te: niente che tu possa acquistare e niente che possa cambiare il tuo chatbot questa settimana. Ciò che cambierà nei prossimi anni è il prezzo. I chip sottostanti i servizi di intelligenza artificiale stanno diventando sempre più economici ed efficienti per risposta, e questo è il motivo principale per cui i livelli gratuiti che utilizzi continuano a diventare più generosi anziché inferiori. È anche un piccolo indizio sulla direzione in cui sta andando “l’intelligenza artificiale sul tuo dispositivo”: non un cervello generico nel tuo telefono, ma modelli specifici fissati in hardware specifico. Un giusto avvertimento: questa è un’acquisizione, non un prodotto. I regolatori devono ancora approvarlo e domani non verrà spedito nulla.
Fonti
Secondo quanto riferito, ByteDance, proprietario di TikTok, sta formando il modello di intelligenza artificiale più grande mai realizzato in Cina
Tre addetti ai lavori hanno riferito al Financial Times che ByteDance ha un modello con un massimo di diecimila miliardi di parametri in pre-allenamento, tre volte più grande di Kimi K3.