AMD e Cerebras collaborano per far arrivare più velocemente le risposte dell’IA
Due aziende di chip dividono il lavoro di esecuzione di un modello IA per puntare a una latenza più bassa e a una migliore efficienza energetica. Ecco la versione in parole semplici.
AMD e Cerebras hanno annunciato questa settimana una partnership per eseguire più velocemente i modelli IA, dividendo il lavoro tra due tipi di chip molto diversi. Sembra un dettaglio tecnico dell’hardware, ma l’obiettivo è qualcosa che senti ogni giorno: il tempo tra quando premi Invio e quando la risposta inizia ad apparire.
L’idea, in parole semplici, è questa. Quando un modello IA ti risponde svolge due compiti. Prima legge e assimila la richiesta, insieme ai documenti o alla cronologia allegati. Poi scrive la risposta un pezzo alla volta. I due compiti hanno esigenze diverse. Leggere una richiesta lunga è un’attività di massa che premia il throughput; scrivere la risposta parola per parola richiede soprattutto velocità a ogni passaggio. I rack “Helios” di AMD, costruiti con processori EPYC e GPU Instinct, gestiranno la lettura e potranno elaborare molte richieste grandi insieme. Cerebras, nota per un chip grande quanto un piatto, un “wafer-scale engine”, in sostanza un solo processore gigante invece di molti piccoli collegati, si occuperà della scrittura, producendo token con un ritardo minimo. AMD e Cerebras affermano che questa divisione offre fino a cinque volte più efficienza energetica. Il servizio combinato dovrebbe arrivare prima tramite Cerebras Cloud nella seconda metà dell’anno.
Che cosa sta succedendo davvero? Per anni l’industria IA ha gareggiato per costruire modelli più grandi. La nuova gara consiste nel servirli bene: velocemente, a basso costo e senza consumare quantità assurde di energia. Le configurazioni “disaggregate” come questa, che usano il chip giusto per ogni parte del compito invece di uno solo per tutto, sono una parte importante della risposta. È anche un momento notevole per Cerebras, da tempo outsider in un mondo dominato da Nvidia, e per AMD, che ha recentemente firmato un accordo separato sull’inferenza con Anthropic. Una cautela: sono dichiarazioni sulle prestazioni fatte dalle aziende stesse e il prodotto comune non è ancora disponibile, quindi i numeri reali devono ancora arrivare.
Cosa significa per te: Non vedrai mai un chip AMD o Cerebras e non ti serve. Quando l’assistente che usi risponde più velocemente o un provider abbassa i prezzi, è questo tipo di lavoro dietro le quinte a renderlo possibile. Un servizio più rapido ed economico trasforma una demo impressionante in qualcosa che vuoi davvero usare tutto il giorno. Per la maggior parte delle persone oggi non cambia nulla: è solo un buon segnale per la direzione dell’infrastruttura.
Fonti
Le nuove regole cinesi per i compagni IA sono entrate in vigore. Ecco cosa prevedono
Le nuove regole cinesi sulle app “compagno” IA sono entrate in vigore la scorsa settimana: vietano i chatbot romantici per i minori e impongono protezioni contro la dipendenza. Ecco cosa è cambiato e perché il mondo le sta osservando.