CourionAI
IT
Newsletter
← Tutte le notizie
openai 3 min di lettura

OpenAI ha costruito il proprio chip e i primi benchmark sono buoni

Jalapeño, il primo chip di inferenza personalizzato di OpenAI con Broadcom, funziona con 700 watt contro i 900-1.150 di Nvidia. Un'analisi indipendente lo colloca da 1,5 a 1,9 volte in più per kilowatt.

Un piccolo peperoncino disegnato come un chip di computer con perni, accanto a una spina di alimentazione a spirale molto più grande

OpenAI e Broadcom hanno presentato questa settimana Jalapeño alla conferenza Hot Chips, il primo processore che OpenAI ha progettato da sola. È un chip di inferenza, il che significa che è costruito per eseguire modelli finiti piuttosto che per addestrarne di nuovi, e i primi benchmark pubblicati lo pongono davanti agli attuali rack di Nvidia nella misura che conta di più per chiunque paghi una bolletta elettrica.

Le cifre principali, dalla newsletter di analisi dei chip SemiAnalysis e dai numeri di OpenAI: Jalapeño assorbe 700 watt, contro i 900-1.150 watt del die di calcolo Rubin di Nvidia. Sul benchmark InferenceX di SemiAnalysis ha fornito da 1,5 a 1,9 volte più throughput per kilowatt e da 1,7 a 3,6 volte la latenza end-to-end inferiore rispetto ai sistemi rack GB200 e GB300 di Nvidia, testati su modelli aperti tra cui DeepSeek R1, GPT-OSS e Kimi K2.5. Il lavoro di progettazione è iniziato a metà del 2024, il progetto è arrivato in fabbrica nel novembre 2025 ed è basato sul processo N3P di TSMC con memoria HBM4 a 15,4 TB/s. Nello stesso rapporto si trovano due avvertenze. SemiAnalysis sostiene che il giusto paragone è la più recente piattaforma Vera Rubin di Nvidia piuttosto che Blackwell, poiché entrambe utilizzano la memoria HBM4, e su questo piano Jalapeño è ancora in vantaggio sui token di output per megawatt ma arriva più o meno alla pari sul costo totale per token.

Cosa sta realmente succedendo qui: l’inferenza è dove vanno i soldi. L’addestramento di un modello è una spesa una tantum, ma ogni domanda posta da un utente costa energia per sempre e, su scala di OpenAI, un quinto di sconto sulla bolletta elettrica è una cifra molto elevata. Un chip personalizzato può essere più stretto di una GPU generica in base alla progettazione: deve solo eseguire bene i modelli di OpenAI, quindi tutto ciò che non serve a tale obiettivo viene tagliato. Questo è l’intero motivo per cui Google ha creato TPU e Amazon ha creato Inferentia. La parte strategica non è il punto di riferimento, è la leva finanziaria. Un’azienda con un chip interno credibile negozia con Nvidia da una posizione diversa, e Anthropic leggendo la stessa pagina è presumibilmente il motivo per cui ha appena assunto il fondatore del programma TPU di Google.

Che cosa significa per te: non noterai nulla questo mese e non potrai acquistarne uno. Ma l’inferenza più economica è il meccanismo alla base di quasi tutti i miglioramenti effettivamente percepiti: prezzi API più bassi, limiti del livello gratuito più elevati, risposte più rapide e modelli che possono pensare più a lungo prima di rispondere. Se si basa su API AI, la cosa da guardare è se OpenAI trasmette l’efficienza o la mantiene come margine. Vale anche la pena radicarsi: si tratta di benchmark di fornitori e analisti su modelli selezionati, non di test indipendenti su larga scala, e la risposta di Nvidia viene fornita nella stessa finestra.

Fonti

Fonti: https://openai.com/index/openai-broadcom-jalapeno-inference-chip/

Articolo successivo

Questo robot impara un compito di dieci minuti guardando un video

Skild AI ha rilasciato S1, un modello di robot che copia un'attività dopo aver visto una singola dimostrazione umana, senza riqualificazione. Ha girato un pancake anche se non l'ha mai visto durante l'allenamento.

Un braccio robotico che gira una frittella in una padella, con una pellicola accanto che mostra lo stesso movimento fotogramma per fotogramma