Vai al contenuto
LF Lomazzi Federico

Home/Appunti/Elettronica

Elettronica

Jalapeño: OpenAI si costruisce il chip per l'AI agentica

Lomazzi Federico 23 min di lettura

Jalapeño è il primo acceleratore proprietario di OpenAI, sviluppato con Broadcom e costruito apposta per l'inferenza dei grandi modelli linguistici, soprattutto quando la latenza conta e gli agenti devono concatenare molti passaggi. Non sostituisce magicamente tutte le GPU NVIDIA, ma dimostra che OpenAI vuole controllare anche il silicio: 700 W di TDP, 216 GiB di HBM4, 15,4 TB/s di banda ed una architettura co-progettata con l'AI.

Sam Altman e Hock Tan mostrano il wafer del processore Jalapeño sviluppato da OpenAI e Broadcom

Prima correzione: Jalapeño non è stato presentato per la prima volta ad Hot Chips

Se avete seguito soltanto le notizie europee di fine agosto saprete certamente che Jalapeño è sembrato comparire dal nulla durante Hot Chips 2026, ma in realtà OpenAI e Broadcom lo avevano già annunciato il 24 giugno. Ad Hot Chips, il 25 agosto, è arrivata la parte che personalmente trovo molto più interessante, ossia i numeri, l'architettura, i benchmark e soprattutto la spiegazione del perché OpenAI abbia deciso che comprare acceleratori già fatti non bastava più. Quello che a giugno era il primo Intelligence Processor di OpenAI, cioè il primo ASIC proprietario costruito insieme a Broadcom per l'inferenza LLM, ad agosto è diventato finalmente un oggetto tecnico abbastanza concreto da poter essere confrontato con i sistemi NVIDIA GB200 e GB300.

E qui secondo me bisogna togliere immediatamente di mezzo un'altra semplificazione, perché dire che OpenAI fosse fino a ieri una azienda soltanto software e che improvvisamente si sia messa a fabbricare chip da sola non è corretto. OpenAI ha progettato Jalapeño partendo dai propri workload e dalla propria roadmap, Broadcom ha contribuito alla implementazione del silicio, al networking ed alla industrializzazione della piattaforma, mentre Celestica entra nella parte di board, rack e integrazione di sistema. Non siamo quindi davanti ad OpenAI che si compra una fabbrica e comincia a produrre wafer, ma davanti a qualcosa di forse ancora più significativo: OPENAI HA DECISO DI CONTROLLARE ANCHE L'ARCHITETTURA DEL SILICIO CHE ESEGUE I SUOI MODELLI.

Non è una GPU generica, ma neppure NVIDIA costruisce ferri generici

La storia viene spesso raccontata così: le GPU NVIDIA sono generiche, Jalapeño invece è specifico. È una frase comoda ma troppo grezza, perché un GB200 oppure un GB300 non è certo una scheda grafica da videogioco riciclata alla buona, sono sistemi progettati in maniera estremamente sofisticata proprio per l'AI. La differenza vera è un'altra: OpenAI conosce con una precisione che nessun fornitore esterno può avere il proprio mix di modelli, kernel, pattern di serving, richieste interattive, Codex, agenti, roadmap futura ed economia interna del token, ed ha quindi potuto chiedersi quale macchina avrebbe costruito SE IL SUO LAVORO PRINCIPALE FOSSE ESATTAMENTE ESEGUIRE QUEL TIPO DI INFERENZA.

Questa distinzione è fondamentale. Un acceleratore commerciale deve funzionare bene per clienti diversi, framework diversi, modelli diversi ed esigenze diverse, Jalapeño invece nasce dentro una strategia di hardware-software co-design nella quale chi progetta il modello conosce anche il chip, chi scrive il serving stack conosce la rete e chi ottimizza i kernel può intervenire sull'architettura. OpenAI dichiara comunque di averlo progettato per essere flessibile e capace di eseguire LLM non proprietari, ed infatti i test pubblici sono stati fatti non soltanto con GPT-OSS 120B ma anche con DeepSeek R1 670B e Kimi K2.5 1T. Quindi non è un circuito inchiodato ad un singolo modello, ma resta un ASIC costruito da zero attorno ad un profilo di inferenza molto più specifico di quello che deve servire una piattaforma general purpose.

Il vero bersaglio è l'inferenza, non il training

Questa è probabilmente la cosa più importante per capire Jalapeño. OpenAI non lo ha presentato come il chip con il quale addestrare la prossima generazione di modelli, ma come una piattaforma per INFERENCE, cioè per la fase nella quale un modello già addestrato deve servire richieste reali agli utenti. Ed oggi questa fase sta diventando mostruosamente importante perché ogni risposta di ChatGPT, ogni chiamata API, ogni sessione Codex ed ogni agente che esegue decine o centinaia di passaggi consuma calcolo in tempo reale.

Il training è costosissimo ma avviene per periodi relativamente definiti, mentre l'inferenza è una tassa continua che cresce con l'utilizzo del prodotto. Più utenti arrivano, più modelli ragionano a lungo, più gli agenti provano, verificano, correggono e riprovano, più quella tassa diventa il vero costo industriale dell'AI. È qui che per OpenAI un guadagno apparentemente piccolo in joule per token oppure millisecondi per step può moltiplicarsi per miliardi e diventare denaro, capacità di datacenter ed esperienza utente.

Per questo Jalapeño non è interessante soltanto come chip. È il segnale che l'AI sta entrando nella stessa fase nella quale sono entrati anni fa i grandi hyperscaler: quando il workload diventa abbastanza grande e prevedibile, progettarsi l'hardware intorno al proprio software può costare meno che continuare per sempre ad adattare il software all'hardware di qualcun altro.

Perché gli agenti cambiano il problema della latenza

Se chiedo ad un chatbot una risposta e devo aspettare qualche centinaio di millisecondi in più, magari me ne accorgo appena. Ma se un agente deve leggere un repository, decidere quale file aprire, modificare del codice, eseguire un test, leggere l'errore, ragionare di nuovo, correggere il codice, lanciare un altro test e ripetere la sequenza decine di volte, la latenza di ogni singolo passo si SOMMA.

È questo che OpenAI sottolinea nei risultati di agosto. Per un agente non conta soltanto quanti token al secondo riesco a produrre quando riempio un acceleratore con una enorme quantità di richieste, conta anche quanto rapidamente riesco a completare ciascuna richiesta interattiva, perché il passo successivo spesso non può iniziare prima che sia terminato quello precedente. La latenza non è più soltanto una questione di comfort dell'utente, diventa parte della velocità con la quale il software artificiale riesce a lavorare.

Ed è anche qui che correggerei la formula secondo cui Jalapeño sarebbe stato progettato specificamente per i coders. Il chip non è un acceleratore esclusivo per scrivere codice, OpenAI lo descrive come una piattaforma per i moderni e futuri LLM ed in particolare per workload interattivi ed agentici. Codex è però l'esempio perfetto per capire perché questa scelta conta: un agente di coding può compiere moltissimi passaggi consecutivi e quindi ogni millisecondo risparmiato fra un token, una decisione ed il passaggio successivo viene amplificato dall'intera catena.

Prefill, decode e rete non chiedono la stessa macchina

Una richiesta LLM non è un blocco uniforme di calcolo. Prima c'è il prefill, cioè la fase nella quale il sistema legge il prompt ed il contesto e che tende ad essere molto compute-bound, poi arriva il decode, cioè la produzione dei token successivi, che diventa molto più dipendente dalla banda di memoria, ed in mezzo ai modelli moderni compaiono draft model, speculative decoding, Mixture of Experts e comunicazioni fra chip che possono trasformare la rete in un altro collo di bottiglia.

Questa eterogeneità è uno dei punti centrali della presentazione di Hot Chips. OpenAI sostiene che costruire flotte separate, ognuna specializzata per una fase diversa, introduce inefficienze perché quando un acceleratore resta in attesa continua comunque a portarsi dietro il consumo di package, memoria, I/O e rete. Jalapeño cerca invece di essere un CHIP BILANCIATO nel quale le diverse risorse vengono accese ed utilizzate nella proporzione richiesta dalla fase corrente, mentre quelle non necessarie possono essere power-gated.

La scelta ha un'altra conseguenza molto interessante: evitare di spostare continuamente la KV Cache fra sistemi specializzati. La KV Cache è uno dei grandi serbatoi di stato dell'inferenza moderna e muoverla attraverso la rete ogni volta che cambia la fase del workload significa introdurre traffico, consumo e latenza. OpenAI ha quindi cercato di tenere lo stato vicino al calcolo e di cambiare internamente il mix di compute, memoria e comunicazione attivo in quel momento.

La memoria: 216 GiB di HBM4 e 15,4 TB al secondo

Jalapeño integra 216 GiB di HBM4 e dichiara una banda complessiva di 15,4 TB/s per package. Sono numeri enormi perché nell'inferenza dei grandi modelli la banda di memoria è spesso almeno importante quanto la quantità di operazioni teoriche che il chip sa eseguire. Posso avere una matrice di calcolo mostruosa, ma se i dati non arrivano abbastanza velocemente quella matrice resta ferma ad aspettare.

Il chip dichiara 13,4 PFLOP/s di calcolo matriciale MXFP4 e viene pensato per scalare non come una singola scheda isolata ma dentro domini molto grandi. A livello locale OpenAI parla di 128 ASIC collegati a bassa latenza, mentre un pod completo arriva a 2.048 chip, ed è qui che Broadcom diventa molto più di un semplice partner al quale affidare il layout del silicio perché il networking stesso fa parte dell'architettura del prodotto.

Una macchina per LLM ormai non finisce sul bordo del package. Quando un modello viene distribuito su centinaia oppure migliaia di acceleratori, la rete interna diventa una estensione del chip e la sua latenza può determinare quanta parte del calcolo teorico riesco veramente ad usare. Jalapeño adotta quindi percorsi locali veloci, una rete specializzata per alcune operazioni collettive frequenti ed una NoC più generale per il traffico che non richiede quella via rapida, cercando di evitare che ogni comunicazione debba attraversare il percorso più costoso.

700 watt contro 1.200 e 1.400 watt, ma attenzione al confronto

Il dato che ha fatto più rumore è inevitabilmente il consumo. Jalapeño ha un package TDP dichiarato di 700 W, mentre nei confronti pubblicati da OpenAI il GB200 viene normalizzato a 1.200 W ed il GB300 a 1.400 W. Sui workload misurati OpenAI afferma inoltre che Jalapeño è rimasto ad un consumo sostenuto pari o inferiore a 550 W.

La tentazione è scrivere immediatamente che il chip OpenAI consuma la metà del top NVIDIA ed è più veloce. In parte è proprio quello che i grafici vogliono mostrare, ma bisogna capire COME sono stati costruiti i confronti. OpenAI usa InferenceX di SemiAnalysis e confronta il rapporto fra throughput, energia e latenza lungo diversi punti operativi, non un semplice benchmark nel quale faccio girare lo stesso kernel su un chip e conto quanto impiega.

Sui tre modelli pubblici testati Jalapeño ha mostrato da 1,5 a 1,9 volte più lavoro AI per watt al picco di throughput e da 1,7 a 3,6 volte meno latenza end-to-end rispetto ai sistemi di confronto. Nei workload altamente interattivi OpenAI parla di prestazioni da 2,1 a 4,1 volte superiori. Sono già risultati enormi e molto più utili dei titoli che trasformano tutto in una gara di watt.

Il famoso 104 volte più veloce non significa quello che sembra

Qui c'è un dato che, preso senza contesto, è perfetto per produrre una notizia sbagliata. Nel test con DeepSeek R1, alla velocità TBT che rappresentava il miglior punto del sistema concorrente, Jalapeño arriva ad offrire circa 104,3 volte più mixed-token throughput per kilowatt. Sul GPT-OSS il rapporto è circa 53,7 volte e su Kimi K2.5 circa 56,1 volte.

Non significa che Jalapeño sia cento volte più potente del GB300. Significa che, SE FISSO UNA DETERMINATA LATENZA DI DECODE molto aggressiva e confronto quanto throughput utile per kilowatt i due sistemi riescono a sostenere proprio a quel punto operativo, il sistema OpenAI può servire moltissimo più lavoro. È una differenza enorme, ma è una differenza sulla forma della curva throughput-latenza e non un moltiplicatore universale valido per qualsiasi workload.

Il numero che descrive più direttamente la velocità interattiva è il minimum TBT, cioè Time Between Tokens. Su GPT-OSS Jalapeño scende a circa 0,69 ms contro 1,87 ms, quindi circa 2,7 volte meglio, su DeepSeek R1 arriva a 1,43 ms contro 5,90 ms, circa 4,1 volte, mentre su Kimi K2.5 abbiamo 1,44 ms contro 5,48 ms, circa 3,8 volte. Ed è già abbastanza impressionante senza trasformarlo in un improbabile chip cento volte più veloce di NVIDIA.

TBT significa letteralmente quanto aspetto fra un token ed il successivo

Il TBT (Time Between Tokens) è una metrica molto più concreta di quanto sembri. Quando il modello ha iniziato a rispondere, misura l'intervallo medio fra la produzione di un token ed il successivo. Se il TBT si abbassa, la risposta scorre più rapidamente ed un agente può concatenare più velocemente le proprie decisioni.

Per un chatbot un TBT estremamente basso rende la conversazione più naturale, ma per un agente il vantaggio diventa ancora maggiore perché ogni token prodotto può essere parte di un ragionamento che precede una tool call, una lettura, una modifica oppure un nuovo ciclo. OpenAI infatti dichiara che su frontier model Jalapeño raggiunge latenze token-to-token inferiori al millisecondo in condizioni economicamente utili, ed è qui che si vede la filosofia del progetto: non massimizzare soltanto il numero totale di token prodotti da un datacenter ma ridurre anche il tempo che serve ad un singolo flusso di lavoro per ARRIVARE ALLA FINE.

L'AI ha aiutato davvero a progettare il chip, ma non ha progettato Jalapeño da sola

Questa è probabilmente la parte che mi diverte di più perché chiude il cerchio: un chip costruito per far funzionare l'AI è stato progettato usando la stessa AI. Ma anche qui bisogna evitare la versione da titolo. OpenAI non ha scritto un prompt del tipo "disegnami un ASIC" e ricevuto nove mesi dopo un GDS pronto per la fabbrica, ha utilizzato modelli interni per accelerare parti reali del processo di progettazione, esplorare implementazioni, ridurre il ciclo fra misura e verifica ed ottimizzare circuiti aritmetici.

ServeTheHome riporta un esempio molto concreto presentato ad Hot Chips: su una moltiplicazione BF16 l'ottimizzazione guidata dall'AI avrebbe prodotto un miglioramento del PPA rispetto alla baseline umana e contribuito a ridurre l'area di alcune unità. Ancora più interessante è il lato software, perché Jalapeño è stato progettato deliberatamente in modo che la sua architettura fosse semplice da descrivere non soltanto agli esseri umani ma anche ai modelli.

OpenAI espone local tensor, comunicazioni esplicite e sincronizzazioni prevedibili, poi lascia ad un sistema AI la possibilità di ottimizzare mapping, placement, scheduling e pipelining. In pratica il modello riceve una macchina più regolare e quindi più facile da esplorare, mentre l'hardware viene progettato sapendo fin dall'inizio che una parte importante dell'ottimizzazione del software sarà eseguita da altre AI.

AI che programma il chip che esegue l'AI

Questa parte secondo me vale da sola l'articolo. OpenAI racconta di avere usato Codex con GPT-Astra per portare ad alte prestazioni, in circa due mesi, tre modelli open-weight che non facevano parte del piano originale di produzione di Jalapeño. Su alcuni blocchi selezionati di attention e Mixture of Experts relativi a GPT-OSS, le implementazioni generate ed ottimizzate dall'AI sono risultate da 1,5 a 1,8 volte più veloci rispetto alle implementazioni esistenti scritte da esperti umani.

Attenzione ancora una volta, non significa che l'intero GPT-OSS sia diventato 1,8 volte più veloce grazie al codice scritto dalla AI, il dato riguarda KERNEL E BLOCCHI SELEZIONATI. Ma il significato industriale rimane enorme: hardware e software possono adesso co-evolvere dentro un loop molto più rapido nel quale gli ingegneri cambiano il chip, i modelli cercano nuove implementazioni, i benchmark misurano il risultato ed il ciclo riparte.

Se questo processo funziona davvero su larga scala, la conseguenza non è soltanto che OpenAI ha costruito un acceleratore. È che ha iniziato a comprimere il ciclo di sviluppo del silicio usando il prodotto che quel silicio dovrà poi eseguire. Il primo Jalapeño è passato dal design iniziale al tapeout in circa nove mesi, una velocità che OpenAI e Broadcom descrivono come eccezionalmente alta per un ASIC ad alte prestazioni, mentre Gen 2 è già in sviluppo avanzato e Gen 3 sta prendendo forma.

Una architettura spaziale che piace anche alle macchine

Jalapeño usa un modello di programmazione spaziale. In termini semplificati significa che il software descrive con maggiore esplicitazione DOVE vivono i dati e DOVE viene eseguito il lavoro, invece di affidare tutto ad una gigantesca memoria globale astratta dietro alla quale l'hardware deve continuamente indovinare e spostare informazioni.

Ogni slice associa il calcolo ad una porzione di HBM ed utilizza percorsi locali molto veloci, mentre per le comunicazioni fra core esistono meccanismi collettivi specializzati. Questa struttura riduce una delle tasse più odiose dei sistemi moderni, cioè muovere dati lontano dal punto nel quale devono essere elaborati.

Per un programmatore umano gestire manualmente mapping, placement e scheduling di una macchina enorme può diventare un incubo, ma OpenAI fa un ragionamento curioso: se l'ottimizzazione più difficile può essere affidata ad un modello capace di cercare fra moltissime soluzioni, allora posso progettare l'architettura perché sia TRATTABILE DA UNA AI e non soltanto comoda da programmare a mano. È una inversione interessante, perché per decenni abbiamo progettato linguaggi ed hardware per adattarli alla mente del programmatore, mentre qui stiamo cominciando a progettare una macchina sapendo che uno dei programmatori principali sarà un'altra macchina.

Il chip da solo non basta: 128 ASIC locali e 2.048 in un pod

Quando si parla di acceleratori AI il singolo package rischia di diventare quasi una unità troppo piccola per capire il prodotto. OpenAI ha descritto un dominio locale da 128 Jalapeño ed un dominio globale che arriva a 2.048 ASIC, usando una topologia di rete costruita anche attorno a switch Broadcom Tomahawk6. A 128 chip il sistema arriva ad una quantità enorme di memoria HBM e calcolo, mentre a 2.048 ASIC OpenAI parla di 27 EFLOP/s MXFP4 e 432 TiB complessivi di HBM.

Numeri del genere spiegano perché Broadcom sia un partner così strategico. Non basta realizzare una ALU veloce, devo collegare migliaia di package facendo in modo che tensor parallelism, expert parallelism e traffico MoE non trasformino la rete nel collo di bottiglia. Il progetto prevede infatti livelli differenti di banda fra dominio locale e dominio globale, adattando la rete al tipo di comunicazione più frequente.

Ed è proprio qui che l'espressione chip proprietario diventa quasi riduttiva. Jalapeño è più correttamente una PIATTAFORMA DI INFERENZA, perché chip, HBM, rete, rack, software e runtime sono stati pensati insieme. Il vantaggio non arriva necessariamente da un singolo blocco miracoloso ma dal togliere piccole inefficienze ad ogni livello finché la macchina reale si avvicina molto di più alle prestazioni che sulla carta il silicio potrebbe già fornire.

OpenAI è diventata una azienda hardware? In un senso importante sì

Non diventa Intel, TSMC oppure Broadcom e non è quello il punto. Ma dopo Jalapeño è difficile continuare a descrivere OpenAI come una società che produce modelli e poi compra la potenza di calcolo necessaria sul mercato. La sua strategia è ormai FULL STACK: prodotto, modello, serving software, runtime, chip, memoria, networking e sistema vengono trattati come parti dello stesso problema.

Questo non significa nemmeno che OpenAI stia abbandonando NVIDIA. Richard Ho lo ha detto esplicitamente: il fabbisogno di calcolo è così grande che l'azienda continuerà a distribuire largamente acceleratori NVIDIA e di altri partner per training ed inference. Jalapeño non nasce necessariamente per sostituire ogni GPU, nasce per aggiungere una capacità proprietaria molto ottimizzata proprio dove OpenAI spende una parte crescente del proprio denaro, cioè servire modelli ed agenti.

Da questo punto di vista NVIDIA non scompare affatto, ma perde una cosa che per anni è stata quasi assoluta: essere il luogo nel quale praticamente tutti devono adattare il proprio workload. Quando OpenAI, Google, Amazon ed altri hyperscaler disegnano acceleratori propri, il software e l'hardware smettono di essere due mercati completamente separati ed iniziano ad avvicinarsi fino quasi a fondersi.

La vera guerra non è più soltanto chi ha più FLOPS

Jalapeño mette molto bene in evidenza una cosa che vale per tutta l'AI moderna: il picco teorico racconta sempre meno. Posso costruire un chip con una quantità spettacolare di FLOPS e perdere gran parte del vantaggio aspettando la memoria, sincronizzando core, spostando KV Cache oppure attraversando una rete congestionata.

OpenAI ha infatti scelto come metriche principali due cose molto meno glamour: quanta energia serve per completare lavoro utile e quanto tempo passa prima che l'utente oppure l'agente riceva il risultato. Tokens per joule e time to last token raccontano molto più direttamente l'economia di un servizio reale rispetto al numero massimo di operazioni che un package può eseguire in laboratorio.

È qui che la progettazione verticale diventa potente. Se conosco esattamente quali bottleneck vedo ogni giorno nei miei datacenter non devo necessariamente costruire il chip più veloce IN ASSOLUTO, devo costruire quello che spreca meno tempo ed energia sul mio carico reale.

Ed il 700 W è forse persino il dato meno interessante

Quando ho letto 700 W contro 1.400 W la prima reazione è stata inevitabilmente quella, ma andando a vedere la presentazione mi sono reso conto che il risultato più importante è altrove. Jalapeño non sembra vincere perché OpenAI abbia semplicemente dimezzato la frequenza oppure costruito un chip più piccolo, ma perché l'architettura cerca di ridurre data movement, mantenere locale lo stato, bilanciare compute e memoria ed usare percorsi di rete specializzati per le operazioni più frequenti.

In altre parole l'efficienza energetica non è una caratteristica separata dalle prestazioni, è una conseguenza della stessa scelta architetturale. Ogni volta che un dato attraversa centimetri di package, memoria oppure rete consumo energia, ogni volta che un core aspetta pago potenza senza produrre token ed ogni volta che devo replicare lo stesso stato su sistemi diversi sto spendendo banda che avrei potuto usare per calcolare.

L'AI moderna sta diventando abbastanza grande da rendere il MOVIMENTO DEI DATI quasi importante quanto il calcolo, ed è per questo che memoria e networking compaiono nella progettazione di Jalapeño con la stessa dignità delle unità matematiche.

Il confronto con NVIDIA va letto con prudenza

I risultati pubblicati arrivano da OpenAI e non da un laboratorio indipendente, usano il benchmark pubblico InferenceX e confrontano Jalapeño con configurazioni commerciali leader disponibili in quel momento. Sono dati tecnicamente molto interessanti, ma restano benchmark del produttore del nuovo chip e vanno quindi letti come tali.

C'è poi una questione temporale. Jalapeño inizierà ad essere distribuito in quantità limitate entro la fine del 2026 ed il ramp più importante arriverà successivamente, mentre NVIDIA non è ferma ad aspettare. Quando una nuova architettura entra realmente in produzione, il confronto industriale va fatto contro ciò che esiste IN QUEL MOMENTO, non contro ciò che era disponibile quando il tapeout è stato deciso.

Quindi non scriverei affatto che OpenAI abbia sconfitto NVIDIA. Scriverei una cosa più interessante: OpenAI ha dimostrato di essere capace di costruire un acceleratore first-party che, sui benchmark scelti e misurati pubblicamente, entra già alla prima generazione nella frontiera prestazioni-latenza-efficienza dei migliori sistemi disponibili.

Per un primo chip è un risultato enorme.

La parte davvero dirompente è il ciclo chiuso

Alla fine il dettaglio che secondo me racconta il futuro meglio di tutti non è 700 W, non sono i 15,4 TB/s di HBM e nemmeno il 104,3x che farà inevitabilmente i titoli. È il loop:

AI CHE AIUTA A PROGETTARE IL CHIP → CHIP PROGETTATO PER ESEGUIRE AI → AI CHE PROGRAMMA ED OTTIMIZZA QUEL CHIP → DATI REALI DEL CHIP CHE GUIDANO LA GENERAZIONE SUCCESSIVA.

Questo ciclo può comprimere enormemente i tempi fra una generazione e quella dopo. Il modello non è più soltanto il workload passivo che l'ingegnere deve eseguire, diventa anche uno degli strumenti con i quali l'ingegnere esplora l'architettura, ottimizza i circuiti e produce il software che rende il nuovo hardware utilizzabile.

Ed allora l'idea del software da una parte e del silicio dall'altra comincia davvero a sembrare vecchia. OpenAI può cambiare il comportamento dei propri modelli sapendo come verrà costruita Gen 2, può progettare Gen 2 sapendo quali pattern mostreranno i modelli futuri e può utilizzare i modelli attuali per accelerare la realizzazione del chip che li sostituirà.

Il programmatore entra dentro il progetto del silicio

Per chi sviluppa software questa cosa è secondo me particolarmente affascinante. Quando l'AI deve soltanto generare testo, una GPU estremamente potente può già fare miracoli, ma quando gli agenti devono lavorare come veri operatori software il parametro che interessa diventa il TEMPO COMPLESSIVO DEL LAVORO. Un agente Codex che impiega un secondo anziché quattro per ogni passaggio può completare una catena di cento iterazioni in tempi radicalmente diversi, anche se il numero totale di token prodotti non cambia di molto.

La latenza diventa quindi una caratteristica del prodotto software. Il compilatore, il runtime, il kernel, la memoria, il fabric di rete ed il package finiscono tutti dentro il tempo che passa fra quando l'agente legge un errore e quando prova la correzione successiva.

È quasi buffo pensarci: siamo abituati a discutere di qualità del prompting e di capacità del modello, mentre sotto la scrivania virtuale dell'agente c'è un problema molto più fisico, cioè quanti nanosecondi perde ogni volta che un dato deve attraversare memoria oppure rete. Jalapeño nasce precisamente dal fatto che OpenAI può vedere questo problema su una scala che un normale produttore di software non vedrà mai.

Non compreremo una scheda Jalapeño per il nostro PC

Almeno per adesso non è quello il progetto. OpenAI deve assorbire internamente quantità enormi di compute e non ha annunciato Jalapeño come prodotto retail, workstation oppure acceleratore PCIe destinato al mercato comune. Le prime installazioni devono entrare nell'infrastruttura OpenAI entro la fine del 2026, poi la piattaforma crescerà nelle generazioni successive.

Ed è importante anche questo perché evita un altro equivoco: non stiamo assistendo alla nascita di un nuovo concorrente di GeForce oppure di una scheda che un programmatore comprerà per fare inference locale. Stiamo guardando un COMPONENTE DI DATACENTER progettato per lavorare in migliaia di esemplari dentro infrastrutture nelle quali il costo di energia, rete e latenza viene moltiplicato per milioni di richieste.

La scala è talmente diversa che perfino il modo di misurare il successo cambia. Non mi interessa soltanto quanto costa il singolo package, mi interessa quanti token utili riesco a servire per kilowatt, quante richieste interattive posso completare dentro un certo SLA e quanto capitale devo immobilizzare per ottenere un dato livello di servizio.

Broadcom diventa il partner che rende il progetto reale

C'è infine un pezzo che non va oscurato dal logo OpenAI. Progettare un ASIC avanzato non significa soltanto scegliere una architettura elegante, significa arrivare al tapeout, chiudere timing e power, costruire package, interfacce HBM, SerDes, networking, schede, rack e supply chain. Broadcom porta proprio questa esperienza industriale, ed è il motivo per cui definire Jalapeño semplicemente "chip OpenAI" è corretto come identità del prodotto ma incompleto come descrizione del lavoro.

OpenAI possiede il workload e la visione dell'architettura, Broadcom possiede una competenza enorme nella realizzazione del silicio e nelle reti ad altissima velocità, Celestica porta l'integrazione fisica del sistema. È una divisione del lavoro che permette ad una azienda nata nel software di entrare nel silicio senza dover reinventare da zero tutta l'industria dei semiconduttori.

Ed è probabilmente così che vedremo nascere sempre più chip AI proprietari: non ogni azienda costruirà una fabbrica, ma chi possiede abbastanza workload potrà disegnare il comportamento della macchina e poi affidarsi ad un ecosistema di partner per trasformarlo in silicio reale.

E quindi cosa cambia davvero con Jalapeño

Secondo me cambia soprattutto la direzione del rapporto fra modello e macchina. Per anni abbiamo preso modelli sempre più grandi e li abbiamo fatti entrare dentro l'hardware disponibile, ottimizzando software e kernel per sfruttare ciò che il mercato offriva. Jalapeño mostra l'altra direzione: partire dai workload reali, osservare dove vengono sprecati watt e millisecondi ed infine DISEGNARE IL CHIP ATTORNO AL MODELLO.

Ed una volta fatto questo il confine continua a spostarsi, perché l'AI stessa entra nel ciclo di progettazione del chip e nella generazione del software che lo programma. Non è più soltanto hardware per AI, è hardware costruito con AI e destinato ad essere programmato anche da AI.

Per questo la notizia secondo me vale molto più del confronto con NVIDIA. Il punto non è stabilire se Jalapeño sia oggi il chip più veloce del mondo, perché quella classifica cambierà continuamente, il punto è che OpenAI ha messo il primo mattone di una piattaforma multi-generazione nella quale il software che crea valore, il modello che ragiona, il compilatore che lo mappa, la rete che collega migliaia di acceleratori ed il silicio che esegue tutto vengono progettati come UN SOLO SISTEMA.

E quando chi costruisce l'intelligenza comincia anche a costruire la macchina fisica sulla quale quella intelligenza gira, il vecchio confine fra azienda software ed azienda hardware smette semplicemente di essere molto utile.

Benchmark di Jalapeño sul throughput per kilowatt a parità di velocità di decoding
Benchmark di Jalapeño sul throughput per kilowatt a parità di velocità di decoding
1 visita

Fonti

  1. OpenAI - OpenAI and Broadcom unveil LLM-optimized inference chip openai.com
  2. OpenAI - Jalapeño’s first results show industry-leading speed and efficiency in AI inference openai.com
  3. Broadcom - OpenAI and Broadcom Unveil LLM-Optimized Intelligence Processor investors.broadcom.com
  4. ServeTheHome - OpenAI Jalapeño Custom AI ASIC at Hot Chips 2026 www.servethehome.com
  5. Data Center Dynamics - OpenAI details Jalapeño AI chip, with 700W TDP www.datacenterdynamics.com
  6. TechCrunch - OpenAI’s Jalapeño chip is built for fast inference at scale techcrunch.com
  7. The Verge - OpenAI says its Jalapeño chip can power faster AI responses than the competition www.theverge.com
  8. Tom's Hardware - benchmark e caratteristiche tecniche di Jalapeño www.tomshardware.com
  9. OpenAI Forum - Richard Ho on OpenAI Jalapeño Chip's Early Performance forum.openai.com

Commenti

Nessun commento, per ora.

Per commentare serve un accesso. Qui siamo tutti tecnici e colleghi!

Accedi per commentare

Scarica