Torna al blogTecnologia

OpenAI Jalapeño: il chip che sfida Nvidia in efficienza di inferenza

OpenAI pubblica i benchmark del Jalapeño: il chip proprietario offre fino a 1,9x più lavoro per watt e una latenza 3,6x inferiore rispetto al Blackwell di Nvidia.

Pubblicato il01 settembre 20267 min di letturaFabian Martinelli
Condividi
OpenAI Jalapeño: il chip che sfida Nvidia in efficienza di inferenza

Il giorno in cui OpenAI è entrata nel business del silicio

Il 25 agosto 2026, OpenAI ha pubblicato sul proprio blog ufficiale i primi risultati di benchmark del Jalapeño, il suo chip di inferenza sviluppato in partnership con Broadcom (NASDAQ: AVGO). Il giorno successivo, 26 agosto, i numeri sono stati presentati all'Hot Chips, la conferenza che si tiene all'Università di Stanford — un palcoscenico storicamente riservato ai grandi produttori di semiconduttori. Il messaggio era inequivocabile: OpenAI non è più soltanto un'azienda di modelli. Ora compete a livello di silicio.

Questo cambia le regole del gioco. Non perché il Jalapeño renda Nvidia obsoleta — non è così, almeno non ancora. Ma perché dimostra, per la prima volta con numeri verificabili, che un hyperscaler è in grado di progettare hardware di inferenza competitivo con il leader assoluto del mercato. Per chi gestisce attività che dipendono da API di IA, ciò ha un impatto diretto sull'equazione del costo per token.

Che cos'è il Jalapeño e come è stato costruito

Il Jalapeño è il primo chip custom di OpenAI, progettato esclusivamente per l'inferenza di LLM — ovvero per eseguire modelli già addestrati, non per addestrarli. La distinzione è importante: l'addestramento rimane territorio di Nvidia, con i suoi cluster di GPU Blackwell. Il Jalapeño punta all'altro lato dell'operazione: la consegna di risposte in tempo reale a utenti e agenti.

Il progetto è iniziato a metà del 2024. La partnership con Broadcom è stata annunciata nell'ottobre 2025 e il programma del chip è stato formalmente presentato nel giugno 2026, descritto dalla stessa OpenAI come costruito "da zero per gli LLM attuali e futuri dell'intero settore." Dall'assunzione iniziale del team fino al tape-out di fabbricazione, il processo ha richiesto circa 16 mesi — un ritmo notevolmente aggressivo per il settore dei semiconduttori. OpenAI stessa ha utilizzato i propri modelli per supportare lo sviluppo del chip.

Un dettaglio tecnico che merita attenzione: i benchmark pubblicati sono stati effettuati con lo stepping A0 del silicio — un campione ingegneristico. La versione attualmente in produzione è lo stepping B0, che offre circa il 25% in più di performance per watt rispetto all'A0 testato. I numeri divulgati sono già, in pratica, conservativi rispetto a ciò che sarà disponibile in produzione.

Le specifiche che definiscono il posizionamento

Il Jalapeño B0, in un singolo die delle dimensioni di un reticle, offre 13,4 PFLOP di calcolo in MXFP4, prodotto con il processo TSMC N3P per il die di calcolo e TSMC N3E per il chiplet di I/O. Il TDP nominale è di 700 watt, ma i workload testati hanno mantenuto un consumo medio pari o inferiore a 550 watt.

La scelta della memoria è strategica: il chip utilizza HBM4, con 216 gigabyte per acceleratore e una larghezza di banda di 15,4 TB/s per pacchetto — che, secondo l'analisi di SemiAnalysis, supera tutti gli acceleratori che attualmente impiegano HBM3E. OpenAI è tra i primi adottanti di HBM4 sul mercato, insieme a Nvidia e AMD, e in anticipo sui programmi TPU e Trainium.

In scala rack con 128 chip, il sistema offre 1,7 exaflop di calcolo a 4 bit e 27,5 terabyte di memoria HBM4. Il pod completo supporta fino a 2.048 ASIC in un dominio di scale-up globale multi-rack.

I benchmark: cosa dicono i numeri — e cosa non dicono

La metodologia utilizzata è il SemiAnalysis InferenceX, un benchmark pubblico che misura il ciclo completo di gestione di una richiesta di IA end-to-end. Gli analisti di SemiAnalysis erano fisicamente presenti nei laboratori di OpenAI per osservare le misurazioni — il che conferisce credibilità direzionale ai risultati, sebbene i numeri siano auto-riportati da OpenAI.

I tre modelli testati, con i rispettivi sistemi di confronto Nvidia:

  • GPT-OSS 120B (vs. Nvidia GB200): throughput per kW ~1,9x maggiore; latenza ridotta da 1,80 s a 1,03 s — miglioramento di 1,7x. Il modello ha raggiunto circa 1.400 token al secondo per utente.
  • DeepSeek R1 670B (vs. Nvidia GB300): throughput per kW ~1,7x maggiore; latenza scesa da 5,99 s a 1,65 s — miglioramento di 3,6x. Il chip ha superato 700 token al secondo per utente con concorrenza 1.
  • Kimi K2.5 1T (vs. Nvidia GB300): throughput per watt ~1,5x maggiore; latenza da 5,31 s a 1,56 s — miglioramento di 3,4x.

Per workload altamente interattivi — il profilo di ChatGPT e degli agenti di IA — il vantaggio è stato ancora maggiore: da 2,1x a 4,1x di guadagno in performance.

La riserva che non può essere ignorata

La stessa SemiAnalysis ha segnalato che il confronto è parzialmente incompleto e non del tutto equo: il Jalapeño utilizza HBM4, mentre i sistemi GB200 e GB300 di Nvidia operano con HBM3E — memoria di generazione precedente. Il confronto più equilibrato sarebbe con la piattaforma Nvidia Vera Rubin, non ancora ampiamente disponibile. Il Rubin ha un TDP di 900 W a 1.150 W per die e offre 17,5 PFLOP in NVFP4 denso — contro i 13,4 PFLOP del Jalapeño B0 in MXFP4. In termini di costo per token, un'analisi di financefeeds.com indica una equivalenza "praticamente identica" tra i due, con il Jalapeño ancora "leggermente superiore" in performance per megawatt — ma con la precisazione che il Rubin incorpora già ottimizzazioni di speculative decoding che il Jalapeño non ha ancora. (La fonte originale di questo specifico passaggio presenta alcune imprecisioni parziali; il dato va letto con cautela.)

Adrien Sanchez, analista tecnologico del Yole Group, è stato diretto intervistato da CNBC: "Un chip progettato da un hyperscaler può ora eguagliare o superare le GPU Blackwell di Nvidia in efficienza di inferenza."

Cosa cambia in pratica — e quando

Prima di qualsiasi entusiasmo operativo: il Jalapeño non è disponibile commercialmente. Al 1° settembre 2026, OpenAI dispone soltanto di campioni ingegneristici. Il deployment interno in volumi ridotti è previsto per la fine del 2026, come dichiarato da Richard Ho, head of hardware di OpenAI, che ha descritto esplicitamente "volumi molto piccoli" per quel periodo. Il ramp di produzione piena avverrà gradualmente nel corso del 2027, con la maggior parte della capacità prevista per la fine di quell'anno.

Quanto al futuro della piattaforma: Richard Ho ha confermato che la seconda generazione del chip è "in fase avanzata di sviluppo". In modo indipendente, OpenAI e BigGo Finance hanno riferito che una terza generazione è già in corso. OpenAI descrive il Jalapeño come una piattaforma multigenerazionale — chip, modelli e memoria sviluppati congiuntamente —, il che rende chiaro che si tratta di un investimento a lungo termine, non di un progetto isolato.

Perché questo è rilevante per chi prende decisioni di business

Siamo di fronte a un'inflessione strutturale: i grandi lab di IA stanno verticalizzando fino allo strato del silicio. Questo comprime lo spazio di differenziazione dei fornitori tradizionali di hardware e crea una pressione reale su margini e road map dei player consolidati. Per le PMI che adottano l'IA, il segnale pratico è che il costo di inferenza continuerà a scendere, e i modelli più capaci tenderanno a diventare progressivamente più accessibili man mano che la struttura dei costi operativi dei grandi lab migliorerà.

La questione strategica non è se utilizzerete l'IA nelle vostre operazioni. È se sarete posizionati per cogliere la prossima ondata di riduzione dei costi — o se arriverete tardi, come è già successo con la precedente.