OpenAI-jev prvi lastni čip po hitrosti in energijski učinkovitosti prekaša NVIDIA
OpenAI je objavil prve podrobne podatke o zmogljivosti Jalapeña, svojega prvega čipa, zasnovanega posebej za izvajanje AI-inference. V lastnih testih podjetja s tremi velikimi jezikovnimi modeli je čip dosegel 1,5–1,9-krat večjo največjo prepustnost na enoto moči in 1,7–3,6-krat nižjo celovito zakasnitev poizvedb kot primerjana sistema NVIDIA GB200 in GB300. To ne pomeni, da je NVIDIA izgubila prestol, vendar kaže, zakaj največja podjetja na področju AI vse bolj želijo sama zasnovati več lastne strojne opreme.
Jalapeño ne tekmuje s čipi za učenje
To je prvi OpenAI-jev lastni čip za inference, kar pomeni, da je optimiziran predvsem za izvajanje že naučenih modelov in ne za učenje novih velikih modelov od začetka. Podjetje bo za učenje in inference še naprej uporabljalo pospeševalnike podjetja NVIDIA in drugih partnerjev.
OpenAI je uporabil javno merilo InferenceX in preizkusil tri modele: GPT-OSS 120B, DeepSeek R1 670B in Kimi K2.5 1T. Kot primerjalna sistema sta bila uporabljena NVIDIA GB200 in GB300.
Pri GPT-OSS 120B je Jalapeño dosegel največjo prepustnost 85.448 vhodnih in izhodnih žetonov na sekundo na kilovat v primerjavi s 44.960 pri GB200. To Jalapeñu daje približno 1,9-kratno prednost. Celovita zakasnitev poizvedbe je znašala 1,03 sekunde v primerjavi z 1,80 sekunde.
DeepSeek R1 je ustvaril še večjo razliko v zakasnitvi. Jalapeño je poizvedbo zaključil v 1,65 sekunde, medtem ko je GB300 potreboval 5,99 sekunde. Največja prepustnost na enoto moči je dosegla 19.641 vhodnih in izhodnih žetonov na sekundo na kilovat pri Jalapeñu in 11.781 pri GB300. Pri Kimi K2.5 je OpenAI izmeril približno 1,5-krat večjo največjo prepustnost na enoto moči in 3,4-krat nižjo skupno zakasnitev za Jalapeño.
To so meritve samega OpenAI-ja, ne rezultati neodvisnega laboratorija. Številke o energijski učinkovitosti je treba brati tudi v kontekstu metodologije. OpenAI je rezultate normaliziral z uporabo objavljene nazivne moči pospeševalnikov, namesto da bi meril dejansko porabo energije vsakega konkurenčnega sistema v enakih pogojih.
Čip z nazivno močjo 700 W je med testiranjem porabil največ 550 W
Jalapeño ima nazivno moč 700 W. Po navedbah OpenAI-ja je dejanska poraba energije pri testiranih obremenitvah ostala pri 550 W ali manj. Podjetje je za izračune uporabilo NVIDIA-jevo objavljeno nazivno moč 1.200 W za GB200 in 1.400 W za GB300.
Delo, opravljeno na enoto moči, postaja v velikih podatkovnih centrih za AI vse pomembnejše. Električna zmogljivost, hlajenje in priključki na omrežje lahko rast strežniških farm omejujejo prav toliko kot razpoložljivost čipov. Če je mogoče z vsakega kilovata obdelati več poizvedb, se strošek infrastrukture na ustvarjeni žeton ali uporabniško zahtevo zniža.
Arhitektura Jalapeña je zasnovana okoli različnih faz inference jezikovnih modelov. Začetna obdelava vnosa oziroma prefill je predvsem računsko intenzivna. Generiranje odgovora žeton za žetonom oziroma decode je bolj odvisno od pasovne širine pomnilnika. Čas se porablja tudi za prenos podatkov in stanja modela med čipi in računskimi enotami.
OpenAI je procesor, pomnilnik, omrežje in programsko opremo zasnoval kot en sam integriran sistem, da bi zmanjšal nepotrebno premikanje podatkov. Med drugim arhitektura omogoča, da predpomnilnik KV, uporabljen med ustvarjanjem odgovora, ostane čim bolj lokalen.
AI je pomagala zasnovati sam čip
AI je imela neposredno vlogo pri razvoju Jalapeña. Po navedbah OpenAI-ja je ekipa od začetne zasnove do tape-outa prešla v devetih mesecih. AI so uporabili za raziskovanje možnosti izvedbe, optimizacijo aritmetičnih blokov ter pospeševanje ciklov preverjanja in merjenja.
Ekipa je pozneje uporabila Codex skupaj z GPT-Astra za optimizacijo čipa za tri modele z odprtimi utežmi, ki niso bili del prvotnega proizvodnega načrta. Delo je trajalo dva meseca. V izbranih blokih pozornosti in mixture-of-experts modela GPT-OSS so implementacije, ki jih je ustvarila AI, delovale 1,5–1,8-krat hitreje kot prejšnje različice, ki so jih napisali strokovnjaki.
Obstaja pomemben pridržek: to povečanje zmogljivosti velja za izbrane računske bloke, ne za model GPT-OSS kot celoto.
Težava NVIDIA še ni Jalapeño, temveč trend, ki stoji za njim
En sam specializiran čip trga strojne opreme za AI ne bo preoblikoval čez noč. Prednost NVIDIA ni le v surovi računski zmogljivosti GB200 ali GB300, temveč tudi v programskem ekosistemu CUDA, omrežju, strežniški arhitekturi in zmožnosti uporabe iste platforme pri širokem naboru modelov in delovnih obremenitev.
Pomen Jalapeña je drugje. OpenAI natančno ve, kakšne delovne obremenitve ustvarjajo njegove lastne storitve, in lahko strojno opremo optimizira zanje. Google, Amazon in druga velika podjetja za storitve v oblaku že leta sledijo isti logiki. Vstop OpenAI-ja na trg z lastnim čipom ustvarja dodaten pritisk, da bi računalniško moč za AI naredili cenejšo in energijsko učinkovitejšo.
OpenAI namerava Jalapeño v lastno računalniško infrastrukturo namestiti do konca leta 2026. Čip druge generacije je že globoko v razvoju, medtem ko se arhitektura tretje generacije že oblikuje.
Energijska učinkovitost je še posebej pomembna za Evropo. Rast podatkovnih centrov za AI pomeni neposredno konkurenco za električno zmogljivost in priključke na omrežje. Če lahko specializirani čipi za inference resnično zagotovijo bistveno več koristnega dela na kilovat, bi se njihov gospodarski vpliv lahko izkazal za pomembnejšega od katere koli posamezne zmage nad NVIDIA v merilih uspešnosti.
Jalapeño ne tekmuje s čipi za učenje
To je prvi OpenAI-jev lastni čip za inference, kar pomeni, da je optimiziran predvsem za izvajanje že naučenih modelov in ne za učenje novih velikih modelov od začetka. Podjetje bo za učenje in inference še naprej uporabljalo pospeševalnike podjetja NVIDIA in drugih partnerjev.
OpenAI je uporabil javno merilo InferenceX in preizkusil tri modele: GPT-OSS 120B, DeepSeek R1 670B in Kimi K2.5 1T. Kot primerjalna sistema sta bila uporabljena NVIDIA GB200 in GB300.
Pri GPT-OSS 120B je Jalapeño dosegel največjo prepustnost 85.448 vhodnih in izhodnih žetonov na sekundo na kilovat v primerjavi s 44.960 pri GB200. To Jalapeñu daje približno 1,9-kratno prednost. Celovita zakasnitev poizvedbe je znašala 1,03 sekunde v primerjavi z 1,80 sekunde.
DeepSeek R1 je ustvaril še večjo razliko v zakasnitvi. Jalapeño je poizvedbo zaključil v 1,65 sekunde, medtem ko je GB300 potreboval 5,99 sekunde. Največja prepustnost na enoto moči je dosegla 19.641 vhodnih in izhodnih žetonov na sekundo na kilovat pri Jalapeñu in 11.781 pri GB300. Pri Kimi K2.5 je OpenAI izmeril približno 1,5-krat večjo največjo prepustnost na enoto moči in 3,4-krat nižjo skupno zakasnitev za Jalapeño.
To so meritve samega OpenAI-ja, ne rezultati neodvisnega laboratorija. Številke o energijski učinkovitosti je treba brati tudi v kontekstu metodologije. OpenAI je rezultate normaliziral z uporabo objavljene nazivne moči pospeševalnikov, namesto da bi meril dejansko porabo energije vsakega konkurenčnega sistema v enakih pogojih.
Čip z nazivno močjo 700 W je med testiranjem porabil največ 550 W
Jalapeño ima nazivno moč 700 W. Po navedbah OpenAI-ja je dejanska poraba energije pri testiranih obremenitvah ostala pri 550 W ali manj. Podjetje je za izračune uporabilo NVIDIA-jevo objavljeno nazivno moč 1.200 W za GB200 in 1.400 W za GB300.
Delo, opravljeno na enoto moči, postaja v velikih podatkovnih centrih za AI vse pomembnejše. Električna zmogljivost, hlajenje in priključki na omrežje lahko rast strežniških farm omejujejo prav toliko kot razpoložljivost čipov. Če je mogoče z vsakega kilovata obdelati več poizvedb, se strošek infrastrukture na ustvarjeni žeton ali uporabniško zahtevo zniža.
Arhitektura Jalapeña je zasnovana okoli različnih faz inference jezikovnih modelov. Začetna obdelava vnosa oziroma prefill je predvsem računsko intenzivna. Generiranje odgovora žeton za žetonom oziroma decode je bolj odvisno od pasovne širine pomnilnika. Čas se porablja tudi za prenos podatkov in stanja modela med čipi in računskimi enotami.
OpenAI je procesor, pomnilnik, omrežje in programsko opremo zasnoval kot en sam integriran sistem, da bi zmanjšal nepotrebno premikanje podatkov. Med drugim arhitektura omogoča, da predpomnilnik KV, uporabljen med ustvarjanjem odgovora, ostane čim bolj lokalen.
AI je pomagala zasnovati sam čip
AI je imela neposredno vlogo pri razvoju Jalapeña. Po navedbah OpenAI-ja je ekipa od začetne zasnove do tape-outa prešla v devetih mesecih. AI so uporabili za raziskovanje možnosti izvedbe, optimizacijo aritmetičnih blokov ter pospeševanje ciklov preverjanja in merjenja.
Ekipa je pozneje uporabila Codex skupaj z GPT-Astra za optimizacijo čipa za tri modele z odprtimi utežmi, ki niso bili del prvotnega proizvodnega načrta. Delo je trajalo dva meseca. V izbranih blokih pozornosti in mixture-of-experts modela GPT-OSS so implementacije, ki jih je ustvarila AI, delovale 1,5–1,8-krat hitreje kot prejšnje različice, ki so jih napisali strokovnjaki.
Obstaja pomemben pridržek: to povečanje zmogljivosti velja za izbrane računske bloke, ne za model GPT-OSS kot celoto.
Težava NVIDIA še ni Jalapeño, temveč trend, ki stoji za njim
En sam specializiran čip trga strojne opreme za AI ne bo preoblikoval čez noč. Prednost NVIDIA ni le v surovi računski zmogljivosti GB200 ali GB300, temveč tudi v programskem ekosistemu CUDA, omrežju, strežniški arhitekturi in zmožnosti uporabe iste platforme pri širokem naboru modelov in delovnih obremenitev.
Pomen Jalapeña je drugje. OpenAI natančno ve, kakšne delovne obremenitve ustvarjajo njegove lastne storitve, in lahko strojno opremo optimizira zanje. Google, Amazon in druga velika podjetja za storitve v oblaku že leta sledijo isti logiki. Vstop OpenAI-ja na trg z lastnim čipom ustvarja dodaten pritisk, da bi računalniško moč za AI naredili cenejšo in energijsko učinkovitejšo.
OpenAI namerava Jalapeño v lastno računalniško infrastrukturo namestiti do konca leta 2026. Čip druge generacije je že globoko v razvoju, medtem ko se arhitektura tretje generacije že oblikuje.
Energijska učinkovitost je še posebej pomembna za Evropo. Rast podatkovnih centrov za AI pomeni neposredno konkurenco za električno zmogljivost in priključke na omrežje. Če lahko specializirani čipi za inference resnično zagotovijo bistveno več koristnega dela na kilovat, bi se njihov gospodarski vpliv lahko izkazal za pomembnejšega od katere koli posamezne zmage nad NVIDIA v merilih uspešnosti.