Reklaam
Fullscreen Image

OpenAIs første egenutviklede brikke overgår NVIDIA på hastighet og energieffektivitet

Forfatter auto.pub | Publisert: 27.08.2026

OpenAI har publisert de første detaljerte ytelsestallene for Jalapeño, selskapets første brikke utviklet spesifikt for KI-inferens. I selskapets egne tester på tvers av tre store språkmodeller leverte brikken 1,5–1,9 ganger høyere maksimal gjennomstrømming per effektenhet og 1,7–3,6 ganger lavere ende-til-ende-forsinkelse for spørringer enn NVIDIA GB200- og GB300-systemene som ble brukt til sammenligning. Det betyr ikke at NVIDIA er avsatt fra tronen, men det viser hvorfor de største KI-selskapene i stadig større grad ønsker å utvikle mer av egen maskinvare.

Reklaam

Jalapeño konkurrerer ikke med treningsbrikker

Dette er OpenAIs første egenutviklede inferensbrikke, noe som betyr at den først og fremst er optimalisert for å kjøre modeller som allerede er trent, fremfor å trene nye store modeller fra bunnen av. Selskapet vil fortsatt bruke akseleratorer fra NVIDIA og andre partnere til både trening og inferens.

OpenAI brukte den offentlige InferenceX-referansetesten og testet tre modeller: GPT-OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. NVIDIAs GB200 og GB300 ble brukt som sammenligningssystemer.

Med GPT-OSS 120B oppnådde Jalapeño en maksimal gjennomstrømming på 85 448 input- og output-tokener per sekund per kilowatt, sammenlignet med 44 960 for GB200. Det gir Jalapeño en fordel på omtrent 1,9 ganger. Ende-til-ende-forsinkelsen for spørringer var henholdsvis 1,03 sekunder mot 1,80 sekunder.

DeepSeek R1 ga et enda større forsinkelsesgap. Jalapeño fullførte spørringen på 1,65 sekunder, mens GB300 krevde 5,99 sekunder. Maksimal gjennomstrømming per effektenhet nådde 19 641 input- og output-tokener per sekund per kilowatt på Jalapeño og 11 781 på GB300. Med Kimi K2.5 målte OpenAI omtrent 1,5 ganger høyere maksimal gjennomstrømming per effektenhet og 3,4 ganger lavere total forsinkelse for Jalapeño.

Dette er OpenAIs egne målinger, ikke resultater fra et uavhengig laboratorium. Energieffektivitetstallene må også leses i lys av metodikken. OpenAI normaliserte resultatene ved hjelp av akseleratorenes publiserte nominelle effekt, fremfor å måle det faktiske strømforbruket til hvert konkurrerende system under identiske forhold.

Brikken på 700 W trakk ikke mer enn 550 W i testene

Jalapeño har en nominell effekt på 700 W. Ifølge OpenAI holdt det faktiske strømforbruket seg på 550 W eller lavere i de testede arbeidsbelastningene. I beregningene brukte selskapet NVIDIAs publiserte nominelle effekt på 1 200 W for GB200 og 1 400 W for GB300.

Arbeid levert per effektenhet blir stadig viktigere i store KI-datasentre. Elektrisk kapasitet, kjøling og nettilknytninger kan begrense veksten i serverparker like mye som tilgjengeligheten av brikker. Hvis flere spørringer kan håndteres fra hver kilowatt, faller infrastrukturkostnaden per genererte token eller brukerforespørsel.

Jalapeños arkitektur er utformet rundt de ulike fasene i inferens for språkmodeller. Innledende inputbehandling, eller prefill, er i hovedsak beregningsintensiv. Å generere svaret token for token, eller decode, er mer avhengig av minnebåndbredde. Tid brukes også på å flytte data og modelltilstand mellom brikker og beregningsenheter.

OpenAI utformet prosessoren, minnet, nettverket og programvaren som ett integrert system for å redusere unødvendig dataflytting. Arkitekturen gjør blant annet at KV-cachen som brukes under responsgenerering, kan forbli så lokal som mulig.

KI bidro til å utvikle selve brikken

KI spilte en direkte rolle i utviklingen av Jalapeño. Ifølge OpenAI gikk teamet fra den første utformingen til tape-out på ni måneder. KI ble brukt til å utforske implementeringsalternativer, optimalisere aritmetiske blokker og fremskynde verifikasjons- og målesykluser.

Teamet brukte senere Codex sammen med GPT-Astra for å optimalisere brikken for tre modeller med åpne vekter som ikke var en del av den opprinnelige produksjonsplanen. Arbeidet tok to måneder. I utvalgte GPT-OSS-blokker for oppmerksomhet og mixture-of-experts kjørte KI-genererte implementeringer 1,5–1,8 ganger raskere enn de tidligere versjonene skrevet av eksperter.

Det finnes et viktig forbehold: Denne ytelsesgevinsten gjelder utvalgte beregningsblokker, ikke GPT-OSS-modellen som helhet.

NVIDIAs problem er ikke Jalapeño ennå, men trenden bak den

Én enkelt spesialisert brikke vil ikke omforme markedet for KI-maskinvare over natten. NVIDIAs fordel ligger ikke bare i den rå beregningsytelsen til GB200 eller GB300, men også i CUDA-programvareøkosystemet, nettverk, serverarkitektur og muligheten til å bruke den samme plattformen på tvers av et bredt spekter av modeller og arbeidsbelastninger.

Betydningen av Jalapeño ligger et annet sted. OpenAI vet nøyaktig hvilke arbeidsbelastninger selskapets egne tjenester genererer, og kan optimalisere maskinvaren rundt dem. Google, Amazon og andre store skyselskaper har fulgt den samme logikken i årevis. At OpenAI går inn i markedet med sin egen brikke, øker presset ytterligere for å gjøre KI-beregning billigere og mer energieffektiv.

OpenAI planlegger å ta Jalapeño i bruk i sin egen beregningsinfrastruktur innen utgangen av 2026. En andre generasjons brikke er allerede langt inne i utviklingen, mens arkitekturen til en tredje generasjon tar form.

Energieffektivitet er særlig viktig for Europa. Veksten i KI-datasentre betyr direkte konkurranse om elektrisk kapasitet og nettilknytninger. Hvis spesialiserte inferensbrikker faktisk kan levere vesentlig mer nyttig arbeid per kilowatt, kan deres økonomiske betydning vise seg å være viktigere enn enhver enkelt seier i en referansetest over NVIDIA.

Jalapeño konkurrerer ikke med treningsbrikker

Dette er OpenAIs første egenutviklede inferensbrikke, noe som betyr at den først og fremst er optimalisert for å kjøre modeller som allerede er trent, fremfor å trene nye store modeller fra bunnen av. Selskapet vil fortsatt bruke akseleratorer fra NVIDIA og andre partnere til både trening og inferens.

OpenAI brukte den offentlige InferenceX-referansetesten og testet tre modeller: GPT-OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. NVIDIAs GB200 og GB300 ble brukt som sammenligningssystemer.

Med GPT-OSS 120B oppnådde Jalapeño en maksimal gjennomstrømming på 85 448 input- og output-tokener per sekund per kilowatt, sammenlignet med 44 960 for GB200. Det gir Jalapeño en fordel på omtrent 1,9 ganger. Ende-til-ende-forsinkelsen for spørringer var henholdsvis 1,03 sekunder mot 1,80 sekunder.

DeepSeek R1 ga et enda større forsinkelsesgap. Jalapeño fullførte spørringen på 1,65 sekunder, mens GB300 krevde 5,99 sekunder. Maksimal gjennomstrømming per effektenhet nådde 19 641 input- og output-tokener per sekund per kilowatt på Jalapeño og 11 781 på GB300. Med Kimi K2.5 målte OpenAI omtrent 1,5 ganger høyere maksimal gjennomstrømming per effektenhet og 3,4 ganger lavere total forsinkelse for Jalapeño.

Dette er OpenAIs egne målinger, ikke resultater fra et uavhengig laboratorium. Energieffektivitetstallene må også leses i lys av metodikken. OpenAI normaliserte resultatene ved hjelp av akseleratorenes publiserte nominelle effekt, fremfor å måle det faktiske strømforbruket til hvert konkurrerende system under identiske forhold.

Brikken på 700 W trakk ikke mer enn 550 W i testene

Jalapeño har en nominell effekt på 700 W. Ifølge OpenAI holdt det faktiske strømforbruket seg på 550 W eller lavere i de testede arbeidsbelastningene. I beregningene brukte selskapet NVIDIAs publiserte nominelle effekt på 1 200 W for GB200 og 1 400 W for GB300.

Arbeid levert per effektenhet blir stadig viktigere i store KI-datasentre. Elektrisk kapasitet, kjøling og nettilknytninger kan begrense veksten i serverparker like mye som tilgjengeligheten av brikker. Hvis flere spørringer kan håndteres fra hver kilowatt, faller infrastrukturkostnaden per genererte token eller brukerforespørsel.

Jalapeños arkitektur er utformet rundt de ulike fasene i inferens for språkmodeller. Innledende inputbehandling, eller prefill, er i hovedsak beregningsintensiv. Å generere svaret token for token, eller decode, er mer avhengig av minnebåndbredde. Tid brukes også på å flytte data og modelltilstand mellom brikker og beregningsenheter.

OpenAI utformet prosessoren, minnet, nettverket og programvaren som ett integrert system for å redusere unødvendig dataflytting. Arkitekturen gjør blant annet at KV-cachen som brukes under responsgenerering, kan forbli så lokal som mulig.

KI bidro til å utvikle selve brikken

KI spilte en direkte rolle i utviklingen av Jalapeño. Ifølge OpenAI gikk teamet fra den første utformingen til tape-out på ni måneder. KI ble brukt til å utforske implementeringsalternativer, optimalisere aritmetiske blokker og fremskynde verifikasjons- og målesykluser.

Teamet brukte senere Codex sammen med GPT-Astra for å optimalisere brikken for tre modeller med åpne vekter som ikke var en del av den opprinnelige produksjonsplanen. Arbeidet tok to måneder. I utvalgte GPT-OSS-blokker for oppmerksomhet og mixture-of-experts kjørte KI-genererte implementeringer 1,5–1,8 ganger raskere enn de tidligere versjonene skrevet av eksperter.

Det finnes et viktig forbehold: Denne ytelsesgevinsten gjelder utvalgte beregningsblokker, ikke GPT-OSS-modellen som helhet.

NVIDIAs problem er ikke Jalapeño ennå, men trenden bak den

Én enkelt spesialisert brikke vil ikke omforme markedet for KI-maskinvare over natten. NVIDIAs fordel ligger ikke bare i den rå beregningsytelsen til GB200 eller GB300, men også i CUDA-programvareøkosystemet, nettverk, serverarkitektur og muligheten til å bruke den samme plattformen på tvers av et bredt spekter av modeller og arbeidsbelastninger.

Betydningen av Jalapeño ligger et annet sted. OpenAI vet nøyaktig hvilke arbeidsbelastninger selskapets egne tjenester genererer, og kan optimalisere maskinvaren rundt dem. Google, Amazon og andre store skyselskaper har fulgt den samme logikken i årevis. At OpenAI går inn i markedet med sin egen brikke, øker presset ytterligere for å gjøre KI-beregning billigere og mer energieffektiv.

OpenAI planlegger å ta Jalapeño i bruk i sin egen beregningsinfrastruktur innen utgangen av 2026. En andre generasjons brikke er allerede langt inne i utviklingen, mens arkitekturen til en tredje generasjon tar form.

Energieffektivitet er særlig viktig for Europa. Veksten i KI-datasentre betyr direkte konkurranse om elektrisk kapasitet og nettilknytninger. Hvis spesialiserte inferensbrikker faktisk kan levere vesentlig mer nyttig arbeid per kilowatt, kan deres økonomiske betydning vise seg å være viktigere enn enhver enkelt seier i en referansetest over NVIDIA.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/no/footer.php on line 6