OpenAI:s första egenutvecklade chip överträffar NVIDIA i hastighet och energieffektivitet
OpenAI har publicerat de första detaljerade prestandasiffrorna för Jalapeño, företagets första chip som utformats specifikt för AI-inferens. I företagets egna tester med tre stora språkmodeller levererade chipet 1,5–1,9 gånger högre toppgenomströmning per effektenhet och 1,7–3,6 gånger lägre total fördröjning per fråga än NVIDIA GB200- och GB300-systemen som användes för jämförelse. Det innebär inte att NVIDIA har avsatts från tronen, men det visar varför de största AI-företagen i allt högre grad vill konstruera mer av sin egen hårdvara.
Jalapeño konkurrerar inte med träningschip
Detta är OpenAI:s första egenutvecklade inferenschip, vilket innebär att det främst har optimerats för att köra modeller som redan har tränats, snarare än för att träna nya stora modeller från grunden. Företaget kommer fortsatt att använda acceleratorer från NVIDIA och andra partner för både träning och inferens.
OpenAI använde det offentliga InferenceX-riktmärket och testade tre modeller: GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T. NVIDIA:s GB200 och GB300 användes som jämförelsesystem.
Med GPT-OSS 120B nådde Jalapeño en toppgenomströmning på 85 448 in- och utmatningstoken per sekund och kilowatt, jämfört med 44 960 för GB200. Det ger Jalapeño en fördel på ungefär 1,9 gånger. Den totala fördröjningen per fråga var 1,03 sekunder jämfört med 1,80 sekunder.
DeepSeek R1 gav upphov till ett ännu större skillnad i fördröjning. Jalapeño slutförde frågan på 1,65 sekunder, medan GB300 behövde 5,99 sekunder. Toppgenomströmningen per effektenhet nådde 19 641 in- och utmatningstoken per sekund och kilowatt på Jalapeño och 11 781 på GB300. Med Kimi K2.5 uppmätte OpenAI ungefär 1,5 gånger högre toppgenomströmning per effektenhet och 3,4 gånger lägre total fördröjning för Jalapeño.
Detta är OpenAI:s egna mätningar, inte resultat från ett oberoende laboratorium. Siffrorna för energieffektivitet måste också läsas i metodikens sammanhang. OpenAI normaliserade resultaten med acceleratorernas publicerade märkeffekt, i stället för att mäta den faktiska strömförbrukningen hos varje konkurrerande system under identiska förhållanden.
Chipet på 700 W drog högst 550 W i tester
Jalapeño har en märkeffekt på 700 W. Enligt OpenAI låg den faktiska strömförbrukningen på 550 W eller lägre i de testade arbetsbelastningarna. För sina beräkningar använde företaget NVIDIA:s publicerade märkeffekt på 1 200 W för GB200 och 1 400 W för GB300.
Arbete som utförs per effektenhet blir allt viktigare i stora AI-datacenter. Elektrisk kapacitet, kylning och nätanslutningar kan begränsa tillväxten i serverparker lika mycket som tillgången på chip. Om fler frågor kan hanteras från varje kilowatt sjunker infrastrukturkostnaden per genererad token eller användarförfrågan.
Jalapeños arkitektur är utformad kring de olika faserna i inferens för språkmodeller. Den inledande bearbetningen av indata, eller prefill, är främst beräkningsintensiv. Att generera svaret token för token, eller decode, är mer beroende av minnesbandbredd. Tid går också åt till att flytta data och modellstatus mellan chip och beräkningsenheter.
OpenAI utformade processorn, minnet, nätverket och mjukvaran som ett enda integrerat system för att minska onödig dataförflyttning. Arkitekturen gör bland annat att KV-cachen som används under svarsgenomförandet kan hållas så lokal som möjligt.
AI hjälpte till att utforma själva chipet
AI spelade en direkt roll i utvecklingen av Jalapeño. Enligt OpenAI gick teamet från den initiala designen till tape-out på nio månader. AI användes för att utforska implementeringsalternativ, optimera aritmetiska block och påskynda verifierings- och mätcykler.
Teamet använde senare Codex tillsammans med GPT-Astra för att optimera chipet för tre modeller med öppna vikter som inte ingick i den ursprungliga produktionsplanen. Arbetet tog två månader. I utvalda GPT-OSS-block för attention och mixture-of-experts kördes AI-genererade implementationer 1,5–1,8 gånger snabbare än de tidigare versionerna skrivna av experter.
Det finns en viktig reservation: prestandavinsten gäller utvalda beräkningsblock, inte GPT-OSS-modellen som helhet.
NVIDIA:s problem är ännu inte Jalapeño, utan trenden bakom det
Ett enda specialiserat chip kommer inte att omforma marknaden för AI-hårdvara över en natt. NVIDIA:s fördel ligger inte bara i den råa beräkningsprestandan hos GB200 eller GB300, utan även i mjukvaruekosystemet CUDA, nätverk, serverarkitektur och möjligheten att använda samma plattform för ett brett urval av modeller och arbetsbelastningar.
Jalapeños betydelse ligger någon annanstans. OpenAI vet exakt vilka arbetsbelastningar dess egna tjänster genererar och kan optimera hårdvaran utifrån dem. Google, Amazon och andra stora molnföretag har följt samma logik i åratal. OpenAI:s inträde på marknaden med ett eget chip ökar pressen ytterligare på att göra AI-beräkningar billigare och mer energieffektiva.
OpenAI planerar att driftsätta Jalapeño i sin egen beräkningsinfrastruktur före slutet av 2026. Ett chip av andra generationen är redan långt in i utvecklingen, medan arkitekturen för en tredje generation tar form.
Energieffektivitet är särskilt viktigt för Europa. Tillväxten av AI-datacenter innebär direkt konkurrens om elektrisk kapacitet och nätanslutningar. Om specialiserade inferenschip verkligen kan leverera avsevärt mer nyttigt arbete per kilowatt kan deras ekonomiska påverkan visa sig vara viktigare än någon enskild riktmärkesvinst över NVIDIA.
Jalapeño konkurrerar inte med träningschip
Detta är OpenAI:s första egenutvecklade inferenschip, vilket innebär att det främst har optimerats för att köra modeller som redan har tränats, snarare än för att träna nya stora modeller från grunden. Företaget kommer fortsatt att använda acceleratorer från NVIDIA och andra partner för både träning och inferens.
OpenAI använde det offentliga InferenceX-riktmärket och testade tre modeller: GPT-OSS 120B, DeepSeek R1 670B och Kimi K2.5 1T. NVIDIA:s GB200 och GB300 användes som jämförelsesystem.
Med GPT-OSS 120B nådde Jalapeño en toppgenomströmning på 85 448 in- och utmatningstoken per sekund och kilowatt, jämfört med 44 960 för GB200. Det ger Jalapeño en fördel på ungefär 1,9 gånger. Den totala fördröjningen per fråga var 1,03 sekunder jämfört med 1,80 sekunder.
DeepSeek R1 gav upphov till ett ännu större skillnad i fördröjning. Jalapeño slutförde frågan på 1,65 sekunder, medan GB300 behövde 5,99 sekunder. Toppgenomströmningen per effektenhet nådde 19 641 in- och utmatningstoken per sekund och kilowatt på Jalapeño och 11 781 på GB300. Med Kimi K2.5 uppmätte OpenAI ungefär 1,5 gånger högre toppgenomströmning per effektenhet och 3,4 gånger lägre total fördröjning för Jalapeño.
Detta är OpenAI:s egna mätningar, inte resultat från ett oberoende laboratorium. Siffrorna för energieffektivitet måste också läsas i metodikens sammanhang. OpenAI normaliserade resultaten med acceleratorernas publicerade märkeffekt, i stället för att mäta den faktiska strömförbrukningen hos varje konkurrerande system under identiska förhållanden.
Chipet på 700 W drog högst 550 W i tester
Jalapeño har en märkeffekt på 700 W. Enligt OpenAI låg den faktiska strömförbrukningen på 550 W eller lägre i de testade arbetsbelastningarna. För sina beräkningar använde företaget NVIDIA:s publicerade märkeffekt på 1 200 W för GB200 och 1 400 W för GB300.
Arbete som utförs per effektenhet blir allt viktigare i stora AI-datacenter. Elektrisk kapacitet, kylning och nätanslutningar kan begränsa tillväxten i serverparker lika mycket som tillgången på chip. Om fler frågor kan hanteras från varje kilowatt sjunker infrastrukturkostnaden per genererad token eller användarförfrågan.
Jalapeños arkitektur är utformad kring de olika faserna i inferens för språkmodeller. Den inledande bearbetningen av indata, eller prefill, är främst beräkningsintensiv. Att generera svaret token för token, eller decode, är mer beroende av minnesbandbredd. Tid går också åt till att flytta data och modellstatus mellan chip och beräkningsenheter.
OpenAI utformade processorn, minnet, nätverket och mjukvaran som ett enda integrerat system för att minska onödig dataförflyttning. Arkitekturen gör bland annat att KV-cachen som används under svarsgenomförandet kan hållas så lokal som möjligt.
AI hjälpte till att utforma själva chipet
AI spelade en direkt roll i utvecklingen av Jalapeño. Enligt OpenAI gick teamet från den initiala designen till tape-out på nio månader. AI användes för att utforska implementeringsalternativ, optimera aritmetiska block och påskynda verifierings- och mätcykler.
Teamet använde senare Codex tillsammans med GPT-Astra för att optimera chipet för tre modeller med öppna vikter som inte ingick i den ursprungliga produktionsplanen. Arbetet tog två månader. I utvalda GPT-OSS-block för attention och mixture-of-experts kördes AI-genererade implementationer 1,5–1,8 gånger snabbare än de tidigare versionerna skrivna av experter.
Det finns en viktig reservation: prestandavinsten gäller utvalda beräkningsblock, inte GPT-OSS-modellen som helhet.
NVIDIA:s problem är ännu inte Jalapeño, utan trenden bakom det
Ett enda specialiserat chip kommer inte att omforma marknaden för AI-hårdvara över en natt. NVIDIA:s fördel ligger inte bara i den råa beräkningsprestandan hos GB200 eller GB300, utan även i mjukvaruekosystemet CUDA, nätverk, serverarkitektur och möjligheten att använda samma plattform för ett brett urval av modeller och arbetsbelastningar.
Jalapeños betydelse ligger någon annanstans. OpenAI vet exakt vilka arbetsbelastningar dess egna tjänster genererar och kan optimera hårdvaran utifrån dem. Google, Amazon och andra stora molnföretag har följt samma logik i åratal. OpenAI:s inträde på marknaden med ett eget chip ökar pressen ytterligare på att göra AI-beräkningar billigare och mer energieffektiva.
OpenAI planerar att driftsätta Jalapeño i sin egen beräkningsinfrastruktur före slutet av 2026. Ett chip av andra generationen är redan långt in i utvecklingen, medan arkitekturen för en tredje generation tar form.
Energieffektivitet är särskilt viktigt för Europa. Tillväxten av AI-datacenter innebär direkt konkurrens om elektrisk kapacitet och nätanslutningar. Om specialiserade inferenschip verkligen kan leverera avsevärt mer nyttigt arbete per kilowatt kan deras ekonomiska påverkan visa sig vara viktigare än någon enskild riktmärkesvinst över NVIDIA.