Reklaam
Fullscreen Image

OpenAI:n ensimmäinen oma siru päihittää NVIDIAn nopeudessa ja energiatehokkuudessa

Tekijä auto.pub | Julkaistu: 27.08.2026

OpenAI on julkaissut ensimmäiset yksityiskohtaiset suorituskykyluvut Jalapeñosta, sen ensimmäisestä erityisesti tekoälyinferenssiin suunnitellusta sirusta. Yhtiön omissa testeissä kolmella suurella kielimallilla siru saavutti 1,5–1,9 kertaa suuremman huippuläpäisyn tehoyksikköä kohden ja 1,7–3,6 kertaa pienemmän päästä päähän -kyselyviiveen kuin vertailussa käytetyt NVIDIA GB200- ja GB300-järjestelmät. Tämä ei tarkoita, että NVIDIA olisi syrjäytetty, mutta se osoittaa, miksi suurimmat tekoälyyhtiöt haluavat yhä enemmän suunnitella omaa laitteistoaan.

Reklaam

Jalapeño ei kilpaile koulutussirujen kanssa

Tämä on OpenAI:n ensimmäinen oma inferenssisiru, eli se on optimoitu ensisijaisesti jo koulutettujen mallien suorittamiseen eikä uusien suurten mallien kouluttamiseen alusta alkaen. Yhtiö jatkaa NVIDIAn ja muiden kumppaneiden kiihdyttimien käyttöä sekä koulutuksessa että inferenssissä.

OpenAI käytti julkista InferenceX-vertailutestiä ja testasi kolmea mallia: GPT-OSS 120B:tä, DeepSeek R1 670B:tä ja Kimi K2.5 1T:tä. Vertailujärjestelminä käytettiin NVIDIAn GB200:aa ja GB300:aa.

GPT-OSS 120B:llä Jalapeño saavutti 85 448 syöte- ja tulostetokenin huippuläpäisyn sekunnissa kilowattia kohden, kun GB200:n vastaava luku oli 44 960. Tämä antaa Jalapeñolle noin 1,9-kertaisen edun. Päästä päähän -kyselyviive oli vastaavasti 1,03 sekuntia verrattuna 1,80 sekuntiin.

DeepSeek R1 tuotti vielä suuremman viive-eron. Jalapeño suoritti kyselyn 1,65 sekunnissa, kun taas GB300 tarvitsi 5,99 sekuntia. Huippuläpäisy tehoyksikköä kohden oli Jalapeñolla 19 641 syöte- ja tulostetokenia sekunnissa kilowattia kohden ja GB300:lla 11 781. Kimi K2.5:llä OpenAI mittasi Jalapeñolle noin 1,5 kertaa suuremman huippuläpäisyn tehoyksikköä kohden ja 3,4 kertaa pienemmän kokonaisviiveen.

Nämä ovat OpenAI:n omia mittauksia, eivät riippumattoman laboratorion tuloksia. Energiatehokkuuslukuja on myös tarkasteltava menetelmän yhteydessä. OpenAI normalisoi tulokset käyttäen kiihdyttimien julkaistua nimellistehoa sen sijaan, että se olisi mitannut jokaisen kilpailevan järjestelmän todellisen tehonkulutuksen identtisissä olosuhteissa.

700 W:n siru kulutti testeissä enintään 550 W

Jalapeñon nimellisteho on 700 W. OpenAI:n mukaan todellinen tehonkulutus pysyi testatuissa työkuormissa 550 W:ssa tai sen alapuolella. Laskelmissaan yhtiö käytti NVIDIAn julkaisemaa 1 200 W:n nimellistehoa GB200:lle ja 1 400 W:n nimellistehoa GB300:lle.

Tehoyksikköä kohden tuotetun työn merkitys kasvaa suurissa tekoälydatakeskuksissa. Sähkökapasiteetti, jäähdytys ja verkkoliitännät voivat rajoittaa palvelinpuistojen kasvua yhtä paljon kuin sirujen saatavuus. Jos jokaisesta kilowatista voidaan palvella enemmän kyselyjä, infrastruktuurikustannus tuotettua tokenia tai käyttäjäpyyntöä kohden pienenee.

Jalapeñon arkkitehtuuri on suunniteltu kielimalliinferenssin eri vaiheiden ympärille. Alkuperäinen syötteen käsittely eli prefill on ensisijaisesti laskentaintensiivistä. Vastauksen token kerrallaan tuottaminen eli decode riippuu enemmän muistiväylän kaistanleveydestä. Aikaa kuluu myös datan ja mallitilan siirtämiseen sirujen ja laskentayksiköiden välillä.

OpenAI suunnitteli prosessorin, muistin, verkkoyhteydet ja ohjelmiston yhtenä integroituna järjestelmänä tarpeettoman datansiirron vähentämiseksi. Arkkitehtuuri mahdollistaa muun muassa sen, että vastauksen generoinnissa käytettävä KV-välimuisti pysyy mahdollisimman paikallisena.

Tekoäly auttoi suunnittelemaan itse sirun

Tekoälyllä oli suora rooli Jalapeñon kehityksessä. OpenAI:n mukaan tiimi eteni alkuperäisestä suunnittelusta tape-out-vaiheeseen yhdeksässä kuukaudessa. Tekoälyä käytettiin toteutusvaihtoehtojen tutkimiseen, aritmeettisten lohkojen optimointiin sekä varmennus- ja mittaussyklien nopeuttamiseen.

Tiimi käytti myöhemmin Codexia yhdessä GPT-Astran kanssa optimoidakseen sirun kolmelle avoimilla painoilla varustetulle mallille, jotka eivät kuuluneet alkuperäiseen tuotantosuunnitelmaan. Työ kesti kaksi kuukautta. Valituissa GPT-OSS:n attention- ja mixture-of-experts-lohkoissa tekoälyn tuottamat toteutukset toimivat 1,5–1,8 kertaa nopeammin kuin aiemmat asiantuntijoiden kirjoittamat versiot.

On kuitenkin tärkeä varaus: tämä suorituskykyparannus koskee valittuja laskentalohkoja, ei GPT-OSS-mallia kokonaisuudessaan.

NVIDIAn ongelma ei ole vielä Jalapeño, vaan sen taustalla oleva trendi

Yksi erikoistunut siru ei mullista tekoälylaitteistomarkkinoita yhdessä yössä. NVIDIAn etu ei perustu ainoastaan GB200:n tai GB300:n raakaa laskentasuorituskykyyn, vaan myös CUDA-ohjelmistoekosysteemiin, verkkoyhteyksiin, palvelinarkkitehtuuriin ja kykyyn käyttää samaa alustaa laajalla mallien ja työkuormien kirjolla.

Jalapeñon merkitys on muualla. OpenAI tietää tarkalleen, millaisia työkuormia sen omat palvelut tuottavat, ja voi optimoida laitteiston niiden ympärille. Google, Amazon ja muut suuret pilviyhtiöt ovat noudattaneet samaa logiikkaa jo vuosien ajan. OpenAI:n tulo markkinoille omalla sirullaan lisää painetta tehdä tekoälylaskennasta halvempaa ja energiatehokkaampaa.

OpenAI aikoo ottaa Jalapeñon käyttöön omassa laskentainfrastruktuurissaan vuoden 2026 loppuun mennessä. Toisen sukupolven siru on jo pitkällä kehityksessä, kun taas kolmannen sukupolven arkkitehtuuri alkaa muotoutua.

Energiatehokkuus on erityisen tärkeää Euroopalle. Tekoälydatakeskusten kasvu merkitsee suoraa kilpailua sähkökapasiteetista ja verkkoliitännöistä. Jos erikoistuneet inferenssisirut voivat todella tuottaa merkittävästi enemmän hyödyllistä työtä kilowattia kohden, niiden taloudellinen vaikutus voi osoittautua tärkeämmäksi kuin yksikään yksittäinen vertailutestivoitto NVIDIAn yli.

Jalapeño ei kilpaile koulutussirujen kanssa

Tämä on OpenAI:n ensimmäinen oma inferenssisiru, eli se on optimoitu ensisijaisesti jo koulutettujen mallien suorittamiseen eikä uusien suurten mallien kouluttamiseen alusta alkaen. Yhtiö jatkaa NVIDIAn ja muiden kumppaneiden kiihdyttimien käyttöä sekä koulutuksessa että inferenssissä.

OpenAI käytti julkista InferenceX-vertailutestiä ja testasi kolmea mallia: GPT-OSS 120B:tä, DeepSeek R1 670B:tä ja Kimi K2.5 1T:tä. Vertailujärjestelminä käytettiin NVIDIAn GB200:aa ja GB300:aa.

GPT-OSS 120B:llä Jalapeño saavutti 85 448 syöte- ja tulostetokenin huippuläpäisyn sekunnissa kilowattia kohden, kun GB200:n vastaava luku oli 44 960. Tämä antaa Jalapeñolle noin 1,9-kertaisen edun. Päästä päähän -kyselyviive oli vastaavasti 1,03 sekuntia verrattuna 1,80 sekuntiin.

DeepSeek R1 tuotti vielä suuremman viive-eron. Jalapeño suoritti kyselyn 1,65 sekunnissa, kun taas GB300 tarvitsi 5,99 sekuntia. Huippuläpäisy tehoyksikköä kohden oli Jalapeñolla 19 641 syöte- ja tulostetokenia sekunnissa kilowattia kohden ja GB300:lla 11 781. Kimi K2.5:llä OpenAI mittasi Jalapeñolle noin 1,5 kertaa suuremman huippuläpäisyn tehoyksikköä kohden ja 3,4 kertaa pienemmän kokonaisviiveen.

Nämä ovat OpenAI:n omia mittauksia, eivät riippumattoman laboratorion tuloksia. Energiatehokkuuslukuja on myös tarkasteltava menetelmän yhteydessä. OpenAI normalisoi tulokset käyttäen kiihdyttimien julkaistua nimellistehoa sen sijaan, että se olisi mitannut jokaisen kilpailevan järjestelmän todellisen tehonkulutuksen identtisissä olosuhteissa.

700 W:n siru kulutti testeissä enintään 550 W

Jalapeñon nimellisteho on 700 W. OpenAI:n mukaan todellinen tehonkulutus pysyi testatuissa työkuormissa 550 W:ssa tai sen alapuolella. Laskelmissaan yhtiö käytti NVIDIAn julkaisemaa 1 200 W:n nimellistehoa GB200:lle ja 1 400 W:n nimellistehoa GB300:lle.

Tehoyksikköä kohden tuotetun työn merkitys kasvaa suurissa tekoälydatakeskuksissa. Sähkökapasiteetti, jäähdytys ja verkkoliitännät voivat rajoittaa palvelinpuistojen kasvua yhtä paljon kuin sirujen saatavuus. Jos jokaisesta kilowatista voidaan palvella enemmän kyselyjä, infrastruktuurikustannus tuotettua tokenia tai käyttäjäpyyntöä kohden pienenee.

Jalapeñon arkkitehtuuri on suunniteltu kielimalliinferenssin eri vaiheiden ympärille. Alkuperäinen syötteen käsittely eli prefill on ensisijaisesti laskentaintensiivistä. Vastauksen token kerrallaan tuottaminen eli decode riippuu enemmän muistiväylän kaistanleveydestä. Aikaa kuluu myös datan ja mallitilan siirtämiseen sirujen ja laskentayksiköiden välillä.

OpenAI suunnitteli prosessorin, muistin, verkkoyhteydet ja ohjelmiston yhtenä integroituna järjestelmänä tarpeettoman datansiirron vähentämiseksi. Arkkitehtuuri mahdollistaa muun muassa sen, että vastauksen generoinnissa käytettävä KV-välimuisti pysyy mahdollisimman paikallisena.

Tekoäly auttoi suunnittelemaan itse sirun

Tekoälyllä oli suora rooli Jalapeñon kehityksessä. OpenAI:n mukaan tiimi eteni alkuperäisestä suunnittelusta tape-out-vaiheeseen yhdeksässä kuukaudessa. Tekoälyä käytettiin toteutusvaihtoehtojen tutkimiseen, aritmeettisten lohkojen optimointiin sekä varmennus- ja mittaussyklien nopeuttamiseen.

Tiimi käytti myöhemmin Codexia yhdessä GPT-Astran kanssa optimoidakseen sirun kolmelle avoimilla painoilla varustetulle mallille, jotka eivät kuuluneet alkuperäiseen tuotantosuunnitelmaan. Työ kesti kaksi kuukautta. Valituissa GPT-OSS:n attention- ja mixture-of-experts-lohkoissa tekoälyn tuottamat toteutukset toimivat 1,5–1,8 kertaa nopeammin kuin aiemmat asiantuntijoiden kirjoittamat versiot.

On kuitenkin tärkeä varaus: tämä suorituskykyparannus koskee valittuja laskentalohkoja, ei GPT-OSS-mallia kokonaisuudessaan.

NVIDIAn ongelma ei ole vielä Jalapeño, vaan sen taustalla oleva trendi

Yksi erikoistunut siru ei mullista tekoälylaitteistomarkkinoita yhdessä yössä. NVIDIAn etu ei perustu ainoastaan GB200:n tai GB300:n raakaa laskentasuorituskykyyn, vaan myös CUDA-ohjelmistoekosysteemiin, verkkoyhteyksiin, palvelinarkkitehtuuriin ja kykyyn käyttää samaa alustaa laajalla mallien ja työkuormien kirjolla.

Jalapeñon merkitys on muualla. OpenAI tietää tarkalleen, millaisia työkuormia sen omat palvelut tuottavat, ja voi optimoida laitteiston niiden ympärille. Google, Amazon ja muut suuret pilviyhtiöt ovat noudattaneet samaa logiikkaa jo vuosien ajan. OpenAI:n tulo markkinoille omalla sirullaan lisää painetta tehdä tekoälylaskennasta halvempaa ja energiatehokkaampaa.

OpenAI aikoo ottaa Jalapeñon käyttöön omassa laskentainfrastruktuurissaan vuoden 2026 loppuun mennessä. Toisen sukupolven siru on jo pitkällä kehityksessä, kun taas kolmannen sukupolven arkkitehtuuri alkaa muotoutua.

Energiatehokkuus on erityisen tärkeää Euroopalle. Tekoälydatakeskusten kasvu merkitsee suoraa kilpailua sähkökapasiteetista ja verkkoliitännöistä. Jos erikoistuneet inferenssisirut voivat todella tuottaa merkittävästi enemmän hyödyllistä työtä kilowattia kohden, niiden taloudellinen vaikutus voi osoittautua tärkeämmäksi kuin yksikään yksittäinen vertailutestivoitto NVIDIAn yli.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/fi/footer.php on line 6