Reklaam
Fullscreen Image

Prvý vlastný čip OpenAI prekonáva NVIDIA v rýchlosti a energetickej efektívnosti

Autor auto.pub | Publikované: 27.08.2026

OpenAI zverejnila prvé podrobné údaje o výkone Jalapeño, svojho prvého čipu navrhnutého špeciálne pre AI inferenciu. Vo vlastných testoch spoločnosti naprieč tromi veľkými jazykovými modelmi čip dosiahol 1,5- až 1,9-násobne vyššiu špičkovú priepustnosť na jednotku výkonu a 1,7- až 3,6-násobne nižšiu koncovú latenciu dopytov než porovnávacie systémy NVIDIA GB200 a GB300. Neznamená to, že NVIDIA bola zosadená z trónu, no ukazuje to, prečo najväčšie AI spoločnosti čoraz viac chcú navrhovať vlastný hardvér.

Reklaam

Jalapeño nekonkuruje čipom na trénovanie

Ide o prvý vlastný inferenčný čip OpenAI, čo znamená, že bol optimalizovaný predovšetkým na prevádzku už natrénovaných modelov, nie na trénovanie nových veľkých modelov od základu. Spoločnosť bude na trénovanie aj inferenciu naďalej používať akcelerátory od NVIDIA a ďalších partnerov.

OpenAI použila verejný benchmark InferenceX a testovala tri modely: GPT-OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. Ako porovnávacie systémy boli použité NVIDIA GB200 a GB300.

S GPT-OSS 120B dosiahlo Jalapeño špičkovú priepustnosť 85 448 vstupných a výstupných tokenov za sekundu na kilowatt v porovnaní so 44 960 pri GB200. Jalapeño tak získava približne 1,9-násobnú výhodu. Koncová latencia dopytu bola 1,03 sekundy oproti 1,80 sekundy.

DeepSeek R1 vykázal ešte väčší rozdiel v latencii. Jalapeño dokončilo dopyt za 1,65 sekundy, zatiaľ čo GB300 potreboval 5,99 sekundy. Špičková priepustnosť na jednotku výkonu dosiahla 19 641 vstupných a výstupných tokenov za sekundu na kilowatt pri Jalapeño a 11 781 pri GB300. Pri Kimi K2.5 namerala OpenAI pre Jalapeño približne 1,5-násobne vyššiu špičkovú priepustnosť na jednotku výkonu a 3,4-násobne nižšiu celkovú latenciu.

Ide o vlastné merania OpenAI, nie o výsledky nezávislého laboratória. Údaje o energetickej efektívnosti treba tiež čítať v kontexte metodiky. OpenAI výsledky normalizovala pomocou zverejneného menovitého výkonu akcelerátorov, namiesto merania skutočnej spotreby energie každého konkurenčného systému za rovnakých podmienok.

Čip s výkonom 700 W v testovaní neodoberal viac než 550 W

Jalapeño má menovitý výkon 700 W. Podľa OpenAI zostala skutočná spotreba energie pri testovaných pracovných záťažiach na úrovni 550 W alebo nižšej. Spoločnosť pri svojich výpočtoch použila NVIDIA zverejnený menovitý výkon 1 200 W pre GB200 a 1 400 W pre GB300.

Práca vykonaná na jednotku výkonu je vo veľkých AI dátových centrách čoraz dôležitejšia. Elektrická kapacita, chladenie a pripojenia k sieti môžu rast serverových fariem obmedzovať rovnako ako dostupnosť čipov. Ak možno z každého kilowattu obslúžiť viac dopytov, náklady na infraštruktúru na jeden vygenerovaný token alebo používateľskú požiadavku klesajú.

Architektúra Jalapeño je navrhnutá okolo rôznych fáz inferencie jazykových modelov. Počiatočné spracovanie vstupu, teda prefill, je najmä výpočtovo náročné. Generovanie odpovede token po tokene, teda decode, závisí viac od priepustnosti pamäte. Čas sa spotrebúva aj presunom dát a stavu modelu medzi čipmi a výpočtovými jednotkami.

OpenAI navrhla procesor, pamäť, sieťovanie a softvér ako jeden integrovaný systém, aby znížila zbytočné presuny dát. Architektúra okrem iného umožňuje, aby KV cache používaná počas generovania odpovede zostala čo najviac lokálna.

Pri návrhu samotného čipu pomáhala AI

AI zohrala priamu úlohu pri vývoji Jalapeño. Podľa OpenAI tím prešiel od počiatočného návrhu po tape-out za deväť mesiacov. AI sa použila na skúmanie možností implementácie, optimalizáciu aritmetických blokov a zrýchlenie cyklov overovania a merania.

Tím neskôr použil Codex spolu s GPT-Astra na optimalizáciu čipu pre tri modely s otvorenými váhami, ktoré neboli súčasťou pôvodného produkčného plánu. Práca trvala dva mesiace. Vo vybraných blokoch pozornosti a mixture-of-experts modelu GPT-OSS bežali implementácie vytvorené AI 1,5- až 1,8-násobne rýchlejšie než skoršie verzie napísané odborníkmi.

Existuje dôležitá výhrada: tento nárast výkonu sa týka vybraných výpočtových blokov, nie modelu GPT-OSS ako celku.

Problémom NVIDIA zatiaľ nie je Jalapeño, ale trend, ktorý stojí za ním

Jeden špecializovaný čip trh s AI hardvérom cez noc nezmení. Výhoda NVIDIA nespočíva iba v surovom výpočtovom výkone GB200 či GB300, ale aj v softvérovom ekosystéme CUDA, sieťovaní, architektúre serverov a schopnosti používať rovnakú platformu naprieč širokou škálou modelov a pracovných záťaží.

Význam Jalapeño spočíva inde. OpenAI presne vie, aké pracovné záťaže generujú jej vlastné služby, a môže okolo nich optimalizovať hardvér. Google, Amazon a ďalšie veľké cloudové spoločnosti sa rovnakou logikou riadia už roky. Vstup OpenAI na trh s vlastným čipom vytvára ďalší tlak na zlacnenie AI výpočtov a zvýšenie ich energetickej efektívnosti.

OpenAI plánuje nasadiť Jalapeño vo vlastnej výpočtovej infraštruktúre do konca roka 2026. Čip druhej generácie je už v pokročilom vývoji, zatiaľ čo architektúra tretej generácie nadobúda podobu.

Energetická efektívnosť je obzvlášť dôležitá pre Európu. Rast AI dátových centier znamená priamu konkurenciu o elektrickú kapacitu a pripojenia k sieti. Ak špecializované inferenčné čipy dokážu skutočne poskytovať podstatne viac užitočnej práce na kilowatt, ich hospodársky vplyv sa môže ukázať ako dôležitejší než akékoľvek jednotlivé víťazstvo v benchmarku nad NVIDIA.

Jalapeño nekonkuruje čipom na trénovanie

Ide o prvý vlastný inferenčný čip OpenAI, čo znamená, že bol optimalizovaný predovšetkým na prevádzku už natrénovaných modelov, nie na trénovanie nových veľkých modelov od základu. Spoločnosť bude na trénovanie aj inferenciu naďalej používať akcelerátory od NVIDIA a ďalších partnerov.

OpenAI použila verejný benchmark InferenceX a testovala tri modely: GPT-OSS 120B, DeepSeek R1 670B a Kimi K2.5 1T. Ako porovnávacie systémy boli použité NVIDIA GB200 a GB300.

S GPT-OSS 120B dosiahlo Jalapeño špičkovú priepustnosť 85 448 vstupných a výstupných tokenov za sekundu na kilowatt v porovnaní so 44 960 pri GB200. Jalapeño tak získava približne 1,9-násobnú výhodu. Koncová latencia dopytu bola 1,03 sekundy oproti 1,80 sekundy.

DeepSeek R1 vykázal ešte väčší rozdiel v latencii. Jalapeño dokončilo dopyt za 1,65 sekundy, zatiaľ čo GB300 potreboval 5,99 sekundy. Špičková priepustnosť na jednotku výkonu dosiahla 19 641 vstupných a výstupných tokenov za sekundu na kilowatt pri Jalapeño a 11 781 pri GB300. Pri Kimi K2.5 namerala OpenAI pre Jalapeño približne 1,5-násobne vyššiu špičkovú priepustnosť na jednotku výkonu a 3,4-násobne nižšiu celkovú latenciu.

Ide o vlastné merania OpenAI, nie o výsledky nezávislého laboratória. Údaje o energetickej efektívnosti treba tiež čítať v kontexte metodiky. OpenAI výsledky normalizovala pomocou zverejneného menovitého výkonu akcelerátorov, namiesto merania skutočnej spotreby energie každého konkurenčného systému za rovnakých podmienok.

Čip s výkonom 700 W v testovaní neodoberal viac než 550 W

Jalapeño má menovitý výkon 700 W. Podľa OpenAI zostala skutočná spotreba energie pri testovaných pracovných záťažiach na úrovni 550 W alebo nižšej. Spoločnosť pri svojich výpočtoch použila NVIDIA zverejnený menovitý výkon 1 200 W pre GB200 a 1 400 W pre GB300.

Práca vykonaná na jednotku výkonu je vo veľkých AI dátových centrách čoraz dôležitejšia. Elektrická kapacita, chladenie a pripojenia k sieti môžu rast serverových fariem obmedzovať rovnako ako dostupnosť čipov. Ak možno z každého kilowattu obslúžiť viac dopytov, náklady na infraštruktúru na jeden vygenerovaný token alebo používateľskú požiadavku klesajú.

Architektúra Jalapeño je navrhnutá okolo rôznych fáz inferencie jazykových modelov. Počiatočné spracovanie vstupu, teda prefill, je najmä výpočtovo náročné. Generovanie odpovede token po tokene, teda decode, závisí viac od priepustnosti pamäte. Čas sa spotrebúva aj presunom dát a stavu modelu medzi čipmi a výpočtovými jednotkami.

OpenAI navrhla procesor, pamäť, sieťovanie a softvér ako jeden integrovaný systém, aby znížila zbytočné presuny dát. Architektúra okrem iného umožňuje, aby KV cache používaná počas generovania odpovede zostala čo najviac lokálna.

Pri návrhu samotného čipu pomáhala AI

AI zohrala priamu úlohu pri vývoji Jalapeño. Podľa OpenAI tím prešiel od počiatočného návrhu po tape-out za deväť mesiacov. AI sa použila na skúmanie možností implementácie, optimalizáciu aritmetických blokov a zrýchlenie cyklov overovania a merania.

Tím neskôr použil Codex spolu s GPT-Astra na optimalizáciu čipu pre tri modely s otvorenými váhami, ktoré neboli súčasťou pôvodného produkčného plánu. Práca trvala dva mesiace. Vo vybraných blokoch pozornosti a mixture-of-experts modelu GPT-OSS bežali implementácie vytvorené AI 1,5- až 1,8-násobne rýchlejšie než skoršie verzie napísané odborníkmi.

Existuje dôležitá výhrada: tento nárast výkonu sa týka vybraných výpočtových blokov, nie modelu GPT-OSS ako celku.

Problémom NVIDIA zatiaľ nie je Jalapeño, ale trend, ktorý stojí za ním

Jeden špecializovaný čip trh s AI hardvérom cez noc nezmení. Výhoda NVIDIA nespočíva iba v surovom výpočtovom výkone GB200 či GB300, ale aj v softvérovom ekosystéme CUDA, sieťovaní, architektúre serverov a schopnosti používať rovnakú platformu naprieč širokou škálou modelov a pracovných záťaží.

Význam Jalapeño spočíva inde. OpenAI presne vie, aké pracovné záťaže generujú jej vlastné služby, a môže okolo nich optimalizovať hardvér. Google, Amazon a ďalšie veľké cloudové spoločnosti sa rovnakou logikou riadia už roky. Vstup OpenAI na trh s vlastným čipom vytvára ďalší tlak na zlacnenie AI výpočtov a zvýšenie ich energetickej efektívnosti.

OpenAI plánuje nasadiť Jalapeño vo vlastnej výpočtovej infraštruktúre do konca roka 2026. Čip druhej generácie je už v pokročilom vývoji, zatiaľ čo architektúra tretej generácie nadobúda podobu.

Energetická efektívnosť je obzvlášť dôležitá pre Európu. Rast AI dátových centier znamená priamu konkurenciu o elektrickú kapacitu a pripojenia k sieti. Ak špecializované inferenčné čipy dokážu skutočne poskytovať podstatne viac užitočnej práce na kilowatt, ich hospodársky vplyv sa môže ukázať ako dôležitejší než akékoľvek jednotlivé víťazstvo v benchmarku nad NVIDIA.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/sk/footer.php on line 6