Reklaam
Fullscreen Image

OpenAI-jev prvi vlastiti čip nadmašuje NVIDIA-u u brzini i energetskoj učinkovitosti

Autor auto.pub | Objavljeno: 27.08.2026

OpenAI je objavio prve detaljne rezultate performansi za Jalapeño, svoj prvi čip dizajniran posebno za AI inferenciju. U vlastitim testovima na tri velika jezična modela, čip je ostvario 1,5–1,9 puta veći vršni protok po jedinici snage i 1,7–3,6 puta manju ukupnu latenciju upita od sustava NVIDIA GB200 i GB300 korištenih za usporedbu. To ne znači da je NVIDIA svrgnuta s trona, ali pokazuje zašto najveće AI tvrtke sve više žele same dizajnirati veći dio vlastitog hardvera.

Reklaam

Jalapeño se ne natječe s čipovima za treniranje

Ovo je OpenAI-jev prvi vlastiti čip za inferenciju, što znači da je optimiziran prvenstveno za pokretanje već istreniranih modela, a ne za treniranje novih velikih modela od nule. Tvrtka će nastaviti koristiti akceleratore NVIDIA-e i drugih partnera i za treniranje i za inferenciju.

OpenAI je koristio javno mjerilo InferenceX i testirao tri modela: GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. NVIDIA-ini GB200 i GB300 korišteni su kao usporedbeni sustavi.

S modelom GPT-OSS 120B, Jalapeño je ostvario vršni protok od 85.448 ulaznih i izlaznih tokena u sekundi po kilovatu, u usporedbi s 44.960 za GB200. To Jalapeñu daje prednost od približno 1,9 puta. Ukupna latencija upita iznosila je 1,03 sekunde naspram 1,80 sekundi.

DeepSeek R1 ostvario je još veći jaz u latenciji. Jalapeño je dovršio upit za 1,65 sekundi, dok je GB300 zahtijevao 5,99 sekundi. Vršni protok po jedinici snage dosegnuo je 19.641 ulazni i izlazni token u sekundi po kilovatu na Jalapeñu i 11.781 na GB300. S modelom Kimi K2.5, OpenAI je izmjerio približno 1,5 puta veći vršni protok po jedinici snage i 3,4 puta manju ukupnu latenciju za Jalapeño.

Riječ je o vlastitim mjerenjima OpenAI-ja, a ne o rezultatima neovisnog laboratorija. Podatke o energetskoj učinkovitosti također treba tumačiti u kontekstu metodologije. OpenAI je normalizirao rezultate koristeći objavljenu nazivnu snagu akceleratora, umjesto da mjeri stvarnu potrošnju energije svakog konkurentskog sustava u identičnim uvjetima.

Čip od 700 W u testiranju nije trošio više od 550 W

Jalapeño ima nazivnu snagu od 700 W. Prema OpenAI-ju, stvarna potrošnja energije u testiranim radnim opterećenjima ostala je na 550 W ili manje. Za svoje izračune tvrtka je koristila NVIDIA-inu objavljenu nazivnu snagu od 1.200 W za GB200 i 1.400 W za GB300.

Rad obavljen po jedinici snage postaje sve važniji u velikim AI podatkovnim centrima. Električni kapacitet, hlađenje i priključci na mrežu mogu ograničiti rast poslužiteljskih farmi jednako kao i dostupnost čipova. Ako se sa svakog kilovata može obraditi više upita, infrastrukturni trošak po generiranom tokenu ili korisničkom zahtjevu pada.

Arhitektura Jalapeña osmišljena je oko različitih faza inference jezičnog modela. Početna obrada ulaza, odnosno prefill, prvenstveno je računalno intenzivna. Generiranje odgovora token po token, odnosno decode, više ovisi o memorijskoj propusnosti. Vrijeme se također troši na prijenos podataka i stanja modela između čipova i računalnih jedinica.

OpenAI je procesor, memoriju, mrežnu povezanost i softver dizajnirao kao jedinstveni integrirani sustav kako bi smanjio nepotrebno premještanje podataka. Između ostalog, arhitektura omogućuje da KV predmemorija koja se koristi tijekom generiranja odgovora ostane što lokalnija.

AI je pomogao dizajnirati sam čip

AI je imao izravnu ulogu u razvoju Jalapeña. Prema OpenAI-ju, tim je od početnog dizajna do tape-outa stigao za devet mjeseci. AI se koristio za istraživanje opcija implementacije, optimizaciju aritmetičkih blokova te ubrzavanje ciklusa provjere i mjerenja.

Tim je kasnije koristio Codex zajedno s GPT-Astrom kako bi optimizirao čip za tri modela s otvorenim težinama koji nisu bili dio izvornog proizvodnog plana. Rad je trajao dva mjeseca. U odabranim blokovima pažnje i mixture-of-experts modela GPT-OSS, implementacije koje je generirao AI radile su 1,5–1,8 puta brže od ranijih verzija koje su napisali stručnjaci.

Postoji važna napomena: taj porast performansi odnosi se na odabrane računalne blokove, a ne na model GPT-OSS u cjelini.

Problem NVIDIA-e još nije Jalapeño, nego trend koji stoji iza njega

Jedan specijalizirani čip neće preko noći preoblikovati tržište AI hardvera. Prednost NVIDIA-e nije samo u sirovim računalnim performansama GB200 ili GB300, nego i u softverskom ekosustavu CUDA, mrežnoj povezanosti, arhitekturi poslužitelja i mogućnosti korištenja iste platforme za širok raspon modela i radnih opterećenja.

Značaj Jalapeña leži negdje drugdje. OpenAI točno zna kakva radna opterećenja stvaraju njegove usluge i može optimizirati hardver za njih. Google, Amazon i druge velike cloud tvrtke godinama slijede istu logiku. OpenAI-jev ulazak na tržište s vlastitim čipom stvara dodatni pritisak da AI računalstvo postane jeftinije i energetski učinkovitije.

OpenAI planira uvesti Jalapeño u vlastitu računalnu infrastrukturu do kraja 2026. Čip druge generacije već je u poodmaklom razvoju, dok se oblikuje arhitektura treće generacije.

Energetska učinkovitost posebno je važna za Europu. Rast AI podatkovnih centara znači izravnu konkurenciju za električni kapacitet i priključke na mrežu. Ako specijalizirani čipovi za inferenciju doista mogu pružiti znatno više korisnog rada po kilovatu, njihov bi se gospodarski učinak mogao pokazati važnijim od bilo koje pojedinačne pobjede u mjerilima nad NVIDIA-om.

Jalapeño se ne natječe s čipovima za treniranje

Ovo je OpenAI-jev prvi vlastiti čip za inferenciju, što znači da je optimiziran prvenstveno za pokretanje već istreniranih modela, a ne za treniranje novih velikih modela od nule. Tvrtka će nastaviti koristiti akceleratore NVIDIA-e i drugih partnera i za treniranje i za inferenciju.

OpenAI je koristio javno mjerilo InferenceX i testirao tri modela: GPT-OSS 120B, DeepSeek R1 670B i Kimi K2.5 1T. NVIDIA-ini GB200 i GB300 korišteni su kao usporedbeni sustavi.

S modelom GPT-OSS 120B, Jalapeño je ostvario vršni protok od 85.448 ulaznih i izlaznih tokena u sekundi po kilovatu, u usporedbi s 44.960 za GB200. To Jalapeñu daje prednost od približno 1,9 puta. Ukupna latencija upita iznosila je 1,03 sekunde naspram 1,80 sekundi.

DeepSeek R1 ostvario je još veći jaz u latenciji. Jalapeño je dovršio upit za 1,65 sekundi, dok je GB300 zahtijevao 5,99 sekundi. Vršni protok po jedinici snage dosegnuo je 19.641 ulazni i izlazni token u sekundi po kilovatu na Jalapeñu i 11.781 na GB300. S modelom Kimi K2.5, OpenAI je izmjerio približno 1,5 puta veći vršni protok po jedinici snage i 3,4 puta manju ukupnu latenciju za Jalapeño.

Riječ je o vlastitim mjerenjima OpenAI-ja, a ne o rezultatima neovisnog laboratorija. Podatke o energetskoj učinkovitosti također treba tumačiti u kontekstu metodologije. OpenAI je normalizirao rezultate koristeći objavljenu nazivnu snagu akceleratora, umjesto da mjeri stvarnu potrošnju energije svakog konkurentskog sustava u identičnim uvjetima.

Čip od 700 W u testiranju nije trošio više od 550 W

Jalapeño ima nazivnu snagu od 700 W. Prema OpenAI-ju, stvarna potrošnja energije u testiranim radnim opterećenjima ostala je na 550 W ili manje. Za svoje izračune tvrtka je koristila NVIDIA-inu objavljenu nazivnu snagu od 1.200 W za GB200 i 1.400 W za GB300.

Rad obavljen po jedinici snage postaje sve važniji u velikim AI podatkovnim centrima. Električni kapacitet, hlađenje i priključci na mrežu mogu ograničiti rast poslužiteljskih farmi jednako kao i dostupnost čipova. Ako se sa svakog kilovata može obraditi više upita, infrastrukturni trošak po generiranom tokenu ili korisničkom zahtjevu pada.

Arhitektura Jalapeña osmišljena je oko različitih faza inference jezičnog modela. Početna obrada ulaza, odnosno prefill, prvenstveno je računalno intenzivna. Generiranje odgovora token po token, odnosno decode, više ovisi o memorijskoj propusnosti. Vrijeme se također troši na prijenos podataka i stanja modela između čipova i računalnih jedinica.

OpenAI je procesor, memoriju, mrežnu povezanost i softver dizajnirao kao jedinstveni integrirani sustav kako bi smanjio nepotrebno premještanje podataka. Između ostalog, arhitektura omogućuje da KV predmemorija koja se koristi tijekom generiranja odgovora ostane što lokalnija.

AI je pomogao dizajnirati sam čip

AI je imao izravnu ulogu u razvoju Jalapeña. Prema OpenAI-ju, tim je od početnog dizajna do tape-outa stigao za devet mjeseci. AI se koristio za istraživanje opcija implementacije, optimizaciju aritmetičkih blokova te ubrzavanje ciklusa provjere i mjerenja.

Tim je kasnije koristio Codex zajedno s GPT-Astrom kako bi optimizirao čip za tri modela s otvorenim težinama koji nisu bili dio izvornog proizvodnog plana. Rad je trajao dva mjeseca. U odabranim blokovima pažnje i mixture-of-experts modela GPT-OSS, implementacije koje je generirao AI radile su 1,5–1,8 puta brže od ranijih verzija koje su napisali stručnjaci.

Postoji važna napomena: taj porast performansi odnosi se na odabrane računalne blokove, a ne na model GPT-OSS u cjelini.

Problem NVIDIA-e još nije Jalapeño, nego trend koji stoji iza njega

Jedan specijalizirani čip neće preko noći preoblikovati tržište AI hardvera. Prednost NVIDIA-e nije samo u sirovim računalnim performansama GB200 ili GB300, nego i u softverskom ekosustavu CUDA, mrežnoj povezanosti, arhitekturi poslužitelja i mogućnosti korištenja iste platforme za širok raspon modela i radnih opterećenja.

Značaj Jalapeña leži negdje drugdje. OpenAI točno zna kakva radna opterećenja stvaraju njegove usluge i može optimizirati hardver za njih. Google, Amazon i druge velike cloud tvrtke godinama slijede istu logiku. OpenAI-jev ulazak na tržište s vlastitim čipom stvara dodatni pritisak da AI računalstvo postane jeftinije i energetski učinkovitije.

OpenAI planira uvesti Jalapeño u vlastitu računalnu infrastrukturu do kraja 2026. Čip druge generacije već je u poodmaklom razvoju, dok se oblikuje arhitektura treće generacije.

Energetska učinkovitost posebno je važna za Europu. Rast AI podatkovnih centara znači izravnu konkurenciju za električni kapacitet i priključke na mrežu. Ako specijalizirani čipovi za inferenciju doista mogu pružiti znatno više korisnog rada po kilovatu, njihov bi se gospodarski učinak mogao pokazati važnijim od bilo koje pojedinačne pobjede u mjerilima nad NVIDIA-om.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/hr/footer.php on line 6