Reklaam
Fullscreen Image

Pirmasis „OpenAI“ viduje sukurtas lustas greičiu ir energijos efektyvumu lenkia NVIDIA

Autorius auto.pub | Paskelbta: 27.08.2026

„OpenAI“ paskelbė pirmuosius išsamius savo pirmojo specialiai AI išvadoms skirto lusto „Jalapeño“ našumo rodiklius. Pačios bendrovės bandymuose su trimis dideliais kalbos modeliais šis lustas pasiekė 1,5–1,9 karto didesnį didžiausią pralaidumą galios vienetui ir 1,7–3,6 karto mažesnę bendrą užklausos delsą nei palyginimui naudotos NVIDIA GB200 ir GB300 sistemos. Tai nereiškia, kad NVIDIA buvo nuversta nuo sosto, tačiau parodo, kodėl didžiausios AI bendrovės vis labiau nori pačios kurti daugiau savo aparatinės įrangos.

Reklaam

„Jalapeño“ nekonkuruoja su mokymui skirtais lustais

Tai pirmasis „OpenAI“ viduje sukurtas išvadoms skirtas lustas, o tai reiškia, kad jis pirmiausia optimizuotas jau apmokytiems modeliams vykdyti, o ne naujiems dideliems modeliams nuo nulio mokyti. Bendrovė ir toliau naudos NVIDIA bei kitų partnerių greitintuvus tiek mokymui, tiek išvadoms.

„OpenAI“ naudojo viešąjį „InferenceX“ etaloną ir testavo tris modelius: GPT-OSS 120B, DeepSeek R1 670B ir Kimi K2.5 1T. Palyginamosiomis sistemomis buvo naudojamos NVIDIA GB200 ir GB300.

Su GPT-OSS 120B „Jalapeño“ pasiekė 85 448 įvesties ir išvesties žetonų per sekundę vienam kilovatui didžiausią pralaidumą, palyginti su 44 960 GB200 sistemoje. Tai suteikia „Jalapeño“ maždaug 1,9 karto pranašumą. Bendra užklausos delsa atitinkamai siekė 1,03 sekundės, palyginti su 1,80 sekundės.

Su DeepSeek R1 delsos skirtumas buvo dar didesnis. „Jalapeño“ užklausą įvykdė per 1,65 sekundės, o GB300 reikėjo 5,99 sekundės. Didžiausias pralaidumas galios vienetui „Jalapeño“ sistemoje pasiekė 19 641 įvesties ir išvesties žetoną per sekundę vienam kilovatui, o GB300 sistemoje – 11 781. Su Kimi K2.5 „OpenAI“ „Jalapeño“ atveju išmatavo maždaug 1,5 karto didesnį didžiausią pralaidumą galios vienetui ir 3,4 karto mažesnę bendrą delsą.

Tai yra pačios „OpenAI“ matavimai, o ne nepriklausomos laboratorijos rezultatai. Energijos efektyvumo rodiklius taip pat reikia vertinti metodikos kontekste. „OpenAI“ normalizavo rezultatus pagal paskelbtą vardinę greitintuvų galią, užuot vienodomis sąlygomis matavusi faktinį kiekvienos konkuruojančios sistemos energijos suvartojimą.

700 W lustas bandymų metu naudojo ne daugiau kaip 550 W

„Jalapeño“ vardinė galia yra 700 W. Pasak „OpenAI“, faktinis energijos suvartojimas tirtose apkrovose išliko ne didesnis nei 550 W. Skaičiavimams bendrovė naudojo NVIDIA paskelbtą 1 200 W vardinę GB200 ir 1 400 W vardinę GB300 galią.

Dideliuose AI duomenų centruose atliekamas darbas galios vienetui tampa vis svarbesnis. Elektros pajėgumas, aušinimas ir prisijungimai prie elektros tinklo gali riboti serverių parkų augimą lygiai taip pat kaip lustų prieinamumas. Jei iš kiekvieno kilovato galima aptarnauti daugiau užklausų, infrastruktūros kaina vienam sugeneruotam žetonui ar naudotojo užklausai mažėja.

„Jalapeño“ architektūra sukurta atsižvelgiant į skirtingus kalbos modelio išvadų etapus. Pradinis įvesties apdorojimas, arba prefill, pirmiausia reikalauja daug skaičiavimų. Atsakymo generavimas po vieną žetoną, arba decode, labiau priklauso nuo atminties pralaidumo. Laiko taip pat sunaudojama perkeliant duomenis ir modelio būseną tarp lustų ir skaičiavimo blokų.

„OpenAI“ sukūrė procesorių, atmintį, tinklą ir programinę įrangą kaip vieną integruotą sistemą, siekdama sumažinti nereikalingą duomenų perkėlimą. Be kita ko, architektūra leidžia atsakymo generavimo metu naudojamą KV podėlį išlaikyti kuo lokalesnį.

AI padėjo kurti patį lustą

AI atliko tiesioginį vaidmenį kuriant „Jalapeño“. Pasak „OpenAI“, komanda nuo pradinio projekto iki tape-out etapo perėjo per devynis mėnesius. AI buvo naudojamas diegimo galimybėms tirti, aritmetiniams blokams optimizuoti ir verifikavimo bei matavimo ciklams paspartinti.

Vėliau komanda naudojo „Codex“ kartu su GPT-Astra, kad optimizuotų lustą trims atvirų svorių modeliams, kurie nebuvo įtraukti į pradinį gamybos planą. Darbas truko du mėnesius. Pasirinktuose GPT-OSS dėmesio ir ekspertų mišinio blokuose AI sugeneruoti įgyvendinimai veikė 1,5–1,8 karto greičiau nei ankstesnės ekspertų parašytos versijos.

Yra svarbi išlyga: šis našumo padidėjimas taikomas pasirinktiems skaičiavimo blokams, o ne visam GPT-OSS modeliui.

NVIDIA problema kol kas nėra „Jalapeño“, bet tendencija, kurią jis atspindi

Vienas specializuotas lustas per naktį nepakeis AI aparatinės įrangos rinkos. NVIDIA pranašumą lemia ne tik neapdorota GB200 ar GB300 skaičiavimo sparta, bet ir CUDA programinės įrangos ekosistema, tinklai, serverių architektūra bei galimybė tą pačią platformą naudoti įvairiems modeliams ir apkrovoms.

„Jalapeño“ reikšmė slypi kitur. „OpenAI“ tiksliai žino, kokias apkrovas sukuria jos pačios paslaugos, ir gali pagal jas optimizuoti aparatinę įrangą. „Google“, „Amazon“ ir kitos didžiosios debesijos bendrovės šia logika vadovaujasi jau daug metų. „OpenAI“ įžengimas į rinką su savo lustu dar labiau didina spaudimą AI skaičiavimus padaryti pigesnius ir efektyviau vartojančius energiją.

„OpenAI“ planuoja iki 2026 m. pabaigos įdiegti „Jalapeño“ savo skaičiavimo infrastruktūroje. Antrosios kartos lustas jau intensyviai kuriamas, o trečiosios kartos architektūra įgauna formą.

Energijos efektyvumas ypač svarbus Europai. AI duomenų centrų augimas reiškia tiesioginę konkurenciją dėl elektros pajėgumų ir prisijungimų prie tinklo. Jei specializuoti išvadoms skirti lustai iš tiesų gali atlikti gerokai daugiau naudingo darbo vienam kilovatui, jų ekonominis poveikis gali pasirodyti svarbesnis už bet kurią pavienę pergalę prieš NVIDIA etaloniniuose testuose.

„Jalapeño“ nekonkuruoja su mokymui skirtais lustais

Tai pirmasis „OpenAI“ viduje sukurtas išvadoms skirtas lustas, o tai reiškia, kad jis pirmiausia optimizuotas jau apmokytiems modeliams vykdyti, o ne naujiems dideliems modeliams nuo nulio mokyti. Bendrovė ir toliau naudos NVIDIA bei kitų partnerių greitintuvus tiek mokymui, tiek išvadoms.

„OpenAI“ naudojo viešąjį „InferenceX“ etaloną ir testavo tris modelius: GPT-OSS 120B, DeepSeek R1 670B ir Kimi K2.5 1T. Palyginamosiomis sistemomis buvo naudojamos NVIDIA GB200 ir GB300.

Su GPT-OSS 120B „Jalapeño“ pasiekė 85 448 įvesties ir išvesties žetonų per sekundę vienam kilovatui didžiausią pralaidumą, palyginti su 44 960 GB200 sistemoje. Tai suteikia „Jalapeño“ maždaug 1,9 karto pranašumą. Bendra užklausos delsa atitinkamai siekė 1,03 sekundės, palyginti su 1,80 sekundės.

Su DeepSeek R1 delsos skirtumas buvo dar didesnis. „Jalapeño“ užklausą įvykdė per 1,65 sekundės, o GB300 reikėjo 5,99 sekundės. Didžiausias pralaidumas galios vienetui „Jalapeño“ sistemoje pasiekė 19 641 įvesties ir išvesties žetoną per sekundę vienam kilovatui, o GB300 sistemoje – 11 781. Su Kimi K2.5 „OpenAI“ „Jalapeño“ atveju išmatavo maždaug 1,5 karto didesnį didžiausią pralaidumą galios vienetui ir 3,4 karto mažesnę bendrą delsą.

Tai yra pačios „OpenAI“ matavimai, o ne nepriklausomos laboratorijos rezultatai. Energijos efektyvumo rodiklius taip pat reikia vertinti metodikos kontekste. „OpenAI“ normalizavo rezultatus pagal paskelbtą vardinę greitintuvų galią, užuot vienodomis sąlygomis matavusi faktinį kiekvienos konkuruojančios sistemos energijos suvartojimą.

700 W lustas bandymų metu naudojo ne daugiau kaip 550 W

„Jalapeño“ vardinė galia yra 700 W. Pasak „OpenAI“, faktinis energijos suvartojimas tirtose apkrovose išliko ne didesnis nei 550 W. Skaičiavimams bendrovė naudojo NVIDIA paskelbtą 1 200 W vardinę GB200 ir 1 400 W vardinę GB300 galią.

Dideliuose AI duomenų centruose atliekamas darbas galios vienetui tampa vis svarbesnis. Elektros pajėgumas, aušinimas ir prisijungimai prie elektros tinklo gali riboti serverių parkų augimą lygiai taip pat kaip lustų prieinamumas. Jei iš kiekvieno kilovato galima aptarnauti daugiau užklausų, infrastruktūros kaina vienam sugeneruotam žetonui ar naudotojo užklausai mažėja.

„Jalapeño“ architektūra sukurta atsižvelgiant į skirtingus kalbos modelio išvadų etapus. Pradinis įvesties apdorojimas, arba prefill, pirmiausia reikalauja daug skaičiavimų. Atsakymo generavimas po vieną žetoną, arba decode, labiau priklauso nuo atminties pralaidumo. Laiko taip pat sunaudojama perkeliant duomenis ir modelio būseną tarp lustų ir skaičiavimo blokų.

„OpenAI“ sukūrė procesorių, atmintį, tinklą ir programinę įrangą kaip vieną integruotą sistemą, siekdama sumažinti nereikalingą duomenų perkėlimą. Be kita ko, architektūra leidžia atsakymo generavimo metu naudojamą KV podėlį išlaikyti kuo lokalesnį.

AI padėjo kurti patį lustą

AI atliko tiesioginį vaidmenį kuriant „Jalapeño“. Pasak „OpenAI“, komanda nuo pradinio projekto iki tape-out etapo perėjo per devynis mėnesius. AI buvo naudojamas diegimo galimybėms tirti, aritmetiniams blokams optimizuoti ir verifikavimo bei matavimo ciklams paspartinti.

Vėliau komanda naudojo „Codex“ kartu su GPT-Astra, kad optimizuotų lustą trims atvirų svorių modeliams, kurie nebuvo įtraukti į pradinį gamybos planą. Darbas truko du mėnesius. Pasirinktuose GPT-OSS dėmesio ir ekspertų mišinio blokuose AI sugeneruoti įgyvendinimai veikė 1,5–1,8 karto greičiau nei ankstesnės ekspertų parašytos versijos.

Yra svarbi išlyga: šis našumo padidėjimas taikomas pasirinktiems skaičiavimo blokams, o ne visam GPT-OSS modeliui.

NVIDIA problema kol kas nėra „Jalapeño“, bet tendencija, kurią jis atspindi

Vienas specializuotas lustas per naktį nepakeis AI aparatinės įrangos rinkos. NVIDIA pranašumą lemia ne tik neapdorota GB200 ar GB300 skaičiavimo sparta, bet ir CUDA programinės įrangos ekosistema, tinklai, serverių architektūra bei galimybė tą pačią platformą naudoti įvairiems modeliams ir apkrovoms.

„Jalapeño“ reikšmė slypi kitur. „OpenAI“ tiksliai žino, kokias apkrovas sukuria jos pačios paslaugos, ir gali pagal jas optimizuoti aparatinę įrangą. „Google“, „Amazon“ ir kitos didžiosios debesijos bendrovės šia logika vadovaujasi jau daug metų. „OpenAI“ įžengimas į rinką su savo lustu dar labiau didina spaudimą AI skaičiavimus padaryti pigesnius ir efektyviau vartojančius energiją.

„OpenAI“ planuoja iki 2026 m. pabaigos įdiegti „Jalapeño“ savo skaičiavimo infrastruktūroje. Antrosios kartos lustas jau intensyviai kuriamas, o trečiosios kartos architektūra įgauna formą.

Energijos efektyvumas ypač svarbus Europai. AI duomenų centrų augimas reiškia tiesioginę konkurenciją dėl elektros pajėgumų ir prisijungimų prie tinklo. Jei specializuoti išvadoms skirti lustai iš tiesų gali atlikti gerokai daugiau naudingo darbo vienam kilovatui, jų ekonominis poveikis gali pasirodyti svarbesnis už bet kurią pavienę pergalę prieš NVIDIA etaloniniuose testuose.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/lt/footer.php on line 6