Reklaam
Fullscreen Image

Първият вътрешно разработен чип на OpenAI изпреварва NVIDIA по скорост и енергийна ефективност

Автор auto.pub | Публикувано: 27.08.2026

OpenAI публикува първите подробни показатели за производителността на Jalapeño — първия ѝ чип, проектиран специално за AI инференция. В собствените тестове на компанията с три големи езикови модела чипът осигурява 1,5-1,9 пъти по-висока пикова пропускателна способност на единица мощност и 1,7-3,6 пъти по-ниска цялостна латентност на заявките в сравнение със системите NVIDIA GB200 и GB300, използвани за сравнение. Това не означава, че NVIDIA е детронирана, но показва защо най-големите AI компании все повече искат да проектират повече от собствения си хардуер.

Reklaam

Jalapeño не се конкурира с чипове за обучение

Това е първият вътрешно разработен чип за инференция на OpenAI, което означава, че е оптимизиран основно за изпълнение на вече обучени модели, а не за обучение на нови големи модели от нулата. Компанията ще продължи да използва ускорители от NVIDIA и други партньори както за обучение, така и за инференция.

OpenAI използва публичния бенчмарк InferenceX и тества три модела: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. За сравнителни системи бяха използвани NVIDIA GB200 и GB300.

При GPT-OSS 120B Jalapeño постигна пикова пропускателна способност от 85 448 входни и изходни токена в секунда на киловат, в сравнение с 44 960 за GB200. Това дава на Jalapeño предимство от приблизително 1,9 пъти. Цялостната латентност на заявката беше съответно 1,03 секунди срещу 1,80 секунди.

DeepSeek R1 показа още по-голяма разлика в латентността. Jalapeño завърши заявката за 1,65 секунди, докато GB300 се нуждаеше от 5,99 секунди. Пиковата пропускателна способност на единица мощност достигна 19 641 входни и изходни токена в секунда на киловат при Jalapeño и 11 781 при GB300. При Kimi K2.5 OpenAI измери приблизително 1,5 пъти по-висока пикова пропускателна способност на единица мощност и 3,4 пъти по-ниска обща латентност за Jalapeño.

Това са собствени измервания на OpenAI, а не резултати от независима лаборатория. Данните за енергийната ефективност също трябва да се разглеждат в контекста на методологията. OpenAI нормализира резултатите, използвайки публикуваната номинална мощност на ускорителите, вместо да измерва действителното потребление на енергия на всяка конкурентна система при идентични условия.

Чипът с мощност 700 W е консумирал не повече от 550 W при тестването

Jalapeño има номинална мощност от 700 W. Според OpenAI действителното потребление на енергия е останало на или под 550 W при тестваните натоварвания. За своите изчисления компанията е използвала публикуваната от NVIDIA номинална мощност от 1 200 W за GB200 и 1 400 W за GB300.

Извършената работа на единица мощност става все по-важна в големите AI центрове за данни. Електрическият капацитет, охлаждането и връзките с електропреносната мрежа могат да ограничат растежа на сървърните паркове също толкова, колкото и наличността на чипове. Ако от всеки киловат могат да се обслужват повече заявки, инфраструктурният разход за генериран токен или потребителска заявка намалява.

Архитектурата на Jalapeño е проектирана около различните етапи на инференцията на езиковите модели. Първоначалната обработка на входните данни, или prefill, е предимно изчислително интензивна. Генерирането на отговора токен по токен, или decode, зависи в по-голяма степен от честотната лента на паметта. Време се изразходва и за преместване на данни и състоянието на модела между чипове и изчислителни единици.

OpenAI е проектирала процесора, паметта, мрежовата свързаност и софтуера като единна интегрирана система, за да намали ненужното преместване на данни. Наред с други неща, архитектурата позволява KV кешът, използван при генерирането на отговори, да остава възможно най-локален.

AI е помогнал и при проектирането на самия чип

AI има пряка роля в разработването на Jalapeño. Според OpenAI екипът е преминал от първоначалния проект до tape-out за девет месеца. AI е използван за проучване на варианти за имплементация, оптимизиране на аритметични блокове и ускоряване на циклите по проверка и измерване.

По-късно екипът използва Codex заедно с GPT-Astra, за да оптимизира чипа за три модела с отворени тегла, които не са били част от първоначалния производствен план. Работата е отнела два месеца. В избрани GPT-OSS блокове за внимание и mixture-of-experts имплементациите, генерирани от AI, работят 1,5-1,8 пъти по-бързо от по-ранните версии, написани от експерти.

Има важно уточнение: това увеличение на производителността се отнася за избрани изчислителни блокове, а не за модела GPT-OSS като цяло.

Проблемът на NVIDIA все още не е Jalapeño, а тенденцията зад него

Един специализиран чип няма да промени пазара на AI хардуер за една нощ. Предимството на NVIDIA не се състои само в суровата изчислителна производителност на GB200 или GB300, а и в софтуерната екосистема CUDA, мрежовата свързаност, сървърната архитектура и възможността една и съща платформа да се използва за широк спектър от модели и натоварвания.

Значението на Jalapeño е другаде. OpenAI знае точно какви натоварвания генерират собствените ѝ услуги и може да оптимизира хардуера около тях. Google, Amazon и други големи облачни компании следват същата логика от години. Навлизането на OpenAI на пазара със собствен чип добавя допълнителен натиск AI изчисленията да станат по-евтини и по-енергийно ефективни.

OpenAI планира да внедри Jalapeño в собствената си изчислителна инфраструктура до края на 2026 г. Чип от второ поколение вече е в напреднала разработка, докато архитектурата на трето поколение започва да се оформя.

Енергийната ефективност е особено важна за Европа. Растежът на AI центровете за данни означава пряка конкуренция за електрически капацитет и връзки с електропреносната мрежа. Ако специализираните чипове за инференция действително могат да осигурят значително повече полезна работа на киловат, икономическото им въздействие може да се окаже по-важно от всяка отделна победа над NVIDIA в бенчмарк.

Jalapeño не се конкурира с чипове за обучение

Това е първият вътрешно разработен чип за инференция на OpenAI, което означава, че е оптимизиран основно за изпълнение на вече обучени модели, а не за обучение на нови големи модели от нулата. Компанията ще продължи да използва ускорители от NVIDIA и други партньори както за обучение, така и за инференция.

OpenAI използва публичния бенчмарк InferenceX и тества три модела: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. За сравнителни системи бяха използвани NVIDIA GB200 и GB300.

При GPT-OSS 120B Jalapeño постигна пикова пропускателна способност от 85 448 входни и изходни токена в секунда на киловат, в сравнение с 44 960 за GB200. Това дава на Jalapeño предимство от приблизително 1,9 пъти. Цялостната латентност на заявката беше съответно 1,03 секунди срещу 1,80 секунди.

DeepSeek R1 показа още по-голяма разлика в латентността. Jalapeño завърши заявката за 1,65 секунди, докато GB300 се нуждаеше от 5,99 секунди. Пиковата пропускателна способност на единица мощност достигна 19 641 входни и изходни токена в секунда на киловат при Jalapeño и 11 781 при GB300. При Kimi K2.5 OpenAI измери приблизително 1,5 пъти по-висока пикова пропускателна способност на единица мощност и 3,4 пъти по-ниска обща латентност за Jalapeño.

Това са собствени измервания на OpenAI, а не резултати от независима лаборатория. Данните за енергийната ефективност също трябва да се разглеждат в контекста на методологията. OpenAI нормализира резултатите, използвайки публикуваната номинална мощност на ускорителите, вместо да измерва действителното потребление на енергия на всяка конкурентна система при идентични условия.

Чипът с мощност 700 W е консумирал не повече от 550 W при тестването

Jalapeño има номинална мощност от 700 W. Според OpenAI действителното потребление на енергия е останало на или под 550 W при тестваните натоварвания. За своите изчисления компанията е използвала публикуваната от NVIDIA номинална мощност от 1 200 W за GB200 и 1 400 W за GB300.

Извършената работа на единица мощност става все по-важна в големите AI центрове за данни. Електрическият капацитет, охлаждането и връзките с електропреносната мрежа могат да ограничат растежа на сървърните паркове също толкова, колкото и наличността на чипове. Ако от всеки киловат могат да се обслужват повече заявки, инфраструктурният разход за генериран токен или потребителска заявка намалява.

Архитектурата на Jalapeño е проектирана около различните етапи на инференцията на езиковите модели. Първоначалната обработка на входните данни, или prefill, е предимно изчислително интензивна. Генерирането на отговора токен по токен, или decode, зависи в по-голяма степен от честотната лента на паметта. Време се изразходва и за преместване на данни и състоянието на модела между чипове и изчислителни единици.

OpenAI е проектирала процесора, паметта, мрежовата свързаност и софтуера като единна интегрирана система, за да намали ненужното преместване на данни. Наред с други неща, архитектурата позволява KV кешът, използван при генерирането на отговори, да остава възможно най-локален.

AI е помогнал и при проектирането на самия чип

AI има пряка роля в разработването на Jalapeño. Според OpenAI екипът е преминал от първоначалния проект до tape-out за девет месеца. AI е използван за проучване на варианти за имплементация, оптимизиране на аритметични блокове и ускоряване на циклите по проверка и измерване.

По-късно екипът използва Codex заедно с GPT-Astra, за да оптимизира чипа за три модела с отворени тегла, които не са били част от първоначалния производствен план. Работата е отнела два месеца. В избрани GPT-OSS блокове за внимание и mixture-of-experts имплементациите, генерирани от AI, работят 1,5-1,8 пъти по-бързо от по-ранните версии, написани от експерти.

Има важно уточнение: това увеличение на производителността се отнася за избрани изчислителни блокове, а не за модела GPT-OSS като цяло.

Проблемът на NVIDIA все още не е Jalapeño, а тенденцията зад него

Един специализиран чип няма да промени пазара на AI хардуер за една нощ. Предимството на NVIDIA не се състои само в суровата изчислителна производителност на GB200 или GB300, а и в софтуерната екосистема CUDA, мрежовата свързаност, сървърната архитектура и възможността една и съща платформа да се използва за широк спектър от модели и натоварвания.

Значението на Jalapeño е другаде. OpenAI знае точно какви натоварвания генерират собствените ѝ услуги и може да оптимизира хардуера около тях. Google, Amazon и други големи облачни компании следват същата логика от години. Навлизането на OpenAI на пазара със собствен чип добавя допълнителен натиск AI изчисленията да станат по-евтини и по-енергийно ефективни.

OpenAI планира да внедри Jalapeño в собствената си изчислителна инфраструктура до края на 2026 г. Чип от второ поколение вече е в напреднала разработка, докато архитектурата на трето поколение започва да се оформя.

Енергийната ефективност е особено важна за Европа. Растежът на AI центровете за данни означава пряка конкуренция за електрически капацитет и връзки с електропреносната мрежа. Ако специализираните чипове за инференция действително могат да осигурят значително повече полезна работа на киловат, икономическото им въздействие може да се окаже по-важно от всяка отделна победа над NVIDIA в бенчмарк.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/bg/footer.php on line 6