Първият вътрешно разработен чип на OpenAI изпреварва NVIDIA по скорост и енергийна ефективност
OpenAI публикува първите подробни показатели за производителността на Jalapeño — първия ѝ чип, проектиран специално за AI инференция. В собствените тестове на компанията с три големи езикови модела чипът осигурява 1,5-1,9 пъти по-висока пикова пропускателна способност на единица мощност и 1,7-3,6 пъти по-ниска цялостна латентност на заявките в сравнение със системите NVIDIA GB200 и GB300, използвани за сравнение. Това не означава, че NVIDIA е детронирана, но показва защо най-големите AI компании все повече искат да проектират повече от собствения си хардуер.
Jalapeño не се конкурира с чипове за обучение
Това е първият вътрешно разработен чип за инференция на OpenAI, което означава, че е оптимизиран основно за изпълнение на вече обучени модели, а не за обучение на нови големи модели от нулата. Компанията ще продължи да използва ускорители от NVIDIA и други партньори както за обучение, така и за инференция.
OpenAI използва публичния бенчмарк InferenceX и тества три модела: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. За сравнителни системи бяха използвани NVIDIA GB200 и GB300.
При GPT-OSS 120B Jalapeño постигна пикова пропускателна способност от 85 448 входни и изходни токена в секунда на киловат, в сравнение с 44 960 за GB200. Това дава на Jalapeño предимство от приблизително 1,9 пъти. Цялостната латентност на заявката беше съответно 1,03 секунди срещу 1,80 секунди.
DeepSeek R1 показа още по-голяма разлика в латентността. Jalapeño завърши заявката за 1,65 секунди, докато GB300 се нуждаеше от 5,99 секунди. Пиковата пропускателна способност на единица мощност достигна 19 641 входни и изходни токена в секунда на киловат при Jalapeño и 11 781 при GB300. При Kimi K2.5 OpenAI измери приблизително 1,5 пъти по-висока пикова пропускателна способност на единица мощност и 3,4 пъти по-ниска обща латентност за Jalapeño.
Това са собствени измервания на OpenAI, а не резултати от независима лаборатория. Данните за енергийната ефективност също трябва да се разглеждат в контекста на методологията. OpenAI нормализира резултатите, използвайки публикуваната номинална мощност на ускорителите, вместо да измерва действителното потребление на енергия на всяка конкурентна система при идентични условия.
Чипът с мощност 700 W е консумирал не повече от 550 W при тестването
Jalapeño има номинална мощност от 700 W. Според OpenAI действителното потребление на енергия е останало на или под 550 W при тестваните натоварвания. За своите изчисления компанията е използвала публикуваната от NVIDIA номинална мощност от 1 200 W за GB200 и 1 400 W за GB300.
Извършената работа на единица мощност става все по-важна в големите AI центрове за данни. Електрическият капацитет, охлаждането и връзките с електропреносната мрежа могат да ограничат растежа на сървърните паркове също толкова, колкото и наличността на чипове. Ако от всеки киловат могат да се обслужват повече заявки, инфраструктурният разход за генериран токен или потребителска заявка намалява.
Архитектурата на Jalapeño е проектирана около различните етапи на инференцията на езиковите модели. Първоначалната обработка на входните данни, или prefill, е предимно изчислително интензивна. Генерирането на отговора токен по токен, или decode, зависи в по-голяма степен от честотната лента на паметта. Време се изразходва и за преместване на данни и състоянието на модела между чипове и изчислителни единици.
OpenAI е проектирала процесора, паметта, мрежовата свързаност и софтуера като единна интегрирана система, за да намали ненужното преместване на данни. Наред с други неща, архитектурата позволява KV кешът, използван при генерирането на отговори, да остава възможно най-локален.
AI е помогнал и при проектирането на самия чип
AI има пряка роля в разработването на Jalapeño. Според OpenAI екипът е преминал от първоначалния проект до tape-out за девет месеца. AI е използван за проучване на варианти за имплементация, оптимизиране на аритметични блокове и ускоряване на циклите по проверка и измерване.
По-късно екипът използва Codex заедно с GPT-Astra, за да оптимизира чипа за три модела с отворени тегла, които не са били част от първоначалния производствен план. Работата е отнела два месеца. В избрани GPT-OSS блокове за внимание и mixture-of-experts имплементациите, генерирани от AI, работят 1,5-1,8 пъти по-бързо от по-ранните версии, написани от експерти.
Има важно уточнение: това увеличение на производителността се отнася за избрани изчислителни блокове, а не за модела GPT-OSS като цяло.
Проблемът на NVIDIA все още не е Jalapeño, а тенденцията зад него
Един специализиран чип няма да промени пазара на AI хардуер за една нощ. Предимството на NVIDIA не се състои само в суровата изчислителна производителност на GB200 или GB300, а и в софтуерната екосистема CUDA, мрежовата свързаност, сървърната архитектура и възможността една и съща платформа да се използва за широк спектър от модели и натоварвания.
Значението на Jalapeño е другаде. OpenAI знае точно какви натоварвания генерират собствените ѝ услуги и може да оптимизира хардуера около тях. Google, Amazon и други големи облачни компании следват същата логика от години. Навлизането на OpenAI на пазара със собствен чип добавя допълнителен натиск AI изчисленията да станат по-евтини и по-енергийно ефективни.
OpenAI планира да внедри Jalapeño в собствената си изчислителна инфраструктура до края на 2026 г. Чип от второ поколение вече е в напреднала разработка, докато архитектурата на трето поколение започва да се оформя.
Енергийната ефективност е особено важна за Европа. Растежът на AI центровете за данни означава пряка конкуренция за електрически капацитет и връзки с електропреносната мрежа. Ако специализираните чипове за инференция действително могат да осигурят значително повече полезна работа на киловат, икономическото им въздействие може да се окаже по-важно от всяка отделна победа над NVIDIA в бенчмарк.
Jalapeño не се конкурира с чипове за обучение
Това е първият вътрешно разработен чип за инференция на OpenAI, което означава, че е оптимизиран основно за изпълнение на вече обучени модели, а не за обучение на нови големи модели от нулата. Компанията ще продължи да използва ускорители от NVIDIA и други партньори както за обучение, така и за инференция.
OpenAI използва публичния бенчмарк InferenceX и тества три модела: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. За сравнителни системи бяха използвани NVIDIA GB200 и GB300.
При GPT-OSS 120B Jalapeño постигна пикова пропускателна способност от 85 448 входни и изходни токена в секунда на киловат, в сравнение с 44 960 за GB200. Това дава на Jalapeño предимство от приблизително 1,9 пъти. Цялостната латентност на заявката беше съответно 1,03 секунди срещу 1,80 секунди.
DeepSeek R1 показа още по-голяма разлика в латентността. Jalapeño завърши заявката за 1,65 секунди, докато GB300 се нуждаеше от 5,99 секунди. Пиковата пропускателна способност на единица мощност достигна 19 641 входни и изходни токена в секунда на киловат при Jalapeño и 11 781 при GB300. При Kimi K2.5 OpenAI измери приблизително 1,5 пъти по-висока пикова пропускателна способност на единица мощност и 3,4 пъти по-ниска обща латентност за Jalapeño.
Това са собствени измервания на OpenAI, а не резултати от независима лаборатория. Данните за енергийната ефективност също трябва да се разглеждат в контекста на методологията. OpenAI нормализира резултатите, използвайки публикуваната номинална мощност на ускорителите, вместо да измерва действителното потребление на енергия на всяка конкурентна система при идентични условия.
Чипът с мощност 700 W е консумирал не повече от 550 W при тестването
Jalapeño има номинална мощност от 700 W. Според OpenAI действителното потребление на енергия е останало на или под 550 W при тестваните натоварвания. За своите изчисления компанията е използвала публикуваната от NVIDIA номинална мощност от 1 200 W за GB200 и 1 400 W за GB300.
Извършената работа на единица мощност става все по-важна в големите AI центрове за данни. Електрическият капацитет, охлаждането и връзките с електропреносната мрежа могат да ограничат растежа на сървърните паркове също толкова, колкото и наличността на чипове. Ако от всеки киловат могат да се обслужват повече заявки, инфраструктурният разход за генериран токен или потребителска заявка намалява.
Архитектурата на Jalapeño е проектирана около различните етапи на инференцията на езиковите модели. Първоначалната обработка на входните данни, или prefill, е предимно изчислително интензивна. Генерирането на отговора токен по токен, или decode, зависи в по-голяма степен от честотната лента на паметта. Време се изразходва и за преместване на данни и състоянието на модела между чипове и изчислителни единици.
OpenAI е проектирала процесора, паметта, мрежовата свързаност и софтуера като единна интегрирана система, за да намали ненужното преместване на данни. Наред с други неща, архитектурата позволява KV кешът, използван при генерирането на отговори, да остава възможно най-локален.
AI е помогнал и при проектирането на самия чип
AI има пряка роля в разработването на Jalapeño. Според OpenAI екипът е преминал от първоначалния проект до tape-out за девет месеца. AI е използван за проучване на варианти за имплементация, оптимизиране на аритметични блокове и ускоряване на циклите по проверка и измерване.
По-късно екипът използва Codex заедно с GPT-Astra, за да оптимизира чипа за три модела с отворени тегла, които не са били част от първоначалния производствен план. Работата е отнела два месеца. В избрани GPT-OSS блокове за внимание и mixture-of-experts имплементациите, генерирани от AI, работят 1,5-1,8 пъти по-бързо от по-ранните версии, написани от експерти.
Има важно уточнение: това увеличение на производителността се отнася за избрани изчислителни блокове, а не за модела GPT-OSS като цяло.
Проблемът на NVIDIA все още не е Jalapeño, а тенденцията зад него
Един специализиран чип няма да промени пазара на AI хардуер за една нощ. Предимството на NVIDIA не се състои само в суровата изчислителна производителност на GB200 или GB300, а и в софтуерната екосистема CUDA, мрежовата свързаност, сървърната архитектура и възможността една и съща платформа да се използва за широк спектър от модели и натоварвания.
Значението на Jalapeño е другаде. OpenAI знае точно какви натоварвания генерират собствените ѝ услуги и може да оптимизира хардуера около тях. Google, Amazon и други големи облачни компании следват същата логика от години. Навлизането на OpenAI на пазара със собствен чип добавя допълнителен натиск AI изчисленията да станат по-евтини и по-енергийно ефективни.
OpenAI планира да внедри Jalapeño в собствената си изчислителна инфраструктура до края на 2026 г. Чип от второ поколение вече е в напреднала разработка, докато архитектурата на трето поколение започва да се оформя.
Енергийната ефективност е особено важна за Европа. Растежът на AI центровете за данни означава пряка конкуренция за електрически капацитет и връзки с електропреносната мрежа. Ако специализираните чипове за инференция действително могат да осигурят значително повече полезна работа на киловат, икономическото им въздействие може да се окаже по-важно от всяка отделна победа над NVIDIA в бенчмарк.