Reklaam
Fullscreen Image

Первый собственный чип OpenAI превосходит NVIDIA по скорости и энергоэффективности

Автор auto.pub | Опубликовано: 27.08.2026

OpenAI опубликовала первые подробные показатели производительности Jalapeño — своего первого чипа, разработанного специально для ИИ-инференса. В собственных тестах компании на трёх больших языковых моделях чип обеспечил в 1,5–1,9 раза более высокую пиковую пропускную способность на единицу мощности и в 1,7–3,6 раза меньшую сквозную задержку запросов по сравнению с системами NVIDIA GB200 и GB300, использованными для сопоставления. Это не означает, что NVIDIA свергнута с трона, но показывает, почему крупнейшие ИИ-компании всё чаще хотят разрабатывать больше собственного оборудования.

Reklaam

Jalapeño не конкурирует с чипами для обучения

Это первый собственный чип OpenAI для инференса, то есть он оптимизирован прежде всего для запуска уже обученных моделей, а не для обучения новых крупных моделей с нуля. Компания продолжит использовать ускорители NVIDIA и других партнёров как для обучения, так и для инференса.

OpenAI использовала публичный бенчмарк InferenceX и протестировала три модели: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В качестве систем для сравнения использовались NVIDIA GB200 и GB300.

С GPT-OSS 120B Jalapeño достиг пиковой пропускной способности 85 448 входных и выходных токенов в секунду на киловатт против 44 960 у GB200. Это даёт Jalapeño преимущество примерно в 1,9 раза. Сквозная задержка запроса составила 1,03 секунды против 1,80 секунды соответственно.

DeepSeek R1 показала ещё больший разрыв по задержке. Jalapeño выполнил запрос за 1,65 секунды, тогда как GB300 потребовалось 5,99 секунды. Пиковая пропускная способность на единицу мощности достигла 19 641 входного и выходного токена в секунду на киловатт у Jalapeño и 11 781 у GB300. С Kimi K2.5 OpenAI измерила примерно в 1,5 раза более высокую пиковую пропускную способность на единицу мощности и в 3,4 раза меньшую общую задержку у Jalapeño.

Это собственные измерения OpenAI, а не результаты независимой лаборатории. Показатели энергоэффективности также следует рассматривать в контексте методологии. OpenAI нормализовала результаты с использованием опубликованной номинальной мощности ускорителей, а не измеряла фактическое энергопотребление каждой конкурирующей системы в идентичных условиях.

Чип мощностью 700 W в тестах потреблял не более 550 W

Номинальная мощность Jalapeño составляет 700 W. По данным OpenAI, фактическое энергопотребление в протестированных нагрузках оставалось на уровне 550 W или ниже. Для расчётов компания использовала опубликованную NVIDIA номинальную мощность 1 200 W для GB200 и 1 400 W для GB300.

Объём работы, выполняемой на единицу мощности, становится всё важнее в крупных ИИ-центрах обработки данных. Электрические мощности, охлаждение и подключения к энергосети могут ограничивать рост серверных ферм не меньше, чем доступность чипов. Если с каждого киловатта можно обслуживать больше запросов, инфраструктурные затраты на один сгенерированный токен или пользовательский запрос снижаются.

Архитектура Jalapeño разработана с учётом различных фаз инференса языковых моделей. Первоначальная обработка входных данных, или prefill, в первую очередь требовательна к вычислениям. Генерация ответа токен за токеном, или decode, сильнее зависит от пропускной способности памяти. Время также расходуется на перемещение данных и состояния модели между чипами и вычислительными блоками.

OpenAI разработала процессор, память, сетевую инфраструктуру и программное обеспечение как единую интегрированную систему, чтобы сократить ненужное перемещение данных. Помимо прочего, архитектура позволяет кешу KV, используемому при генерации ответа, оставаться максимально локальным.

ИИ помог разработать сам чип

ИИ сыграл непосредственную роль в разработке Jalapeño. По данным OpenAI, команда прошла путь от первоначального проекта до tape-out за девять месяцев. ИИ использовался для изучения вариантов реализации, оптимизации арифметических блоков и ускорения циклов верификации и измерений.

Позже команда использовала Codex вместе с GPT-Astra для оптимизации чипа под три модели с открытыми весами, которые не входили в первоначальный производственный план. Эта работа заняла два месяца. В отдельных блоках внимания и mixture-of-experts GPT-OSS реализации, сгенерированные ИИ, работали в 1,5–1,8 раза быстрее, чем более ранние версии, написанные экспертами.

Есть важная оговорка: этот прирост производительности относится к выбранным вычислительным блокам, а не к модели GPT-OSS в целом.

Проблема NVIDIA пока не в Jalapeño, а в тенденции, стоящей за ним

Один специализированный чип не изменит рынок ИИ-оборудования за одну ночь. Преимущество NVIDIA заключается не только в чистой вычислительной производительности GB200 или GB300, но и в программной экосистеме CUDA, сетевой инфраструктуре, серверной архитектуре и возможности использовать одну платформу для широкого спектра моделей и нагрузок.

Значение Jalapeño заключается в другом. OpenAI точно знает, какие нагрузки создают её собственные сервисы, и может оптимизировать оборудование под них. Google, Amazon и другие крупные облачные компании следуют той же логике уже много лет. Выход OpenAI на рынок со своим чипом усиливает давление, направленное на удешевление и повышение энергоэффективности ИИ-вычислений.

OpenAI планирует развернуть Jalapeño в собственной вычислительной инфраструктуре к концу 2026 года. Чип второго поколения уже находится на продвинутой стадии разработки, а архитектура третьего поколения обретает форму.

Энергоэффективность особенно важна для Европы. Рост ИИ-центров обработки данных означает прямую конкуренцию за электрические мощности и подключения к энергосети. Если специализированные чипы для инференса действительно способны выполнять значительно больше полезной работы на киловатт, их экономическое влияние может оказаться важнее любой отдельной победы над NVIDIA в бенчмарке.

Jalapeño не конкурирует с чипами для обучения

Это первый собственный чип OpenAI для инференса, то есть он оптимизирован прежде всего для запуска уже обученных моделей, а не для обучения новых крупных моделей с нуля. Компания продолжит использовать ускорители NVIDIA и других партнёров как для обучения, так и для инференса.

OpenAI использовала публичный бенчмарк InferenceX и протестировала три модели: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. В качестве систем для сравнения использовались NVIDIA GB200 и GB300.

С GPT-OSS 120B Jalapeño достиг пиковой пропускной способности 85 448 входных и выходных токенов в секунду на киловатт против 44 960 у GB200. Это даёт Jalapeño преимущество примерно в 1,9 раза. Сквозная задержка запроса составила 1,03 секунды против 1,80 секунды соответственно.

DeepSeek R1 показала ещё больший разрыв по задержке. Jalapeño выполнил запрос за 1,65 секунды, тогда как GB300 потребовалось 5,99 секунды. Пиковая пропускная способность на единицу мощности достигла 19 641 входного и выходного токена в секунду на киловатт у Jalapeño и 11 781 у GB300. С Kimi K2.5 OpenAI измерила примерно в 1,5 раза более высокую пиковую пропускную способность на единицу мощности и в 3,4 раза меньшую общую задержку у Jalapeño.

Это собственные измерения OpenAI, а не результаты независимой лаборатории. Показатели энергоэффективности также следует рассматривать в контексте методологии. OpenAI нормализовала результаты с использованием опубликованной номинальной мощности ускорителей, а не измеряла фактическое энергопотребление каждой конкурирующей системы в идентичных условиях.

Чип мощностью 700 W в тестах потреблял не более 550 W

Номинальная мощность Jalapeño составляет 700 W. По данным OpenAI, фактическое энергопотребление в протестированных нагрузках оставалось на уровне 550 W или ниже. Для расчётов компания использовала опубликованную NVIDIA номинальную мощность 1 200 W для GB200 и 1 400 W для GB300.

Объём работы, выполняемой на единицу мощности, становится всё важнее в крупных ИИ-центрах обработки данных. Электрические мощности, охлаждение и подключения к энергосети могут ограничивать рост серверных ферм не меньше, чем доступность чипов. Если с каждого киловатта можно обслуживать больше запросов, инфраструктурные затраты на один сгенерированный токен или пользовательский запрос снижаются.

Архитектура Jalapeño разработана с учётом различных фаз инференса языковых моделей. Первоначальная обработка входных данных, или prefill, в первую очередь требовательна к вычислениям. Генерация ответа токен за токеном, или decode, сильнее зависит от пропускной способности памяти. Время также расходуется на перемещение данных и состояния модели между чипами и вычислительными блоками.

OpenAI разработала процессор, память, сетевую инфраструктуру и программное обеспечение как единую интегрированную систему, чтобы сократить ненужное перемещение данных. Помимо прочего, архитектура позволяет кешу KV, используемому при генерации ответа, оставаться максимально локальным.

ИИ помог разработать сам чип

ИИ сыграл непосредственную роль в разработке Jalapeño. По данным OpenAI, команда прошла путь от первоначального проекта до tape-out за девять месяцев. ИИ использовался для изучения вариантов реализации, оптимизации арифметических блоков и ускорения циклов верификации и измерений.

Позже команда использовала Codex вместе с GPT-Astra для оптимизации чипа под три модели с открытыми весами, которые не входили в первоначальный производственный план. Эта работа заняла два месяца. В отдельных блоках внимания и mixture-of-experts GPT-OSS реализации, сгенерированные ИИ, работали в 1,5–1,8 раза быстрее, чем более ранние версии, написанные экспертами.

Есть важная оговорка: этот прирост производительности относится к выбранным вычислительным блокам, а не к модели GPT-OSS в целом.

Проблема NVIDIA пока не в Jalapeño, а в тенденции, стоящей за ним

Один специализированный чип не изменит рынок ИИ-оборудования за одну ночь. Преимущество NVIDIA заключается не только в чистой вычислительной производительности GB200 или GB300, но и в программной экосистеме CUDA, сетевой инфраструктуре, серверной архитектуре и возможности использовать одну платформу для широкого спектра моделей и нагрузок.

Значение Jalapeño заключается в другом. OpenAI точно знает, какие нагрузки создают её собственные сервисы, и может оптимизировать оборудование под них. Google, Amazon и другие крупные облачные компании следуют той же логике уже много лет. Выход OpenAI на рынок со своим чипом усиливает давление, направленное на удешевление и повышение энергоэффективности ИИ-вычислений.

OpenAI планирует развернуть Jalapeño в собственной вычислительной инфраструктуре к концу 2026 года. Чип второго поколения уже находится на продвинутой стадии разработки, а архитектура третьего поколения обретает форму.

Энергоэффективность особенно важна для Европы. Рост ИИ-центров обработки данных означает прямую конкуренцию за электрические мощности и подключения к энергосети. Если специализированные чипы для инференса действительно способны выполнять значительно больше полезной работы на киловатт, их экономическое влияние может оказаться важнее любой отдельной победы над NVIDIA в бенчмарке.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/ru/footer.php on line 6