Reklaam
Fullscreen Image

Pierwszy własny chip OpenAI przewyższa NVIDIA pod względem szybkości i efektywności energetycznej

Autor auto.pub | Opublikowano: 27.08.2026

OpenAI opublikowało pierwsze szczegółowe wyniki wydajności Jalapeño, swojego pierwszego chipa zaprojektowanego specjalnie do inferencji AI. W testach własnych firmy, obejmujących trzy duże modele językowe, chip zapewnił 1,5–1,9 raza wyższą szczytową przepustowość na jednostkę mocy oraz 1,7–3,6 raza niższe opóźnienie zapytań end-to-end niż wykorzystane do porównania systemy NVIDIA GB200 i GB300. Nie oznacza to, że NVIDIA została zdetronizowana, ale pokazuje, dlaczego największe firmy AI coraz częściej chcą projektować więcej własnego sprzętu.

Reklaam

Jalapeño nie konkuruje z chipami do trenowania

To pierwszy własny chip OpenAI do inferencji, co oznacza, że został zoptymalizowany przede wszystkim do uruchamiania modeli, które zostały już wytrenowane, a nie do trenowania od podstaw nowych dużych modeli. Firma będzie nadal korzystać z akceleratorów NVIDIA i innych partnerów zarówno do trenowania, jak i inferencji.

OpenAI wykorzystało publiczny benchmark InferenceX i przetestowało trzy modele: GPT-OSS 120B, DeepSeek R1 670B oraz Kimi K2.5 1T. Jako systemów porównawczych użyto NVIDIA GB200 i GB300.

W przypadku GPT-OSS 120B Jalapeño osiągnął szczytową przepustowość 85 448 tokenów wejściowych i wyjściowych na sekundę na kilowat, wobec 44 960 dla GB200. Daje to Jalapeño przewagę wynoszącą około 1,9 raza. Opóźnienie zapytania end-to-end wyniosło odpowiednio 1,03 sekundy wobec 1,80 sekundy.

DeepSeek R1 zapewnił jeszcze większą różnicę w opóźnieniach. Jalapeño ukończył zapytanie w 1,65 sekundy, podczas gdy GB300 potrzebował 5,99 sekundy. Szczytowa przepustowość na jednostkę mocy wyniosła 19 641 tokenów wejściowych i wyjściowych na sekundę na kilowat w przypadku Jalapeño oraz 11 781 w przypadku GB300. W przypadku Kimi K2.5 OpenAI zmierzyło dla Jalapeño około 1,5 raza wyższą szczytową przepustowość na jednostkę mocy oraz 3,4 raza niższe całkowite opóźnienie.

Są to własne pomiary OpenAI, a nie wyniki niezależnego laboratorium. Dane dotyczące efektywności energetycznej należy również interpretować w kontekście metodologii. OpenAI znormalizowało wyniki, wykorzystując opublikowaną moc znamionową akceleratorów, zamiast mierzyć rzeczywisty pobór mocy każdego konkurencyjnego systemu w identycznych warunkach.

Chip o mocy 700 W pobierał w testach nie więcej niż 550 W

Jalapeño ma moc znamionową 700 W. Według OpenAI rzeczywisty pobór mocy w testowanych obciążeniach pozostawał na poziomie 550 W lub niższym. W swoich obliczeniach firma wykorzystała opublikowaną przez NVIDIA moc znamionową 1 200 W dla GB200 oraz 1 400 W dla GB300.

Praca wykonana na jednostkę mocy staje się coraz ważniejsza w dużych centrach danych AI. Dostępna moc elektryczna, chłodzenie i przyłącza do sieci mogą ograniczać rozwój farm serwerowych w takim samym stopniu jak dostępność chipów. Jeśli z każdego kilowata można obsłużyć więcej zapytań, koszt infrastruktury przypadający na wygenerowany token lub żądanie użytkownika spada.

Architektura Jalapeño została zaprojektowana wokół różnych faz inferencji modeli językowych. Wstępne przetwarzanie danych wejściowych, czyli prefill, jest przede wszystkim intensywne obliczeniowo. Generowanie odpowiedzi token po tokenie, czyli decode, w większym stopniu zależy od przepustowości pamięci. Czas jest także zużywany na przenoszenie danych i stanu modelu między chipami oraz jednostkami obliczeniowymi.

OpenAI zaprojektowało procesor, pamięć, sieć i oprogramowanie jako jeden zintegrowany system, aby ograniczyć niepotrzebne przenoszenie danych. Między innymi architektura pozwala, by pamięć podręczna KV wykorzystywana podczas generowania odpowiedzi pozostawała możliwie lokalnie.

AI pomogła zaprojektować sam chip

AI odegrała bezpośrednią rolę w rozwoju Jalapeño. Według OpenAI zespół przeszedł od wstępnego projektu do tape-out w dziewięć miesięcy. AI wykorzystano do badania wariantów implementacji, optymalizacji bloków arytmetycznych oraz przyspieszania cykli weryfikacji i pomiarów.

Zespół wykorzystał później Codex wraz z GPT-Astra do optymalizacji chipa dla trzech modeli z otwartymi wagami, które nie były częścią pierwotnego planu produkcyjnego. Prace trwały dwa miesiące. W wybranych blokach attention i mixture-of-experts GPT-OSS implementacje wygenerowane przez AI działały 1,5–1,8 raza szybciej niż wcześniejsze wersje napisane przez ekspertów.

Istnieje ważne zastrzeżenie: ten wzrost wydajności dotyczy wybranych bloków obliczeniowych, a nie całego modelu GPT-OSS.

Problemem NVIDIA nie jest jeszcze Jalapeño, lecz trend, który za nim stoi

Jeden wyspecjalizowany chip nie zmieni rynku sprzętu AI z dnia na dzień. Przewaga NVIDIA wynika nie tylko z surowej wydajności obliczeniowej GB200 lub GB300, lecz także z ekosystemu oprogramowania CUDA, sieci, architektury serwerowej oraz możliwości korzystania z tej samej platformy w szerokim zakresie modeli i obciążeń.

Znaczenie Jalapeño leży gdzie indziej. OpenAI dokładnie wie, jakie obciążenia generują jego własne usługi, i może optymalizować wokół nich sprzęt. Google, Amazon i inne duże firmy chmurowe kierują się tą samą logiką od lat. Wejście OpenAI na rynek z własnym chipem wywiera dodatkową presję na obniżanie kosztów i zwiększanie efektywności energetycznej obliczeń AI.

OpenAI planuje wdrożyć Jalapeño we własnej infrastrukturze obliczeniowej do końca 2026 roku. Chip drugiej generacji jest już na zaawansowanym etapie rozwoju, a architektura trzeciej generacji nabiera kształtów.

Efektywność energetyczna jest szczególnie ważna dla Europy. Rozwój centrów danych AI oznacza bezpośrednią konkurencję o dostępną moc elektryczną i przyłącza do sieci. Jeśli wyspecjalizowane chipy do inferencji rzeczywiście mogą zapewnić znacznie więcej użytecznej pracy na kilowat, ich wpływ gospodarczy może okazać się ważniejszy niż pojedyncze zwycięstwo nad NVIDIA w benchmarku.

Jalapeño nie konkuruje z chipami do trenowania

To pierwszy własny chip OpenAI do inferencji, co oznacza, że został zoptymalizowany przede wszystkim do uruchamiania modeli, które zostały już wytrenowane, a nie do trenowania od podstaw nowych dużych modeli. Firma będzie nadal korzystać z akceleratorów NVIDIA i innych partnerów zarówno do trenowania, jak i inferencji.

OpenAI wykorzystało publiczny benchmark InferenceX i przetestowało trzy modele: GPT-OSS 120B, DeepSeek R1 670B oraz Kimi K2.5 1T. Jako systemów porównawczych użyto NVIDIA GB200 i GB300.

W przypadku GPT-OSS 120B Jalapeño osiągnął szczytową przepustowość 85 448 tokenów wejściowych i wyjściowych na sekundę na kilowat, wobec 44 960 dla GB200. Daje to Jalapeño przewagę wynoszącą około 1,9 raza. Opóźnienie zapytania end-to-end wyniosło odpowiednio 1,03 sekundy wobec 1,80 sekundy.

DeepSeek R1 zapewnił jeszcze większą różnicę w opóźnieniach. Jalapeño ukończył zapytanie w 1,65 sekundy, podczas gdy GB300 potrzebował 5,99 sekundy. Szczytowa przepustowość na jednostkę mocy wyniosła 19 641 tokenów wejściowych i wyjściowych na sekundę na kilowat w przypadku Jalapeño oraz 11 781 w przypadku GB300. W przypadku Kimi K2.5 OpenAI zmierzyło dla Jalapeño około 1,5 raza wyższą szczytową przepustowość na jednostkę mocy oraz 3,4 raza niższe całkowite opóźnienie.

Są to własne pomiary OpenAI, a nie wyniki niezależnego laboratorium. Dane dotyczące efektywności energetycznej należy również interpretować w kontekście metodologii. OpenAI znormalizowało wyniki, wykorzystując opublikowaną moc znamionową akceleratorów, zamiast mierzyć rzeczywisty pobór mocy każdego konkurencyjnego systemu w identycznych warunkach.

Chip o mocy 700 W pobierał w testach nie więcej niż 550 W

Jalapeño ma moc znamionową 700 W. Według OpenAI rzeczywisty pobór mocy w testowanych obciążeniach pozostawał na poziomie 550 W lub niższym. W swoich obliczeniach firma wykorzystała opublikowaną przez NVIDIA moc znamionową 1 200 W dla GB200 oraz 1 400 W dla GB300.

Praca wykonana na jednostkę mocy staje się coraz ważniejsza w dużych centrach danych AI. Dostępna moc elektryczna, chłodzenie i przyłącza do sieci mogą ograniczać rozwój farm serwerowych w takim samym stopniu jak dostępność chipów. Jeśli z każdego kilowata można obsłużyć więcej zapytań, koszt infrastruktury przypadający na wygenerowany token lub żądanie użytkownika spada.

Architektura Jalapeño została zaprojektowana wokół różnych faz inferencji modeli językowych. Wstępne przetwarzanie danych wejściowych, czyli prefill, jest przede wszystkim intensywne obliczeniowo. Generowanie odpowiedzi token po tokenie, czyli decode, w większym stopniu zależy od przepustowości pamięci. Czas jest także zużywany na przenoszenie danych i stanu modelu między chipami oraz jednostkami obliczeniowymi.

OpenAI zaprojektowało procesor, pamięć, sieć i oprogramowanie jako jeden zintegrowany system, aby ograniczyć niepotrzebne przenoszenie danych. Między innymi architektura pozwala, by pamięć podręczna KV wykorzystywana podczas generowania odpowiedzi pozostawała możliwie lokalnie.

AI pomogła zaprojektować sam chip

AI odegrała bezpośrednią rolę w rozwoju Jalapeño. Według OpenAI zespół przeszedł od wstępnego projektu do tape-out w dziewięć miesięcy. AI wykorzystano do badania wariantów implementacji, optymalizacji bloków arytmetycznych oraz przyspieszania cykli weryfikacji i pomiarów.

Zespół wykorzystał później Codex wraz z GPT-Astra do optymalizacji chipa dla trzech modeli z otwartymi wagami, które nie były częścią pierwotnego planu produkcyjnego. Prace trwały dwa miesiące. W wybranych blokach attention i mixture-of-experts GPT-OSS implementacje wygenerowane przez AI działały 1,5–1,8 raza szybciej niż wcześniejsze wersje napisane przez ekspertów.

Istnieje ważne zastrzeżenie: ten wzrost wydajności dotyczy wybranych bloków obliczeniowych, a nie całego modelu GPT-OSS.

Problemem NVIDIA nie jest jeszcze Jalapeño, lecz trend, który za nim stoi

Jeden wyspecjalizowany chip nie zmieni rynku sprzętu AI z dnia na dzień. Przewaga NVIDIA wynika nie tylko z surowej wydajności obliczeniowej GB200 lub GB300, lecz także z ekosystemu oprogramowania CUDA, sieci, architektury serwerowej oraz możliwości korzystania z tej samej platformy w szerokim zakresie modeli i obciążeń.

Znaczenie Jalapeño leży gdzie indziej. OpenAI dokładnie wie, jakie obciążenia generują jego własne usługi, i może optymalizować wokół nich sprzęt. Google, Amazon i inne duże firmy chmurowe kierują się tą samą logiką od lat. Wejście OpenAI na rynek z własnym chipem wywiera dodatkową presję na obniżanie kosztów i zwiększanie efektywności energetycznej obliczeń AI.

OpenAI planuje wdrożyć Jalapeño we własnej infrastrukturze obliczeniowej do końca 2026 roku. Chip drugiej generacji jest już na zaawansowanym etapie rozwoju, a architektura trzeciej generacji nabiera kształtów.

Efektywność energetyczna jest szczególnie ważna dla Europy. Rozwój centrów danych AI oznacza bezpośrednią konkurencję o dostępną moc elektryczną i przyłącza do sieci. Jeśli wyspecjalizowane chipy do inferencji rzeczywiście mogą zapewnić znacznie więcej użytecznej pracy na kilowat, ich wpływ gospodarczy może okazać się ważniejszy niż pojedyncze zwycięstwo nad NVIDIA w benchmarku.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/pl/footer.php on line 6