Reklaam
Fullscreen Image

Primul cip dezvoltat intern de OpenAI depășește NVIDIA la viteză și eficiență energetică

Autor auto.pub | Publicat la: 27.08.2026

OpenAI a publicat primele cifre detaliate de performanță pentru Jalapeño, primul său cip proiectat special pentru inferență AI. În testele proprii ale companiei pe trei modele lingvistice mari, cipul a oferit un debit maxim per unitate de putere de 1,5-1,9 ori mai mare și o latență end-to-end a interogărilor de 1,7-3,6 ori mai mică decât sistemele NVIDIA GB200 și GB300 folosite pentru comparație. Asta nu înseamnă că NVIDIA a fost detronată, dar arată de ce cele mai mari companii de AI vor tot mai mult să proiecteze mai mult hardware propriu.

Reklaam

Jalapeño nu concurează cu cipurile pentru antrenare

Acesta este primul cip de inferență dezvoltat intern de OpenAI, ceea ce înseamnă că a fost optimizat în principal pentru rularea modelelor care au fost deja antrenate, nu pentru antrenarea de la zero a unor noi modele mari. Compania va continua să utilizeze acceleratoare de la NVIDIA și alți parteneri atât pentru antrenare, cât și pentru inferență.

OpenAI a utilizat benchmark-ul public InferenceX și a testat trei modele: GPT-OSS 120B, DeepSeek R1 670B și Kimi K2.5 1T. GB200 și GB300 de la NVIDIA au fost utilizate ca sisteme de comparație.

Cu GPT-OSS 120B, Jalapeño a atins un debit maxim de 85.448 tokenuri de intrare și ieșire pe secundă per kilowatt, comparativ cu 44.960 pentru GB200. Acest lucru oferă lui Jalapeño un avantaj de aproximativ 1,9 ori. Latența end-to-end a interogării a fost de 1,03 secunde față de 1,80 secunde, respectiv.

DeepSeek R1 a produs un decalaj de latență și mai mare. Jalapeño a finalizat interogarea în 1,65 secunde, în timp ce GB300 a avut nevoie de 5,99 secunde. Debitul maxim per unitate de putere a ajuns la 19.641 tokenuri de intrare și ieșire pe secundă per kilowatt pe Jalapeño și la 11.781 pe GB300. Cu Kimi K2.5, OpenAI a măsurat pentru Jalapeño un debit maxim per unitate de putere de aproximativ 1,5 ori mai mare și o latență totală de 3,4 ori mai mică.

Acestea sunt măsurători proprii ale OpenAI, nu rezultate ale unui laborator independent. Cifrele privind eficiența energetică trebuie, de asemenea, interpretate în contextul metodologiei. OpenAI a normalizat rezultatele folosind puterea nominală publicată a acceleratoarelor, în loc să măsoare consumul real de energie al fiecărui sistem concurent în condiții identice.

Cipul de 700 W nu a consumat mai mult de 550 W în testare

Jalapeño are o putere nominală de 700 W. Potrivit OpenAI, consumul real de energie a rămas la 550 W sau mai puțin în sarcinile de lucru testate. Pentru calculele sale, compania a folosit puterea nominală publicată de NVIDIA, de 1.200 W pentru GB200 și 1.400 W pentru GB300.

Volumul de lucru realizat per unitate de putere devine tot mai important în centrele mari de date AI. Capacitatea electrică, răcirea și conexiunile la rețea pot limita creșterea fermelor de servere la fel de mult ca disponibilitatea cipurilor. Dacă pot fi deservite mai multe interogări din fiecare kilowatt, costul infrastructurii per token generat sau cerere a utilizatorului scade.

Arhitectura Jalapeño este proiectată în jurul diferitelor faze ale inferenței modelelor lingvistice. Procesarea inițială a intrării, sau prefill, necesită în principal calcule intensive. Generarea răspunsului token cu token, sau decode, depinde mai mult de lățimea de bandă a memoriei. Timpul este consumat și de mutarea datelor și a stării modelului între cipuri și unități de calcul.

OpenAI a proiectat procesorul, memoria, rețeaua și software-ul ca un singur sistem integrat, pentru a reduce mișcarea inutilă a datelor. Printre altele, arhitectura permite ca memoria cache KV utilizată în timpul generării răspunsului să rămână cât mai locală posibil.

AI a contribuit la proiectarea cipului propriu-zis

AI a jucat un rol direct în dezvoltarea Jalapeño. Potrivit OpenAI, echipa a trecut de la proiectarea inițială la tape-out în nouă luni. AI a fost utilizată pentru a explora opțiuni de implementare, a optimiza blocurile aritmetice și a accelera ciclurile de verificare și măsurare.

Ulterior, echipa a folosit Codex împreună cu GPT-Astra pentru a optimiza cipul pentru trei modele cu ponderi deschise care nu făceau parte din planul inițial de producție. Activitatea a durat două luni. În anumite blocuri de atenție și mixture-of-experts din GPT-OSS, implementările generate de AI au rulat de 1,5-1,8 ori mai rapid decât versiunile anterioare scrise de experți.

Există o precizare importantă: acest câștig de performanță se aplică unor blocuri de calcul selectate, nu modelului GPT-OSS în ansamblu.

Problema NVIDIA nu este încă Jalapeño, ci tendința din spatele acestuia

Un singur cip specializat nu va remodela peste noapte piața hardware-ului pentru AI. Avantajul NVIDIA nu constă doar în performanța brută de calcul a GB200 sau GB300, ci și în ecosistemul software CUDA, rețelistică, arhitectura serverelor și capacitatea de a utiliza aceeași platformă pentru o gamă largă de modele și sarcini de lucru.

Importanța Jalapeño se află în altă parte. OpenAI știe exact ce sarcini de lucru generează propriile sale servicii și poate optimiza hardware-ul în jurul acestora. Google, Amazon și alte mari companii de cloud au urmat aceeași logică de ani de zile. Intrarea OpenAI pe piață cu propriul cip adaugă presiune suplimentară pentru a face calculul AI mai ieftin și mai eficient energetic.

OpenAI intenționează să implementeze Jalapeño în propria infrastructură de calcul până la finalul lui 2026. Un cip de a doua generație se află deja într-un stadiu avansat de dezvoltare, în timp ce arhitectura unei a treia generații prinde contur.

Eficiența energetică este deosebit de importantă pentru Europa. Creșterea centrelor de date AI înseamnă concurență directă pentru capacitatea electrică și conexiunile la rețea. Dacă cipurile specializate pentru inferență pot oferi cu adevărat o cantitate substanțial mai mare de muncă utilă per kilowatt, impactul lor economic s-ar putea dovedi mai important decât orice victorie individuală într-un benchmark în fața NVIDIA.

Jalapeño nu concurează cu cipurile pentru antrenare

Acesta este primul cip de inferență dezvoltat intern de OpenAI, ceea ce înseamnă că a fost optimizat în principal pentru rularea modelelor care au fost deja antrenate, nu pentru antrenarea de la zero a unor noi modele mari. Compania va continua să utilizeze acceleratoare de la NVIDIA și alți parteneri atât pentru antrenare, cât și pentru inferență.

OpenAI a utilizat benchmark-ul public InferenceX și a testat trei modele: GPT-OSS 120B, DeepSeek R1 670B și Kimi K2.5 1T. GB200 și GB300 de la NVIDIA au fost utilizate ca sisteme de comparație.

Cu GPT-OSS 120B, Jalapeño a atins un debit maxim de 85.448 tokenuri de intrare și ieșire pe secundă per kilowatt, comparativ cu 44.960 pentru GB200. Acest lucru oferă lui Jalapeño un avantaj de aproximativ 1,9 ori. Latența end-to-end a interogării a fost de 1,03 secunde față de 1,80 secunde, respectiv.

DeepSeek R1 a produs un decalaj de latență și mai mare. Jalapeño a finalizat interogarea în 1,65 secunde, în timp ce GB300 a avut nevoie de 5,99 secunde. Debitul maxim per unitate de putere a ajuns la 19.641 tokenuri de intrare și ieșire pe secundă per kilowatt pe Jalapeño și la 11.781 pe GB300. Cu Kimi K2.5, OpenAI a măsurat pentru Jalapeño un debit maxim per unitate de putere de aproximativ 1,5 ori mai mare și o latență totală de 3,4 ori mai mică.

Acestea sunt măsurători proprii ale OpenAI, nu rezultate ale unui laborator independent. Cifrele privind eficiența energetică trebuie, de asemenea, interpretate în contextul metodologiei. OpenAI a normalizat rezultatele folosind puterea nominală publicată a acceleratoarelor, în loc să măsoare consumul real de energie al fiecărui sistem concurent în condiții identice.

Cipul de 700 W nu a consumat mai mult de 550 W în testare

Jalapeño are o putere nominală de 700 W. Potrivit OpenAI, consumul real de energie a rămas la 550 W sau mai puțin în sarcinile de lucru testate. Pentru calculele sale, compania a folosit puterea nominală publicată de NVIDIA, de 1.200 W pentru GB200 și 1.400 W pentru GB300.

Volumul de lucru realizat per unitate de putere devine tot mai important în centrele mari de date AI. Capacitatea electrică, răcirea și conexiunile la rețea pot limita creșterea fermelor de servere la fel de mult ca disponibilitatea cipurilor. Dacă pot fi deservite mai multe interogări din fiecare kilowatt, costul infrastructurii per token generat sau cerere a utilizatorului scade.

Arhitectura Jalapeño este proiectată în jurul diferitelor faze ale inferenței modelelor lingvistice. Procesarea inițială a intrării, sau prefill, necesită în principal calcule intensive. Generarea răspunsului token cu token, sau decode, depinde mai mult de lățimea de bandă a memoriei. Timpul este consumat și de mutarea datelor și a stării modelului între cipuri și unități de calcul.

OpenAI a proiectat procesorul, memoria, rețeaua și software-ul ca un singur sistem integrat, pentru a reduce mișcarea inutilă a datelor. Printre altele, arhitectura permite ca memoria cache KV utilizată în timpul generării răspunsului să rămână cât mai locală posibil.

AI a contribuit la proiectarea cipului propriu-zis

AI a jucat un rol direct în dezvoltarea Jalapeño. Potrivit OpenAI, echipa a trecut de la proiectarea inițială la tape-out în nouă luni. AI a fost utilizată pentru a explora opțiuni de implementare, a optimiza blocurile aritmetice și a accelera ciclurile de verificare și măsurare.

Ulterior, echipa a folosit Codex împreună cu GPT-Astra pentru a optimiza cipul pentru trei modele cu ponderi deschise care nu făceau parte din planul inițial de producție. Activitatea a durat două luni. În anumite blocuri de atenție și mixture-of-experts din GPT-OSS, implementările generate de AI au rulat de 1,5-1,8 ori mai rapid decât versiunile anterioare scrise de experți.

Există o precizare importantă: acest câștig de performanță se aplică unor blocuri de calcul selectate, nu modelului GPT-OSS în ansamblu.

Problema NVIDIA nu este încă Jalapeño, ci tendința din spatele acestuia

Un singur cip specializat nu va remodela peste noapte piața hardware-ului pentru AI. Avantajul NVIDIA nu constă doar în performanța brută de calcul a GB200 sau GB300, ci și în ecosistemul software CUDA, rețelistică, arhitectura serverelor și capacitatea de a utiliza aceeași platformă pentru o gamă largă de modele și sarcini de lucru.

Importanța Jalapeño se află în altă parte. OpenAI știe exact ce sarcini de lucru generează propriile sale servicii și poate optimiza hardware-ul în jurul acestora. Google, Amazon și alte mari companii de cloud au urmat aceeași logică de ani de zile. Intrarea OpenAI pe piață cu propriul cip adaugă presiune suplimentară pentru a face calculul AI mai ieftin și mai eficient energetic.

OpenAI intenționează să implementeze Jalapeño în propria infrastructură de calcul până la finalul lui 2026. Un cip de a doua generație se află deja într-un stadiu avansat de dezvoltare, în timp ce arhitectura unei a treia generații prinde contur.

Eficiența energetică este deosebit de importantă pentru Europa. Creșterea centrelor de date AI înseamnă concurență directă pentru capacitatea electrică și conexiunile la rețea. Dacă cipurile specializate pentru inferență pot oferi cu adevărat o cantitate substanțial mai mare de muncă utilă per kilowatt, impactul lor economic s-ar putea dovedi mai important decât orice victorie individuală într-un benchmark în fața NVIDIA.


Warning: is_file(): open_basedir restriction in effect. File(/var/www/clients/client0/web302/web/stats/track.php) is not within the allowed path(s): (/var/www/clients/client0/web302/private/autopub-int/:/var/www/clients/client0/web302/tmp/:/var/cache/int-auto-pub/root-cache/:/tmp:/usr/share/php:/dev/urandom:/dev/random) in /var/www/clients/client0/web302/private/autopub-int/ro/footer.php on line 6