OpenAI’nin ilk şirket içi çipi, hız ve enerji verimliliğinde NVIDIA’yı geride bırakıyor
OpenAI, özellikle yapay zekâ çıkarımı için tasarlanan ilk çipi Jalapeño’ya ait ilk ayrıntılı performans verilerini yayımladı. Şirketin üç büyük dil modeli üzerinde gerçekleştirdiği kendi testlerinde çip, karşılaştırma için kullanılan NVIDIA GB200 ve GB300 sistemlerine kıyasla birim güç başına 1,5-1,9 kat daha yüksek tepe verim ve uçtan uca sorgu gecikmesinde 1,7-3,6 kat düşüş sağladı. Bu, NVIDIA’nın tahtından indirildiği anlamına gelmiyor, ancak en büyük yapay zekâ şirketlerinin neden kendi donanımlarının daha fazlasını tasarlamak istediğini gösteriyor.
Jalapeño, eğitim çipleriyle rekabet etmiyor
Bu, OpenAI’nin ilk şirket içi çıkarım çipi; yani sıfırdan yeni büyük modeller eğitmekten ziyade, önceden eğitilmiş modelleri çalıştırmak için öncelikli olarak optimize edildi. Şirket, hem eğitim hem de çıkarım için NVIDIA ve diğer ortaklarının hızlandırıcılarını kullanmaya devam edecek.
OpenAI, herkese açık InferenceX karşılaştırmasını kullandı ve üç modeli test etti: GPT-OSS 120B, DeepSeek R1 670B ve Kimi K2.5 1T. NVIDIA’nın GB200 ve GB300’ü karşılaştırma sistemleri olarak kullanıldı.
GPT-OSS 120B ile Jalapeño, GB200’ün 44.960 değerine kıyasla kilovat başına saniyede 85.448 giriş ve çıkış tokenı tepe verimine ulaştı. Bu, Jalapeño’ya yaklaşık 1,9 kat avantaj sağlıyor. Uçtan uca sorgu gecikmesi ise sırasıyla 1,03 saniyeye karşı 1,80 saniye oldu.
DeepSeek R1 daha da büyük bir gecikme farkı ortaya koydu. Jalapeño sorguyu 1,65 saniyede tamamlarken, GB300 5,99 saniye gerektirdi. Birim güç başına tepe verim, Jalapeño’da kilovat başına saniyede 19.641 giriş ve çıkış tokenına, GB300’de ise 11.781’e ulaştı. Kimi K2.5 ile OpenAI, Jalapeño için birim güç başına yaklaşık 1,5 kat daha yüksek tepe verim ve 3,4 kat daha düşük toplam gecikme ölçtü.
Bunlar, bağımsız bir laboratuvarın sonuçları değil, OpenAI’nin kendi ölçümleridir. Enerji verimliliği rakamlarının da metodoloji bağlamında değerlendirilmesi gerekiyor. OpenAI, her bir rakip sistemin gerçek güç tüketimini aynı koşullar altında ölçmek yerine, sonuçları hızlandırıcıların yayımlanmış nominal gücünü kullanarak normalize etti.
700 W çip, testlerde 550 W’tan fazla çekmedi
Jalapeño’nun nominal gücü 700 W. OpenAI’ye göre, test edilen iş yüklerinde gerçek güç tüketimi 550 W veya altında kaldı. Şirket, hesaplamalarında NVIDIA’nın GB200 için yayımladığı 1.200 W ve GB300 için 1.400 W nominal güç değerlerini kullandı.
Birim güç başına sunulan iş miktarı, büyük yapay zekâ veri merkezlerinde giderek daha önemli hâle geliyor. Elektrik kapasitesi, soğutma ve şebeke bağlantıları, sunucu çiftliklerinin büyümesini çip bulunabilirliği kadar sınırlayabilir. Her kilovattan daha fazla sorgu sunulabilirse, üretilen token veya kullanıcı isteği başına altyapı maliyeti düşer.
Jalapeño’nun mimarisi, dil modeli çıkarımının farklı aşamaları etrafında tasarlandı. İlk girdi işleme, yani prefill, öncelikle yoğun hesaplama gerektirir. Yanıtın token token üretilmesi, yani decode, daha çok bellek bant genişliğine bağlıdır. Verilerin ve model durumunun çipler ile hesaplama birimleri arasında taşınması da zaman tüketir.
OpenAI, gereksiz veri hareketini azaltmak amacıyla işlemciyi, belleği, ağı ve yazılımı tek bir entegre sistem olarak tasarladı. Mimarinin diğer özelliklerinin yanı sıra, yanıt üretimi sırasında kullanılan KV önbelleğinin mümkün olduğunca yerel kalmasına olanak tanıyor.
Çipin tasarımında yapay zekâ da yardımcı oldu
Yapay zekâ, Jalapeño’nun geliştirilmesinde doğrudan rol oynadı. OpenAI’ye göre ekip, ilk tasarımdan tape-out aşamasına dokuz ayda geçti. Yapay zekâ, uygulama seçeneklerini keşfetmek, aritmetik blokları optimize etmek ve doğrulama ile ölçüm döngülerini hızlandırmak için kullanıldı.
Ekip daha sonra, başlangıçtaki üretim planının parçası olmayan üç açık ağırlıklı model için çipi optimize etmek üzere Codex’i GPT-Astra ile birlikte kullandı. Çalışma iki ay sürdü. Seçilmiş GPT-OSS attention ve mixture-of-experts bloklarında, yapay zekâ tarafından üretilen uygulamalar, önceki uzmanlar tarafından yazılmış sürümlerden 1,5-1,8 kat daha hızlı çalıştı.
Önemli bir uyarı var: bu performans artışı, GPT-OSS modelinin tamamı için değil, seçilmiş hesaplama blokları için geçerlidir.
NVIDIA’nın sorunu henüz Jalapeño değil, arkasındaki eğilim
Tek bir özel amaçlı çip, yapay zekâ donanımı pazarını bir gecede yeniden şekillendirmeyecek. NVIDIA’nın avantajı yalnızca GB200 veya GB300’ün ham hesaplama performansında değil; CUDA yazılım ekosisteminde, ağda, sunucu mimarisinde ve aynı platformu geniş bir model ve iş yükü yelpazesinde kullanabilme yeteneğinde de yatıyor.
Jalapeño’nun önemi başka bir yerde. OpenAI, kendi hizmetlerinin tam olarak hangi iş yüklerini ürettiğini biliyor ve donanımı bunlara göre optimize edebiliyor. Google, Amazon ve diğer büyük bulut şirketleri yıllardır aynı mantığı izliyor. OpenAI’nin kendi çipiyle pazara girmesi, yapay zekâ hesaplamasını daha ucuz ve daha enerji verimli hâle getirme yönündeki baskıyı artırıyor.
OpenAI, Jalapeño’yu 2026 sonuna kadar kendi hesaplama altyapısında devreye almayı planlıyor. İkinci nesil bir çip hâlihazırda geliştirme sürecinin ileri aşamalarında bulunurken, üçüncü neslin mimarisi şekilleniyor.
Enerji verimliliği Avrupa için özellikle önemli. Yapay zekâ veri merkezlerinin büyümesi, elektrik kapasitesi ve şebeke bağlantıları için doğrudan rekabet anlamına geliyor. Özel amaçlı çıkarım çipleri gerçekten kilovat başına önemli ölçüde daha fazla faydalı iş sunabilirse, ekonomik etkileri NVIDIA karşısındaki tek bir karşılaştırma zaferinden daha önemli olabilir.
Jalapeño, eğitim çipleriyle rekabet etmiyor
Bu, OpenAI’nin ilk şirket içi çıkarım çipi; yani sıfırdan yeni büyük modeller eğitmekten ziyade, önceden eğitilmiş modelleri çalıştırmak için öncelikli olarak optimize edildi. Şirket, hem eğitim hem de çıkarım için NVIDIA ve diğer ortaklarının hızlandırıcılarını kullanmaya devam edecek.
OpenAI, herkese açık InferenceX karşılaştırmasını kullandı ve üç modeli test etti: GPT-OSS 120B, DeepSeek R1 670B ve Kimi K2.5 1T. NVIDIA’nın GB200 ve GB300’ü karşılaştırma sistemleri olarak kullanıldı.
GPT-OSS 120B ile Jalapeño, GB200’ün 44.960 değerine kıyasla kilovat başına saniyede 85.448 giriş ve çıkış tokenı tepe verimine ulaştı. Bu, Jalapeño’ya yaklaşık 1,9 kat avantaj sağlıyor. Uçtan uca sorgu gecikmesi ise sırasıyla 1,03 saniyeye karşı 1,80 saniye oldu.
DeepSeek R1 daha da büyük bir gecikme farkı ortaya koydu. Jalapeño sorguyu 1,65 saniyede tamamlarken, GB300 5,99 saniye gerektirdi. Birim güç başına tepe verim, Jalapeño’da kilovat başına saniyede 19.641 giriş ve çıkış tokenına, GB300’de ise 11.781’e ulaştı. Kimi K2.5 ile OpenAI, Jalapeño için birim güç başına yaklaşık 1,5 kat daha yüksek tepe verim ve 3,4 kat daha düşük toplam gecikme ölçtü.
Bunlar, bağımsız bir laboratuvarın sonuçları değil, OpenAI’nin kendi ölçümleridir. Enerji verimliliği rakamlarının da metodoloji bağlamında değerlendirilmesi gerekiyor. OpenAI, her bir rakip sistemin gerçek güç tüketimini aynı koşullar altında ölçmek yerine, sonuçları hızlandırıcıların yayımlanmış nominal gücünü kullanarak normalize etti.
700 W çip, testlerde 550 W’tan fazla çekmedi
Jalapeño’nun nominal gücü 700 W. OpenAI’ye göre, test edilen iş yüklerinde gerçek güç tüketimi 550 W veya altında kaldı. Şirket, hesaplamalarında NVIDIA’nın GB200 için yayımladığı 1.200 W ve GB300 için 1.400 W nominal güç değerlerini kullandı.
Birim güç başına sunulan iş miktarı, büyük yapay zekâ veri merkezlerinde giderek daha önemli hâle geliyor. Elektrik kapasitesi, soğutma ve şebeke bağlantıları, sunucu çiftliklerinin büyümesini çip bulunabilirliği kadar sınırlayabilir. Her kilovattan daha fazla sorgu sunulabilirse, üretilen token veya kullanıcı isteği başına altyapı maliyeti düşer.
Jalapeño’nun mimarisi, dil modeli çıkarımının farklı aşamaları etrafında tasarlandı. İlk girdi işleme, yani prefill, öncelikle yoğun hesaplama gerektirir. Yanıtın token token üretilmesi, yani decode, daha çok bellek bant genişliğine bağlıdır. Verilerin ve model durumunun çipler ile hesaplama birimleri arasında taşınması da zaman tüketir.
OpenAI, gereksiz veri hareketini azaltmak amacıyla işlemciyi, belleği, ağı ve yazılımı tek bir entegre sistem olarak tasarladı. Mimarinin diğer özelliklerinin yanı sıra, yanıt üretimi sırasında kullanılan KV önbelleğinin mümkün olduğunca yerel kalmasına olanak tanıyor.
Çipin tasarımında yapay zekâ da yardımcı oldu
Yapay zekâ, Jalapeño’nun geliştirilmesinde doğrudan rol oynadı. OpenAI’ye göre ekip, ilk tasarımdan tape-out aşamasına dokuz ayda geçti. Yapay zekâ, uygulama seçeneklerini keşfetmek, aritmetik blokları optimize etmek ve doğrulama ile ölçüm döngülerini hızlandırmak için kullanıldı.
Ekip daha sonra, başlangıçtaki üretim planının parçası olmayan üç açık ağırlıklı model için çipi optimize etmek üzere Codex’i GPT-Astra ile birlikte kullandı. Çalışma iki ay sürdü. Seçilmiş GPT-OSS attention ve mixture-of-experts bloklarında, yapay zekâ tarafından üretilen uygulamalar, önceki uzmanlar tarafından yazılmış sürümlerden 1,5-1,8 kat daha hızlı çalıştı.
Önemli bir uyarı var: bu performans artışı, GPT-OSS modelinin tamamı için değil, seçilmiş hesaplama blokları için geçerlidir.
NVIDIA’nın sorunu henüz Jalapeño değil, arkasındaki eğilim
Tek bir özel amaçlı çip, yapay zekâ donanımı pazarını bir gecede yeniden şekillendirmeyecek. NVIDIA’nın avantajı yalnızca GB200 veya GB300’ün ham hesaplama performansında değil; CUDA yazılım ekosisteminde, ağda, sunucu mimarisinde ve aynı platformu geniş bir model ve iş yükü yelpazesinde kullanabilme yeteneğinde de yatıyor.
Jalapeño’nun önemi başka bir yerde. OpenAI, kendi hizmetlerinin tam olarak hangi iş yüklerini ürettiğini biliyor ve donanımı bunlara göre optimize edebiliyor. Google, Amazon ve diğer büyük bulut şirketleri yıllardır aynı mantığı izliyor. OpenAI’nin kendi çipiyle pazara girmesi, yapay zekâ hesaplamasını daha ucuz ve daha enerji verimli hâle getirme yönündeki baskıyı artırıyor.
OpenAI, Jalapeño’yu 2026 sonuna kadar kendi hesaplama altyapısında devreye almayı planlıyor. İkinci nesil bir çip hâlihazırda geliştirme sürecinin ileri aşamalarında bulunurken, üçüncü neslin mimarisi şekilleniyor.
Enerji verimliliği Avrupa için özellikle önemli. Yapay zekâ veri merkezlerinin büyümesi, elektrik kapasitesi ve şebeke bağlantıları için doğrudan rekabet anlamına geliyor. Özel amaçlı çıkarım çipleri gerçekten kilovat başına önemli ölçüde daha fazla faydalı iş sunabilirse, ekonomik etkileri NVIDIA karşısındaki tek bir karşılaştırma zaferinden daha önemli olabilir.