NVIDIA Vera Rubin, Blackwell sonrası geliştirilen yeni nesil yapay zeka hızlandırıcı mimarisidir. Rubin GPU, Vera CPU, HBM4 bellek ve NVLink 6 ile birleşik bir hesaplama platformu sunar. Modern yapay zeka sistemlerinin ihtiyaçlarına yanıt veren yenilikler, büyük ölçekli model eğitimi ve inference süreçlerini önemli ölçüde hızlandırır.
NVIDIA Rubin, Blackwell sonrası ortaya çıkan yeni nesil yapay zeka hızlandırıcı mimarisidir ve şirket bu kez sadece tek bir GPU'ya değil, kapsamlı bir hesaplama platformuna odaklanıyor. NVIDIA Vera Rubin mimarisi, grafik hızlandırıcıları, yeni Vera sunucu işlemcisi, yüksek hızlı bellek ve ağ bileşenlerini büyük ölçekli yapay sinir ağlarının eğitimi ve çalıştırılması için birleşik bir sistemde bir araya getiriyor.
Platformun ana amacı, modern yapay zeka sistemlerinin hızla büyüyen hesaplama yükünü karşılamaktır. Reasoning (akıl yürütme) modeli devasa miktarda token üretir, uzun bağlamlarla çalışır ve otonom AI ajanları tek bir görevde yüzlerce adım ardışık işlem gerçekleştirebilir. Bu senaryolarda artık tek bir güçlü GPU'nun performansı yeterli değildir; bellek hızı, hızlandırıcılar arası veri transferi ve tüm veri merkezi verimliliği kritik hale gelir.
Bunun için Rubin, NVIDIA'nın Grace Hopper'dan başlayıp Blackwell ile devam ettirdiği yaklaşımın bir sonraki aşaması olarak görülebilir. Şirket, onlarca GPU ve CPU'nun tek bir birleşik sistem gibi çalıştığı bir sunucu rafını büyük bir hesaplama kompleksi haline getiriyor.
Vera Rubin ismi tek bir işlemciye değil, Rubin mimarisi etrafında inşa edilmiş NVIDIA teknolojileri ve sistemleri ailesine işaret eder. Temelde Rubin GPU ve sunucu sınıfı Vera CPU yer alır; ayrıca NVLink 6 Switch, ConnectX-9 SuperNIC, BlueField-4 DPU ve Spectrum-6 ağ bileşenleri entegre edilmiştir. NVIDIA, hesaplama, bellek ve veri transferi arasındaki darboğazları azaltmak için bu unsurları birlikte tasarlar.
Platformun merkezi ürünü Vera Rubin NVL72 sunucu sistemidir. Tek bir rafta 72 Rubin GPU ve 36 Vera CPU bir aradadır. Hızlandırıcılar NVLink 6 ile bağlıdır, böylece yazılım onları ayrı ekran kartlarından ziyade büyük, ortak bir hesaplama kaynağı olarak kullanabilir.
Bu yaklaşım, yüz milyarlarca ve trilyonlarca parametreye sahip modern sinir ağlarının verimli yönetimi için kritiktir. Model, onlarca hatta binlerce GPU'ya dağıtılır ve hızlandırıcılar arası iletişim hızı doğrudan nihai performansı belirler.
| Özellik | NVIDIA Blackwell | NVIDIA Rubin |
|---|---|---|
| GPU | Blackwell | Rubin |
| GPU Transistör | 208 milyar | 336 milyar |
| Bellek | HBM3E | HBM4 |
| Bellek Bant Genişliği | 8 TB/sn'ye kadar | 22 TB/sn'ye kadar |
| NVFP4 inference | 10 PFLOPS'a kadar | 50 PFLOPS'a kadar |
| Sunucu CPU | Grace | Vera |
| NVLink | 5. nesil | 6. nesil |
| NVLink (bir GPU) | 1,8 TB/sn | 3,6 TB/sn |
| NVLink (NVL72) | 130 TB/sn | 260 TB/sn |
| Ana vurgu | AI eğitimi ve çıkarım | Agentic AI, reasoning, uzun bağlam ve ölçekli çıkarım |
Veriler sunucu hızlandırıcıları ve platformlar için geçerlidir; hesaplama performansı, veri biçimi ve konfigürasyona bağlı olarak değişir.
Yeni Rubin GPU, büyük ölçekli yapay zeka model eğitimi ve çıkarımı için tasarlandı. 336 milyar transistör, 224 akışlı çoklu işlemci ve 896 Tensor Core içerir. Karşılaştırma için, Blackwell yaklaşık 208 milyar transistöre sahipti; bu, bellek ve bağlantı güncellemeleri hariç bile ciddi bir artış anlamına gelir.
Rubin, tek bir pakette NV-HBI yüksek hızlı arayüzle bağlanan iki büyük hesaplama kalıbı kullanır. Bu, NVIDIA'nın devasa GPU'lar üretmesini sağlar ve monolitik tek bir kalıp yerine daha esnek bir tasarıma olanak tanır.
En önemli güncellemelerden biri, üçüncü nesil Transformer Engine'dir. Bu motor, modern transformer modellerinde sıkça kullanılan işlemleri ve düşük hassasiyetli hesaplamaları (NVFP4 dahil) destekler. Rubin GPU, çıkarımda 50 PFLOPS, eğitimde 35 PFLOPS NVFP4 performansı sunar. Bu değerler, oyun ekran kartlarında görülen klasik FP32 ile doğrudan karşılaştırılamaz; burada özel matris hesaplamalarından bahsediyoruz.
Önemli bir yenilik de bellek tarafında. Her Rubin GPU, 288 GB'a kadar HBM4 bellek ve 22 TB/sn'ye kadar bant genişliğiyle donatılır. Blackwell'de bu değer yaklaşık 8 TB/sn idi; Rubin'de ise yaklaşık 2,8 kat artış söz konusu.
Bellek kapasite ve bant genişliği artışı, sadece devasa modellerin yüklenmesi için değil; aynı zamanda inference sırasında sık sık başvurulan nöral ağ ağırlıkları ve KV cache'in hızla erişilebilmesi için gereklidir. Uzun diyaloglar ve aynı anda çok sayıda kullanıcı, bellek üzerindeki yükü daha da artırır.
Bu nedenle HBM4 - yapay zeka ve yüksek performanslı hesaplama için yeni nesil bellek günümüzdeki AI hızlandırıcılarının anahtar bileşenlerinden biridir. Fazladan kapasite, verilerin GPU'ya daha yakın tutulmasını sağlarken yüksek bant genişliği ise hesaplama işlemleri arasındaki bekleme süresini azaltır.
Daha fazla bilgi için HBM4 nedir, yapay zeka hızlandırıcılarında HBM3E ile farkları ve geleceği başlıklı rehberimize göz atabilirsiniz.
NVIDIA, Rubin ile birlikte sunucu sınıfı Grace işlemcisinin yerini Vera CPU'ya bıraktı. Bu, NVIDIA'nın kendi geliştirdiği Arm uyumlu Olympus çekirdeklerine sahip ve büyük ölçekli AI sistemleri için optimize edilmiş bir işlemcidir. Tek bir Vera CPU 88 Olympus çekirdeği ve 1,5 TB LPDDR5X bellekle çalışabilir. Vera Rubin Superchip konfigürasyonunda bir CPU, iki Rubin GPU ile NVLink-C2C üzerinden (1,8 TB/sn) doğrudan bağlanır.
Vera CPU'nun amacı, nöral ağ hesaplamalarında GPU'nun yerini almak değildir. Veri hazırlama, görev yönetimi, geleneksel yazılım kodu çalıştırma gibi işlevleri üstlenir; en ağır paralel hesaplamalar ise GPU'da yapılır. CPU ile GPU arasında hızlı bağlantı, büyük modellerde veri aktarımını hızlandırır ve darboğazları azaltır.
Büyük modellerde asıl darboğaz, hızlandırıcılar arası veri alışverişidir. Model onlarca GPU'ya dağıtıldığında, aralarındaki iletişim gecikmesi toplam verimliliği belirler. Rubin'de NVLink 6. nesil kullanılır ve tek bir GPU için 3,6 TB/sn'ye kadar bant genişliği sunar. Vera Rubin NVL72 sistemi ise 260 TB/sn toplu NVLink 6 Switch bant genişliğine ulaşır.
Bu sayede, NVL72'deki 72 Rubin GPU yüksek hızlı bir ağ üzerinden veri paylaşabilir. Bu, özellikle Mixture-of-Experts gibi modellerde, farklı nöral ağ bölümlerinin farklı hızlandırıcılarda çalıştığı durumlarda kritiktir.
Rubin mimarisi, dört ana kaynağın bütünleşik çalışmasına dayanır: Tensor Core işlem gücü, HBM4 bellek, hızlı CPU-GPU iletişimi ve ölçeklenebilir NVLink. Herhangi birindeki gecikme tüm sistemin verimliliğini azaltır. Bu nedenle NVIDIA, Vera Rubin'i bağımsız işlemciler yerine bütünleşik bir platform olarak tasarlamıştır.
Vera Rubin'in performansını sadece FLOPS ile değerlendirmek yetersizdir. Modern yapay zeka sistemlerinde önemli olan, altyapının belirli enerji tüketimiyle ne kadar token üretebildiği, bir modeli eğitmek için kaç hızlandırıcı gerektiği ve sistemin uzun bağlamlarda ne kadar hızlı çalıştığıdır.
NVIDIA'ya göre, Vera Rubin NVL72, reasoning modeli Kimi K2 Thinking testinde GB200 NVL72'ye kıyasla megavat başına 10 kat daha fazla token üretebiliyor ve bir milyon token üretim maliyetini yaklaşık 10 kat düşürüyor. Ancak bu, Rubin'in her model ve her yükte Blackwell'den 10 kat hızlı olduğu anlamına gelmez; avantaj modelin türüne, veri biçimine ve bağlam uzunluğuna göre değişir.
Ajan tabanlı sistemlerde fark daha da belirgindir. Bir AI ajanı, geleneksel bir chatbot gibi tek cevap üretmekten ziyade, adım adım bilgi arama, dış araçları kullanma, ek modeller çalıştırma ve sonuçları tekrar analiz etme gibi işlemler yapar. Bu süreçler, işlenen token miktarını dramatik biçimde artırır. NVIDIA, ajan görevlerinin geleneksel AI uygulamalarına kıyasla 15 kata kadar daha fazla token tüketebileceğini belirtiyor.
Böylece, kritik sınırlayıcı nokta artık sadece matris işlemlerinin hızı değildir. Sistem, HBM4 ile GPU ve diğer hızlandırıcılar arasında sürekli büyük miktarda veri aktarmalı ve aynı anda çoklu kullanıcıya hizmet vermelidir. Yüksek bellek bant genişliği ve NVLink 6, Rubin'in bu tip yüklerde daha verimli çalışmasını sağlar.
Ağustos 2026'da NVIDIA, ajan programlama için AgentX isimli daha spesifik bir testin sonuçlarını yayımladı. Bazı modlarda Vera Rubin NVL72, GB300 NVL72'ye göre kullanıcı başına saniyede 160 token hedef hızında megavat başına 30 kata kadar daha yüksek throughput sağladı. Bu, platformun iddialı performans rakamları olup, bağımsız doğrulama sürecindedir.
Büyük modellerin eğitimi için ise Rubin, tüm sistem verimliliğine odaklanır. 10 trilyon parametreli bir Mixture-of-Experts modelinin eğitiminde, Vera Rubin NVL72, aynı süre zarfında GB200 NVL72'ye göre yaklaşık dört kat daha az GPU gerektirir. Bu, donanım ve enerji maliyetlerini azaltır, ağı basitleştirir ve düğümler arası veri trafiğini düşürür.
Daha detaylı bilgi için AI Fabric: Binlerce GPU ile yapay zeka eğitiminin altyapısı nasıl kurulur? rehberimizi inceleyebilirsiniz.
NVIDIA, ana Rubin GPU'ya ek olarak, özellikle uzun bağlam işleme (massive-context processing) için optimize edilen Rubin CPX hızlandırıcıyı geliştirdi. Bu, öncelikle kod tabanlarının analizi, yapay zekayla programlama, büyük video ve içerik üretimi gibi görevlerde kullanılmak üzere tasarlanmıştır.
CPX, Rubin'e göre daha güçlü bir versiyon değil, farklı bir ihtiyaca hizmet eden bir çözümdür. Rubin evrensel eğitim ve çıkarım için HBM4 kullanırken, CPX massive-context işlemede 128 GB GDDR7 bellekle donatılmıştır. Bu, belirli görevlerde daha uygun maliyetli bir bellek-performans dengesi sağlar.
CPX, monolitik kalıp tasarımına sahip olup NVFP4 ile 30 PFLOPS'a kadar performans sunar. NVIDIA, mimarisinin attention işlemlerinde GB300 NVL72'ye göre üç kata kadar daha yüksek performans sağlayabildiğini belirtiyor.
Pratik bir örnek olarak, milyonlarca token'lık bağlamlarda programlama asistanları veya uzun video analizleri verilebilir. CPX, video kodlama/çözme ile uzun bağlam çıkarım bloklarını birleştirerek, büyük veri setlerinde analiz ve içerik üretimi için de uygundur.
En büyük CPX tabanlı konfigürasyonlardan biri, Vera Rubin NVL144 CPX'tir. Bu sistemde Vera CPU, Rubin GPU ve Rubin CPX bir arada kullanılır; bir rafta 8 exaflops AI performansı, yaklaşık 100 TB hızlı bellek ve 1,7 PB/sn toplam bellek bant genişliği hedeflenir.
Vera Rubin'in ana hedef kitlesi büyük veri merkezleridir. Platform, bulut operatörleri, temel AI model geliştiricileri, bilimsel hesaplama merkezleri ve kendi AI fabrikalarını inşa eden şirketler için tasarlanmıştır. Burada önemli olan binlerce bağlı hızlandırıcı, megavatlarca güç tüketimi ve maksimum altyapı verimliliğidir.
2026 yılında Vera Rubin, büyük ölçekli üretime geçmiştir. Microsoft, yeni nesil Fairwater altyapısında Vera Rubin NVL72'yi kullanmayı planlarken, CoreWeave ilk Rubin tabanlı bulut çözümlerini müşterilerine sunacak şirketler arasında yer alıyor.
Bir diğer önemli pazar ise süper bilgisayarlardır. Vera Rubin, jeneratif yapay zekanın yanı sıra, iklim modellemesi, akışkanlar mekaniği, kuantum kimya ve enerji araştırmaları gibi geleneksel yüksek performanslı hesaplama (HPC) görevleri için de optimize edilmiştir. Los Alamos Ulusal Laboratuvarı, NERSC ve Leibniz Süper Bilgisayar Merkezi gibi kurumlar, Vera Rubin tabanlı yeni süper bilgisayarlar planlamaktadır.
AI fabrikası içindeki özel bileşenler fikri de gelişiyor. Rubin GPU ve CPX'e ek olarak, NVIDIA inference, bağlam depolama, ağ aktarımı ve CPU görevleri için ayrı hızlandırıcılar ve sistemler sunuyor. Ağustos 2026'da Groq 3 LPX'in kitlesel üretimi duyuruldu; bu, Vera Rubin altyapısına hızlı token üretimi için yeni bir hızlandırıcı ekliyor.
Böylece, Vera Rubin tek bir sabit sunucu konfigürasyonu olmaktan çıkarak, farklı AI yük türleri için bir yapı taşları setine dönüşüyor. Kimi şirketler için maksimum eğitim hızı, kimileri için ucuz ve kitlesel inference, kimileri için ise uzun bağlam veya minimum yanıt gecikmesi önceliklidir. NVIDIA, bu senaryoları ortak yazılım ve ağ altyapısıyla bütünleştirilmiş çeşitli hesaplama bloklarıyla karşılamaya çalışıyor.
Rubin CPX, bu geçişi iyi özetler. Önceki nesillerde yeni hızlandırıcıların öncelikli anlamı daha güçlü bir GPU olurken, şimdi AI donanımı daha fazla uzmanlaşmaya yöneliyor. Yapay zeka yükleri çeşitlendikçe, bunları aşamalara ayırıp her birini optimize edilmiş işlemcilere dağıtmak avantaj sağlar.
NVIDIA Rubin, Blackwell'den sonra gelen sıradan bir GPU değil; NVIDIA'nın bir sunucu rafı ölçeğinde hesaplamaya geçişinde yeni bir dönemi temsil ediyor. Vera Rubin platformu, yeni Rubin GPU, Vera CPU, HBM4 bellek, NVLink 6 ve gelişmiş ağ altyapısını bir araya getirerek, bileşenler arası gecikmeleri azaltıyor ve modern yapay zeka altyapısını daha verimli ölçekleyebiliyor.
Rubin'in başlıca avantajları, büyük ölçekli model eğitimi, reasoning, AI ajanları, uzun bağlam ve kitlesel inference gibi yüksek hesaplama ve sürekli veri alışverişi gerektiren görevlerde öne çıkar. Bellek ve bağlantı bant genişliğindeki büyüme, Tensor Core işlem gücündeki artış kadar kritiktir.
Blackwell ile karşılaştırıldığında, yeni mimari tüm altyapı verimliliğine daha fazla odaklanır: üretilen token sayısı, enerji tüketimi, inference maliyeti ve onlarca/binlerce hızlandırıcının etkileşiminin etkinliği. Rubin CPX'in ortaya çıkışı, NVIDIA'nın farklı nöral ağ aşamaları için uzmanlaşmış işlemcilere yöneldiğini açıkça gösteriyor.
Vera Rubin, son kullanıcılar için görünmez kalsa da - esas olarak veri merkezleri, bulut hizmetleri ve süper bilgisayarlar için tasarlanmıştır - geleceğin yapay zeka servisleri bu platformlar üzerinde çalışacak. Bu nedenle Rubin'in gelişimi, yeni nesil sinir ağlarının ne kadar hızlı, karmaşık ve erişilebilir olacağını doğrudan etkiler.