2026 yılında çoğu kurumsal LLM çıkarım iş yükü için FP8'de sunulan 70B'ye kadar modellerde doğru tercih hâlâ H100'dür; 400B sınıfı bir model veya DeepSeek R1'in tek bir 8 GPU'lu düğüme sığması gerektiğinde ya da uzun bağlamlı KV önbelleği belleğe hâkim olduğunda daha iyi seçim H200'dür; B200 veya GB200 NVL72 ise yalnızca rack başına en yüksek verim, FP4 sunum veya çok büyük MoE modelleri için 72 GPU'luk bir NVLink alanı gerektiğinde haklı çıkar. H100 ve H200 aynı hesaplama gücünü paylaşır, dolayısıyla H200'ün kazancı tamamen bellek ve bant genişliğinden gelir. Önce belleğe, sonra bant genişliğine, en son TFLOPS'a göre boyutlandırın.

H100 vs H200 vs B200: teknik özellik karşılaştırması

H100 ve H200 aynı hesaplama gücüne sahip Hopper mimarisidir; H200, 80 GB HBM3'ü 141 GB HBM3e ile değiştirir. B200 ise Blackwell mimarisidir: FP4 desteği, yaklaşık iki kat daha fazla bant genişliği ve iki kat NVLink sunar. Rakamlar, NVIDIA'nın 2026 itibarıyla SXM ve HGX parçaları için yayımladığı teknik özelliklerdir; özellikler periyodik olarak güncellendiğinden resmi H100, H200 ve HGX sayfalarını kontrol edin.

ÖzellikH100 SXMH200 SXMB200 (HGX B200)
MimariHopperHopperBlackwell
GPU belleği80 GB HBM3141 GB HBM3e~180 GB HBM3e
Bellek bant genişliği3.35 TB/s4.8 TB/s~8 TB/s
FP8 hesaplama (dense)~2 PFLOPS~2 PFLOPS~4.5 PFLOPS
FP4 hesaplama (dense)yokyok~9 PFLOPS
GPU başına NVLink900 GB/s900 GB/s1.8 TB/s
Maks. TDP700 W700 W~1,000 W
8 GPU'lu düğüm başına bellek640 GB1,128 GB~1,440 GB
Form faktörleriSXM (HGX/DGX); PCIe 80 GB, 350 W; H100 NVL 94 GB PCIeSXM (HGX/DGX); H200 NVL 141 GB PCIe, 600 WHGX/DGX B200 (SXM); GB200 NVL72 (Grace + Blackwell, sıvı soğutmalı)
Tipik kullanımFP8'de 7B-70B sunum, LoRA, MIG çoklu kiracılıkTek düğümde 70B-405B, DeepSeek R1 FP8, uzun bağlamRack başına maksimum verim, FP4, ölçekte 400B+ MoE, eğitim

Önemli çıkarım: H100 ve H200 aynı hesaplama gücünü paylaşır, dolayısıyla bellek ve bant genişliği için ödeme yaparsınız; B200 ise hesaplamayı, hassasiyeti ve ara bağlantıyı da değiştirir.

Çıkarım hızını TFLOPS değil, bellek ve bant genişliği belirler

Prefill (istemi okuma) hesaplama sınırlıdır. Decode (token'ları tek tek üretme) ise GPU'nun ağırlıkları ve KV önbelleğini HBM'den ne hızda akıttığıyla sınırlıdır; sohbet ve ajan iş yükleri zamanlarının çoğunu decode aşamasında geçirir. Ağırlıklar tabanı belirler: 70B'lik dense bir model FP16'da yaklaşık 140 GB, FP8'de 70 GB ve INT4'te 38 GB gerektirir; 400B sınıfı bir model yaklaşık 810, 405 ve 220 GB gerektirir; DeepSeek R1 ve V3 (671B MoE, FP8 olarak yayımlandı) yaklaşık 700 GB gerektirir.

KV önbelleği ekiplerin hafife aldığı noktadır. Llama 3 70B için her token FP16'da yaklaşık 320 KB'a mal olur, dolayısıyla 128K token'lık tek bir dizi yaklaşık 40 GB gerektirir; FP8 KV önbelleği bunu yarıya indirir. Kısa bağlamlı sohbet için ağırlıkların üzerine yüzde 20 ila 50 pay planlayın ve 32K üzerindeki bağlamlar için KV önbelleğini açıkça hesaplayın. Bir kıyaslama değil basit bir teknik özellik oranı olarak, bellek sınırlı decode'da H200'ün H100'e göre bant genişliği payı yaklaşık 1.4 kat, B200'de ise yaklaşık 2.4 kattır.

Önemli çıkarım: Önce ağırlıklar artı KV önbelleğine göre boyutlandırın; aynı nesil içinde bant genişliği oranı, decode verimi için en iyi birinci dereceden göstergedir.

Model boyutu ve iş yüküne göre karar matrisi

Varsayımlar: FP8 ağırlıklar, FP8 veya FP16 KV önbelleği, vLLM veya TensorRT-LLM ve eşzamanlılık altında belleğin yüzde 25 ila 40'ının KV önbelleği için ayrılması. Sohbet, yüksek eşzamanlılıkta kısa istemler anlamına gelir; uzun bağlam, istek başına 64K ila 128K+ token anlamına gelir; batch, çevrimdışı verim anlamına gelir.

Model sınıfı (örnekler)SohbetUzun bağlamBatch / çevrimdışıİnce ayar
8B'ye kadar (Llama 3.1 8B, Qwen 3 8B)1x H100 PCIe veya MIG dilimi1x H100; çok sayıda uzun oturum için H2001x H100LoRA 1x H100; tam ince ayar 2x H100 veya 1x H200
30B-35B (Qwen 3 32B)1x H100 (FP8)1x H2001x H100 (FP8)LoRA 1x H100; tam ince ayar 8x H100 veya 4x H200
70B (Llama 3.3 70B, Qwen 2.5 72B)2x H100 veya 1x H2002x H200 veya 4x H1002x H100 veya 1x H200LoRA 2x-4x H100; tam ince ayar 8x H200 veya B200
~110B-120B MoE (Llama 4 Scout, gpt-oss-120b)2x H100 veya 1x H2004x H100 veya 2x H2002x H100 veya 1x H200LoRA 4x-8x H100; tam ince ayar 8x H200 veya B200
400B sınıfı (Llama 3.1 405B, Llama 4 Maverick)8x H100 (sıkışık) veya 8x H2008x H200 veya 8x B2008x H100 veya 8x H200LoRA 8x H200; tam ince ayar çok düğümlü B200 veya GB200 NVL72
671B MoE (DeepSeek R1, V3)8x H200 veya 8x B200; iki düğümde 16x H1008x B200 veya GB200 NVL728x H200LoRA çok düğümlü H200/B200; tam ince ayar GB200 NVL72 sınıfı

70B satırı, H200'ün kendini ilk kez amorti ettiği noktadır: tek bir H200, iki H100'ün yerini alır ve tensor-parallel trafiğini ortadan kaldırır. 671B satırı ise H100'ün devre dışı kaldığı noktadır: DeepSeek R1 FP8'de 640 GB'a sığmaz. Model başına GPU sayıları 70B, 405B ve DeepSeek R1 için kaç GPU gerekir? yazısında ayrıntılı olarak ele alınmıştır. KV önbelleği için yaklaşık 55 GB bırakan, vLLM'de tek bir H200 üzerinde 70B yapılandırması:

vllm serve meta-llama/Llama-3.3-70B-Instruct \
  --quantization fp8 \
  --kv-cache-dtype fp8 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.92

Önemli çıkarım: 70B'ye kadar H100 yeterlidir; 70B-405B arası H200 alanıdır; yüksek eşzamanlılıkta 671B MoE ise Blackwell'in bedelini hak ettiği yerdir.

H100'ün hâlâ doğru tercih olduğu durumlar

2026 itibarıyla H100, serideki en olgun parçadır: her sunum yığını ve kuantizasyon çekirdeği üç yıldır bu kart üzerinde ince ayarlanmıştır, yenilenmiş (refurbished) sistemler mevcuttur ve bulut kapasitesi boldur. Modelleriniz 70B veya daha küçükse ve bağlam yaklaşık 32K'nın altında kalıyorsa, bir H100 filosu bunları FP8'de pay bırakarak sunar. Aşağıdakilerin çoğu geçerliyse doğru tercih budur:

  • FP8'de 70B'ye kadar veya FP16'da 35B'ye kadar modeller, kısa ila orta bağlamda.
  • Bir GPU başına 7'ye kadar MIG bölümünün tek bir çok büyük modelden daha önemli olduğu çok kiracılı sunum.
  • 10 ila 12 kW'ta hava soğutmalı raflar ve tesisat işi için bütçe yokluğu.
  • İnce ayarın LoRA veya QLoRA ile sınırlı olması.
  • Fiyat hassasiyeti: 2026 itibarıyla H100 sistemleri üçü arasında sunucu başına en ucuzudur, H200 orta düzeyde bir prim taşır, B200 ise en yüksek primi ve en uzun teslim sürelerini taşır; güncel fiyatlandırmayı doğrulayın ve hesabı Bulut API'leri yerine kendi GPU'larınız yazısında yapın.

Bir RTX PRO 6000 Blackwell (96 GB GDDR7, PCIe, NVLink yok), mütevazı eşzamanlılıkta 35B'ye kadar modeller için daha ucuz tek kartlı bir seçenektir; ancak H100'ün yaklaşık yarısı bant genişliğiyle yük altında bir alternatif değildir.

Önemli çıkarım: En büyük modeliniz FP8'de iki GPU'ya rahatça sığıyorsa ve odanız hava soğutmalıysa H100 alın; bu en düşük riskli ve en iyi desteklenen seçenektir.

H200'ün ekstra belleğinin karşılığını verdiği durumlar

H200, 4.8 TB/s hızında 141 GB HBM3e'ye sahip aynı GH100 silikonudur: aynı 700 W'ta yüzde 76 daha fazla bellek ve yüzde 43 daha fazla bant genişliği. HGX formunda H100 için doğrudan bir ikame olduğundan, bir H100 platformu genellikle bir bellenim (firmware) güncellemesiyle H200 modüllerini kabul eder. Üç durum belleği belirleyici kılar.

  1. Düğüm başına tek büyük model. FP8'de 400B sınıfı bir model yaklaşık 405 GB gerektirir; 8x H100'de bu, KV önbelleği ve çalışma zamanı için 235 GB'ın altında yer bırakır, 8x H200'de ise yaklaşık 720 GB bırakır.
  2. DeepSeek R1 ve V3. Doğal FP8'de bir 8x H200 düğümüne sığarlar ama bir 8x H100 düğümüne sığmazlar; bu da düğümler arası expert-parallel trafiğini ortadan kaldırır ve işlettiğiniz sunucu sayısını yarıya indirir.
  3. Eşzamanlılıkta uzun bağlam. 70B bir modelde 128K'lık dizi başına yaklaşık 40 GB KV önbelleğiyle, bir H100 çifti birkaç eşzamanlı uzun istekten sonra doygunlaşır; bir H200 çifti ise aynı gecikmede yaklaşık iki kat fazlasını sunar.

H200 NVL (PCIe, 141 GB, 600 W'a kadar, 4 yönlü NVLink köprüsü), mevcut bir kasada 70B FP8 modeli tek bir karta koymanın en basit yoludur.

Önemli çıkarım: Ağırlıklar artı KV önbelleği GPU eklemeden H100'e sığmıyorsa veya 405B ya da DeepSeek sınıfı modelleri tek düğümde sunuyorsanız H200'ü seçin.

B200 veya GB200 NVL72'nin haklı çıktığı durumlar

Blackwell aynı anda üç şeyi değiştirir: ikinci nesil Transformer Engine ile FP4, yaklaşık 8 TB/s HBM3e bant genişliği ve GPU başına 1.8 TB/s NVLink. B200, HGX B200 ve DGX B200 sistemlerinde (8 GPU, x86 ana bilgisayarlar, hava veya sıvı soğutmalı) sunulur. GB200 NVL72, 72 Blackwell GPU'sunu ve 36 Grace CPU'sunu, yaklaşık 13.5 TB HBM3e'lik tek bir NVLink alanına sahip tek bir sıvı soğutmalı rafta bir araya getirir; böylece 671B bir MoE modeli InfiniBand olmadan onlarca GPU üzerinde çalışır. Aşağıdakilerden biri sınırlayıcıysa Blackwell haklı çıkar:

  • Rack başına veya watt başına verim sınırlayıcıysa: GPU başına H100'ün yaklaşık 2.4 katı decode bant genişliği ve modelin izin verdiği yerlerde FP4 ağırlık trafiğini bir kez daha yarıya indirir.
  • Yüksek eşzamanlılık ve uzun bağlamda 400B+ dense veya 671B MoE modelleri sunuyorsanız, 72 GPU'luk NVLink alanı düğümler arası darboğazı ortadan kaldırır.
  • Ölçekte ayrıştırılmış (disaggregated) prefill ve decode çalıştırıyorsanız veya 70B+ modellerin tam parametreli ince ayarını yapıyorsanız.

İki uyarı. NVIDIA'nın GB200 NVL72 için H100'e kıyasla yayımladığı hız artışları FP4, NVLink-alanı ölçekli paralellik ve belirli yapılandırmalar varsayar; daha küçük, iş yüküne bağlı bir kazanç planlayın ve kendi modelinizi kıyaslayın. vLLM ve TensorRT-LLM, 2026 itibarıyla Blackwell'i, FP4 ağırlıkları ve FP8 KV önbelleğini destekler, ancak en yeni çekirdekler en az test edilmiş olanlardır (motor karşılaştırmaları için: vLLM vs TensorRT-LLM vs Ollama vs SGLang). Blackwell Ultra (B300, GB300, GPU başına 288 GB) da 2026 itibarıyla piyasaya sürülmektedir; mantık değişmez, yalnızca bellek tavanı yükselir.

Önemli çıkarım: B200'ü rack başına verim ve FP4, GB200 NVL72'yi ise tek bir 72 GPU'luk NVLink alanı haklı çıkarır; ikisi de sınırlayıcı değilse H200 daha iyi bir değerdir.

PCIe ve SXM, güç ve soğutma

PCIe vs SXM

SXM modülleri, her GPU'ya diğer her GPU'ya 900 GB/s (Hopper) veya 1.8 TB/s (Blackwell) sağlayan NVSwitch'li bir HGX ana kartı üzerinde bulunur; 4 veya 8 GPU arasında tensor paralelliğini verimli kılan budur ve 400B sınıfı modeller ile eğitim için zorunludur. SXM parçaları tam 700 W veya yaklaşık 1,000 W'ta çalışır ve amaca özel bir sunucu gerektirir. PCIe kartları (350 W'ta H100 PCIe 80 GB, H100 NVL 94 GB, 600 W'a kadar H200 NVL 141 GB) standart sunuculara sığar ve daha az güç çeker; ancak bir köprü olmadan GPU'lar yön başına yaklaşık 64 GB/s'de PCIe Gen5 üzerinden konuşur — bu, Hopper NVLink'inin yaklaşık on dörtte biri kadardır — dolayısıyla köprülü bir çift veya dörtlünün ötesinde tensor paralelliği iletişimde tıkanır.

Önemli çıkarım: 4 veya daha fazla tensor paralelliği, eğitim ve 400B+ için SXM; tek kart ve çiftli sunum, düşük güç, MIG çoklu kiracılık ve mevcut sunucular için PCIe.

Güç ve soğutma

Tam yükte 8 GPU'lu bir HGX H100 veya H200 sunucusu yaklaşık 10 ila 11 kW çeker (DGX H100 ve H200, 10.2 kW olarak derecelendirilmiştir); bu, birçok kurumsal rafın tasarlandığı 8 ila 10 kW'ın üzerindedir, dolayısıyla rack başına tek sunucu veya bir arka kapı ısı eşanjörü yaygındır. Bir DGX B200 yaklaşık 14.3 kW olarak derecelendirilmiştir ve hava ile soğutulabilir, ancak rack başına iki tanesi muhafaza (containment) veya sıvı destek gerektirir. GB200 NVL72, tasarım gereği rack başına yaklaşık 120 kW'ta sıvı soğutmalıdır ve tesis suyu, soğutucu dağıtım üniteleri ile ağırlığa uygun bir zemin gerektirir. GPU katmanını seçmeden önce rack gücünü ve soğutmasını doğrulayın, nominal değerin üzerinde yüzde 20 pay planlayın, rack başına yaklaşık 40 kW üzerindeki her şeyi bir sıvı soğutma projesi olarak ele alın ve çok düğümlü kümeler için GPU başına 400 Gb/s InfiniBand'i boyutlandırın; tam yığın şirket içi LLM dağıtım rehberinde bulunur.

Önemli çıkarım: H100 ve H200, mütevazı yükseltmelerle hava soğutmalı odalara sığar; B200, havanın sınırıdır; GB200 NVL72 ise en az bir GPU kararı kadar bir tesis kararıdır.

Karar vermeden önce boyutlandırma kontrol listesi

  1. Önümüzdeki 12 ay içinde sunacağınız modelleri listeleyin: parametre sayısı, dense veya MoE, hedef hassasiyet (precision).
  2. Ağırlık belleğini hesaplayın (parametre sayısı çarpı ağırlık başına bayt) ve KV önbelleği ile çalışma zamanı için yüzde 20 ila 50 ekleyin, ya da 32K bağlamın üzerinde KV önbelleğini açıkça hesaplayın.
  3. Gecikme ve eşzamanlılık hedeflerini belirleyin (ilk token'a kadar geçen süre, kullanıcı başına saniyedeki token sayısı, eşzamanlı oturumlar) ve decode mi yoksa prefill'in mi baskın olduğuna karar verin.
  4. Pay bırakarak tek bir düğüme sığan en küçük katmanı seçin: 70B'ye kadar H100, 405B ve DeepSeek R1'e kadar H200, bunun ötesinde veya FP4 verimi için B200 ya da GB200.
  5. SXM ile PCIe arasındaki seçimi fiyata göre değil, ihtiyaç duyduğunuz tensor-parallel dereceye göre yapın.
  6. Rack gücünü, soğutmayı ve zemin yükünü, yüzde 20 payla birlikte sunucu nominal değerlerine göre doğrulayın.
  7. Satın almadan önce gerçek modeli gerçek motorda kıyaslayın; aynı GPU türünün kısa süreli bir bulut kiralaması, yanlış boyutlandırılmış bir siparişin yanında ucuzdur.

Önemli çıkarım: Ölçülen ağırlıklardan, KV önbelleğinden ve gecikme hedeflerinden boyutlandırın, ardından tek bir düğüme sığan en düşük katmanı seçin.

Sıkça sorulan sorular

H200, LLM çıkarımı için H100'den daha mı hızlı?

Yalnızca bellek sınırlı işlerde. H200, H100 ile aynı hesaplama gücüne sahiptir ancak 4.8 TB/s'de 141 GB HBM3e'ye karşı 3.35 TB/s'de 80 GB'a sahiptir. Decode her token için ağırlıkları ve KV önbelleğini akıttığından, yüksek eşzamanlılıklı sohbet ve uzun bağlam yüzde 43 daha yüksek bant genişliğinden kazanç sağlar; prefill ağırlıklı özetlemede ise değişim azdır. Manşet rakamlara güvenmek yerine kendi modelinizi kıyaslayın.

DeepSeek R1, 8x H100 üzerinde çalışabilir mi?

Tek bir düğümde doğal FP8'de hayır. DeepSeek R1 ve V3, FP8 ağırlıklar için yaklaşık 700 GB gerektiren 671B MoE modelleridir; bu, 8x H100 sunucusundaki 640 GB'tan fazladır. Seçenekler: InfiniBand üzerinden iki H100 düğümü, kalite değerlendirmesiyle birlikte INT4 kuantizasyonu veya 2026 itibarıyla çoğu ekibin tercih ettiği tek bir 8x H200 (1,128 GB) ya da 8x B200 düğümüdür.

70B bir modeli sunmak için B200'e ihtiyacım var mı?

Hayır. FP8'de 70B bir model yaklaşık 70 GB ağırlık gerektirir ve iki H100'de veya bir H200'de iyi çalışır. Bir B200, H100'ün yaklaşık 2.4 katı bellek bant genişliği ve FP4 sayesinde GPU başına daha hızlıdır, ancak bu yalnızca rack başına maksimum saniyedeki token sayısına ihtiyaç duyduğunuzda veya çok sayıda 70B kopyasını birleştirdiğinizde karşılığını verir. Tek bir üretim dağıtımı için ekonomik seçim H100 veya H200'dür.

B200 ile GB200 arasındaki fark nedir?

B200, x86 ana bilgisayarlara sahip 8 GPU'lu HGX B200 ve DGX B200 sistemlerinde satılan bir Blackwell GPU'sudur. GB200 ise bir Grace CPU'yu NVLink-C2C üzerinden iki Blackwell GPU'suyla eşleştirir; bunlardan 36'sı, tek bir NVLink alanında 72 GPU barındıran ve yaklaşık 120 kW'ta sıvı soğutmalı bir GB200 NVL72 rafı oluşturur. Geleneksel sunucular için B200'ü, bir modelin InfiniBand olmadan onlarca GPU'ya yayılması gerektiğinde ise GB200 NVL72'yi seçin.

PCIe H100, çıkarım için yeterli mi?

Evet, tek bir karta veya köprülü bir çifte sığan modeller için. H100 PCIe (80 GB HBM2e, 2 TB/s, 350 W) ve H100 NVL (94 GB HBM3, 3.9 TB/s), FP16'da 8B-35B modelleri ve köprülü iki kart üzerinde FP8'de 70B'yi sunar. Bir çiftin ötesinde, PCIe Gen5 üzerinden tensor paralelliği darboğaz hâline gelir, dolayısıyla 400B sınıfı modeller ve eğitim SXM'e aittir.

8 GPU'lu bir sunucu ne kadar güç ve soğutmaya ihtiyaç duyar?

Hava soğutmalı bir 8x H100 veya H200 sunucusu için yaklaşık 10 ila 11 kW (DGX H100 ve H200, 10.2 kW olarak derecelendirilmiştir), bir DGX B200 için yaklaşık 14 ila 15 kW ve sıvı soğutmalı bir GB200 NVL72 için rack başına yaklaşık 120 kW. Güç dağıtımı için yüzde 20 pay ekleyin, odanın ısıyı atabildiğini doğrulayın ve rack başına yaklaşık 40 kW üzerinde sıvı soğutma planlayın.

FP8 veya FP4 kuantizasyonu yanıt kalitesini düşürür mü?

Hopper ve Blackwell üzerinde FP8 ağırlıklar ve FP8 KV önbelleği, çoğu açık ağırlıklı model için neredeyse kayıpsızdır ve DeepSeek R1 ile V3 doğal olarak FP8'de eğitilmiştir. FP4 (Blackwell'de NVFP4) ve INT4, belleği bir kez daha yarıya indirir ancak özellikle akıl yürütme ve kod için kendi görevlerinizde bir kalite değerlendirmesi gerektirir. Varsayılan olarak FP8, ölçümden sonra FP4 veya INT4, bellek kısıtlı değilse yalnızca FP16 kullanın.

Nanobase AI nasıl yardımcı olabilir

Nanobase AI, özel LLM dağıtımı için NVIDIA GPU altyapısını boyutlandırır, kurar ve işletir: H100, H200, B200 ve RTX PRO sistemleri arasında model-GPU boyutlandırması, PCIe ile SXM seçimi, rack gücü ve soğutması, NVLink ve InfiniBand topolojisi, Kubernetes GPU Operator veya Slurm zamanlaması, MIG bölümlendirmesi ve izleme. Bunun üzerine FP8 ve FP4 kuantizasyonuyla vLLM, TensorRT-LLM veya NVIDIA NIM'i, RAG ve ince ayarla birlikte devreye alır ve siparişi vermeden önce kendi modelleriniz üzerinde kıyaslamalarla doğrularız. Silikon Vadisi merkezli ve NVIDIA Inception Programı'nın kabul edilmiş bir üyesi olarak; şirket içinde, AWS, Azure ve Google Cloud'da veya hibrit olarak teslim ediyoruz. Çözümlerimize göz atın veya bir canlı demo rezervasyonu yapın.

Projenizi görüşmeye hazır mısınız? Nanobase AI ile iletişime geçin veya hello@bumu.tech adresine e-posta gönderin.