Kendi sunucunda çalıştırma

GPU bellek planlayıcısı

Beam bir Mixture-of-Experts modelidir: Her token için yalnızca 23 milyar parametre çalışır, ancak 501 milyar parametrenin tamamı bellekte bulunmalıdır. Gereksinimleri görmek için hassasiyeti, bağlamı ve donanımı seçin.

beam-501b-a23b
Ağırlık hassasiyeti
KV önbellek hassasiyeti
Attention varsayımları

Reflection, yerel ve küresel attention'ın iç içe kullanıldığını belirtiyor ancak henüz config.json dosyasını yayımlamadı. Bu yer tutucular KV önbellek tahminini belirler; gerçek değerler açıklandığında bunları değiştirin.

Toplam bellekToken başına KV önbelleği: 26.0 KB
Ağırlıklar
501 GB
KV önbelleği
16.6 GB
Ek yük
51.8 GB
Toplam bellek
569 GB
AğırlıklarKV önbelleğiEk yük
NVIDIA H200 141GB gerekiyor
Minimum 5, pratikte 8
Tek bir 8 GPU'lu sunucuya sığar

Yalnızca ağırlıklar için gereken GPU sayısı

KV cache hesaba katılmadan, her cihazın belleğinin %92 kadarı kullanılabilir olduğunda hassasiyet başına gereken en az cihaz sayısı.

Hızlandırıcı BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Tahmin nasıl hesaplanıyor

  • Ağırlıklar: 501 milyar parametre × ağırlık başına bit sayısı ÷ 8. GGUF biçimleri blok ölçeklerini içerir; bu nedenle Q4_K_M yaklaşık 4.85 bit olarak hesaplanır.
  • KV cache: Önbelleğe alınan her katmandaki her token için 2 × KV kafası sayısı × kafa boyutu × değer başına bayt. Global katmanlar tüm bağlamı, yerel katmanlar ise yalnızca kendi pencerelerini önbelleğe alır.
  • Ek yük; aktivasyonları, CUDA grafiklerini ve parçalanmayı kapsar. vLLM veya SGLang için %10 makul bir başlangıçtır; kendi kurulumunuzda ölçüm yapın.
  • Cihaz sayısı, belleğin %92 kadarının kullanılabilir olduğunu varsayar ve sunucu başına 1, 2, 4 veya 8 tensor paralelliği grubu boyutlarına yuvarlanır.

Sorular

Beam'i tek bir GPU'da çalıştırabilir miyim?

Hiçbir tüketici veya veri merkezi GPU'sunun belleği yeterli değil. Ağırlıklar 4 bitlik gösterimde bile yaklaşık 250 GB yer kaplar; bu nedenle birkaç büyük hızlandırıcıya veya çok büyük birleşik belleğe sahip bir makineye ihtiyacınız var.

23B aktif parametreli bir model neden bu kadar çok belleğe ihtiyaç duyar?

Her token birkaç uzmana yönlendirilir, ancak hangi uzmanların seçileceği tokendan tokene değişir; bu nedenle her uzmanın kullanıma hazır olması gerekir. Aktif parametreler hızı, toplam parametreler ise bellek ihtiyacını belirler.

Uzmanlar sistem RAM'inde tutulabilir mi?

llama.cpp gibi bazı motorlar uzman ağırlıklarını CPU belleğinde tutup GPU'ya aktarabilir. İşe yarar ama çok daha yavaştır; bunu yalnızca deneyler için planlayın.

Bu sayılar ne zaman kesin olur?

Ağırlık belleği, belirli bir hassasiyet için zaten kesin olarak hesaplanabilir. KV cache tahmini, Reflection model yapılandırmasını yayımladığında kesinleşir.