Self-Hosting

GPU-Speicherplaner

Beam ist ein Mixture-of-Experts-Modell: Pro Token werden nur 23 Milliarden Parameter verwendet, aber alle 501 Milliarden müssen im Speicher liegen. Wähle Präzision, Kontext und Hardware aus, um den Bedarf zu ermitteln.

beam-501b-a23b
Gewichtspräzision
KV-Cache-Präzision
Annahmen zur Attention

Reflection beschreibt eine verschachtelte lokale und globale Attention, hat aber noch keine config.json veröffentlicht. Diese Platzhalter bestimmen die Schätzung des KV-Caches. Passe sie an, sobald die tatsächlichen Werte vorliegen.

GesamtspeicherKV-Cache pro Token: 26.0 KB
Gewichte
501 GB
KV-Cache
16.6 GB
Overhead
51.8 GB
Gesamtspeicher
569 GB
GewichteKV-CacheOverhead
NVIDIA H200 141GB erforderlich
Mindestens 5, in der Praxis 8
Passt auf einen 8-GPU-Server

Benötigte GPUs nur für die Gewichte

Mindestens benötigte Geräte pro Präzision, vor KV-Cache, bei 92% nutzbarem Speicher pro Gerät.

Beschleuniger BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

So funktioniert die Schätzung

  • Gewichte: 501 Milliarden Parameter × Bits pro Gewicht ÷ 8. GGUF-Formate enthalten ihre Block-Skalierungen, daher entspricht Q4_K_M etwa 4.85 Bits.
  • KV-Cache: 2 × KV-Heads × Head-Dimension × Bytes pro Wert für jeden gecachten Token in jeder Schicht. Globale Schichten cachen den gesamten Kontext; lokale Schichten cachen nur ihr Fenster.
  • Der Overhead berücksichtigt Aktivierungen, CUDA-Graphs und Fragmentierung. 10% ist ein sinnvoller Ausgangswert für vLLM oder SGLang; miss deinen eigenen Aufbau.
  • Bei der Geräteanzahl wird angenommen, dass 92% des Speichers nutzbar sind. Aufgerundet wird auf Tensor-Parallel-Gruppengrößen von 1, 2, 4 oder 8 pro Server.

Fragen

Kann ich Beam auf einer GPU ausführen?

Keine Consumer- oder Rechenzentrums-GPU hat genug Speicher. Selbst bei 4 Bit benötigen die Gewichte etwa 250 GB. Du brauchst also mehrere große Beschleuniger oder eine Maschine mit sehr viel gemeinsam genutztem Speicher.

Warum benötigt ein Modell mit 23B aktiven Parametern so viel Speicher?

Jeder Token wird an einige wenige Experten weitergeleitet, aber welche das sind, ändert sich von Token zu Token. Deshalb muss jeder Experte bereitstehen. Die aktiven Parameter bestimmen die Geschwindigkeit; die Gesamtzahl der Parameter bestimmt den Speicherbedarf.

Können Experten im Systemspeicher liegen?

Einige Engines wie llama.cpp können Expert-Gewichte im CPU-Speicher halten und an die GPU übertragen. Das funktioniert, ist aber deutlich langsamer. Plane es nur für Experimente ein.

Wann sind diese Zahlen exakt?

Der Speicherbedarf der Gewichte ist für eine bestimmte Präzision bereits exakt. Die Schätzung für den KV-Cache wird exakt, sobald Reflection die Konfiguration des Modells veröffentlicht.