Zelf hosten

GPU-geheugenplanner

Beam is een Mixture-of-Experts-model: per token worden slechts 23 miljard parameters gebruikt, maar alle 501 miljard moeten in het geheugen staan. Kies een precisie, context en hardware om te zien wat daarvoor nodig is.

beam-501b-a23b
Gewichtsprecisie
KV-cacheprecisie
Aannames voor attention

Reflection beschrijft interleaved lokale en globale attention, maar heeft config.json nog niet gepubliceerd. Deze tijdelijke waarden bepalen de schatting van de KV-cache; pas ze aan zodra de echte waarden bekend zijn.

Totaal geheugenKV-cache per token: 26.0 KB
Gewichten
501 GB
KV-cache
16.6 GB
Overhead
51.8 GB
Totaal geheugen
569 GB
GewichtenKV-cacheOverhead
NVIDIA H200 141GB nodig
Minimaal 5, in de praktijk 8
Past op één server met 8 GPU's

Benodigde GPU's alleen voor de gewichten

Minimumaantal apparaten per precisie, exclusief KV-cache, waarbij 92% van het geheugen van elk apparaat beschikbaar is.

Accelerator BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Zo werkt de schatting

  • Gewichten: 501 miljard parameters × bits per gewicht ÷ 8. GGUF-formaten bevatten de blokschalen, dus Q4_K_M komt neer op ongeveer 4.85 bits.
  • KV-cache: 2 × KV-heads × head-dimensie × bytes per waarde voor elke gecachete token in elke laag. Globale lagen cachen de volledige context; lokale lagen cachen alleen hun venster.
  • De overhead omvat activaties, CUDA-graphs en fragmentatie. 10% is een redelijk uitgangspunt voor vLLM of SGLang; meet dit voor je eigen configuratie.
  • Bij het aantal apparaten wordt ervan uitgegaan dat 92% van het geheugen beschikbaar is. Het aantal wordt afgerond op tensorparallelle groepsgroottes van 1, 2, 4 of 8 per server.

Vragen

Kan ik Beam op één GPU draaien?

Geen enkele consumenten- of datacenter-GPU heeft genoeg geheugen. Zelfs bij 4-bit nemen de gewichten ongeveer 250 GB in beslag, dus heb je meerdere krachtige accelerators nodig of een machine met zeer veel unified memory.

Waarom heeft een model met 23B actieve parameters zoveel geheugen nodig?

Elke token wordt naar een paar experts gerouteerd, maar welke experts dat zijn, verschilt per token. Daarom moet elke expert klaarstaan. Het aantal actieve parameters bepaalt de snelheid; het totale aantal parameters bepaalt het geheugengebruik.

Kunnen experts in het systeemgeheugen staan?

Sommige engines, zoals llama.cpp, kunnen de gewichten van experts in het CPU-geheugen houden en ze naar de GPU streamen. Dat werkt, maar is veel trager; plan dit alleen voor experimenten.

Wanneer zijn deze getallen exact?

Het geheugengebruik voor de gewichten is al exact voor een bepaalde precisie. De schatting voor de KV-cache is exact zodra Reflection de configuratie van het model publiceert.