Zelf hosten
GPU-geheugenplanner
Beam is een Mixture-of-Experts-model: per token worden slechts 23 miljard parameters gebruikt, maar alle 501 miljard moeten in het geheugen staan. Kies een precisie, context en hardware om te zien wat daarvoor nodig is.
Aannames voor attention
Reflection beschrijft interleaved lokale en globale attention, maar heeft config.json nog niet gepubliceerd. Deze tijdelijke waarden bepalen de schatting van de KV-cache; pas ze aan zodra de echte waarden bekend zijn.
Benodigde GPU's alleen voor de gewichten
Minimumaantal apparaten per precisie, exclusief KV-cache, waarbij 92% van het geheugen van elk apparaat beschikbaar is.
| Accelerator | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Zo werkt de schatting
- Gewichten: 501 miljard parameters × bits per gewicht ÷ 8. GGUF-formaten bevatten de blokschalen, dus Q4_K_M komt neer op ongeveer 4.85 bits.
- KV-cache: 2 × KV-heads × head-dimensie × bytes per waarde voor elke gecachete token in elke laag. Globale lagen cachen de volledige context; lokale lagen cachen alleen hun venster.
- De overhead omvat activaties, CUDA-graphs en fragmentatie. 10% is een redelijk uitgangspunt voor vLLM of SGLang; meet dit voor je eigen configuratie.
- Bij het aantal apparaten wordt ervan uitgegaan dat 92% van het geheugen beschikbaar is. Het aantal wordt afgerond op tensorparallelle groepsgroottes van 1, 2, 4 of 8 per server.
Vragen
Kan ik Beam op één GPU draaien?
Geen enkele consumenten- of datacenter-GPU heeft genoeg geheugen. Zelfs bij 4-bit nemen de gewichten ongeveer 250 GB in beslag, dus heb je meerdere krachtige accelerators nodig of een machine met zeer veel unified memory.
Waarom heeft een model met 23B actieve parameters zoveel geheugen nodig?
Elke token wordt naar een paar experts gerouteerd, maar welke experts dat zijn, verschilt per token. Daarom moet elke expert klaarstaan. Het aantal actieve parameters bepaalt de snelheid; het totale aantal parameters bepaalt het geheugengebruik.
Kunnen experts in het systeemgeheugen staan?
Sommige engines, zoals llama.cpp, kunnen de gewichten van experts in het CPU-geheugen houden en ze naar de GPU streamen. Dat werkt, maar is veel trager; plan dit alleen voor experimenten.
Wanneer zijn deze getallen exact?
Het geheugengebruik voor de gewichten is al exact voor een bepaalde precisie. De schatting voor de KV-cache is exact zodra Reflection de configuratie van het model publiceert.