Sariling pagho-host

Planner ng GPU memory

Ang Beam ay isang Mixture-of-Experts model: 23 bilyong parameter lang ang gumagana sa bawat token, pero kailangang nasa memory ang lahat ng 501 bilyong parameter. Pumili ng precision, context at hardware para malaman kung ano ang kakailanganin.

beam-501b-a23b
Precision ng weights
Precision ng KV cache
Mga palagay sa attention

Inilalarawan ng Reflection ang interleaved local at global attention, pero hindi pa nito inilalathala ang config.json. Ginagamit ng mga placeholder na ito sa pagtatantiya ng KV cache; palitan ang mga ito kapag available na ang totoong mga value.

Kabuuang memoryKV cache bawat token: 26.0 KB
Weights
501 GB
KV cache
16.6 GB
Overhead
51.8 GB
Kabuuang memory
569 GB
WeightsKV cacheOverhead
NVIDIA H200 141GB na kailangan
Minimum na 5, 8 sa aktuwal na paggamit
Kasya sa isang 8-GPU server

Mga GPU na kailangan para lang sa weights

Pinakamababang bilang ng device sa bawat precision bago isama ang KV cache, kung 92% ng memory ng bawat device ang magagamit.

Accelerator BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Paano gumagana ang pagtatantiya

  • Weights: 501 bilyong parameter × bits bawat weight ÷ 8. Kasama sa mga GGUF format ang mga block scale nito, kaya humigit-kumulang 4.85 bits ang bilang para sa Q4_K_M.
  • KV cache: 2 × KV heads × head dimension × bytes bawat value para sa bawat naka-cache na token sa bawat layer. Ini-cache ng mga global layer ang buong context; ini-cache lang ng mga local layer ang window ng mga ito.
  • Saklaw ng overhead ang mga activation, CUDA graph at fragmentation. Makatuwirang panimulang tantiya ang 10% para sa vLLM o SGLang; sukatin ang sarili mong setup.
  • Ipinapalagay sa bilang ng mga device na magagamit ang 92% ng memory, at niro-round ito sa mga laki ng tensor-parallel group na 1, 2, 4 o 8 bawat server.

Mga tanong

Maaari ko bang patakbuhin ang Beam sa iisang GPU?

Walang sapat na memory ang anumang consumer o data-center GPU. Kahit sa 4-bit, humigit-kumulang 250 GB ang kailangan ng weights, kaya kailangan mo ng ilang malalaking accelerator o machine na may napakalaking unified memory.

Bakit napakalaki ng memory na kailangan ng modelong may 23B-active parameter?

Ipinapasa ang bawat token sa ilang expert, pero nagbabago ang mga napipili sa bawat token, kaya kailangang handa ang lahat ng expert. Bilis ang itinatakda ng mga active parameter; memory naman ang itinatakda ng kabuuang parameter.

Maaari bang ilagay ang mga expert sa system RAM?

Kayang panatilihin ng ilang engine, gaya ng llama.cpp, ang mga expert weight sa memory ng CPU at i-stream ang mga ito papunta sa GPU. Gumagana ito pero mas mabagal; pag-eksperimento lang ito dapat gamitin.

Kailan magiging eksakto ang mga numerong ito?

Eksakto na ang memory na kailangan ng weights para sa isang partikular na precision. Magiging eksakto ang pagtatantiya sa KV cache kapag inilathala na ng Reflection ang configuration ng model.