Sariling pagho-host
Planner ng GPU memory
Ang Beam ay isang Mixture-of-Experts model: 23 bilyong parameter lang ang gumagana sa bawat token, pero kailangang nasa memory ang lahat ng 501 bilyong parameter. Pumili ng precision, context at hardware para malaman kung ano ang kakailanganin.
Mga palagay sa attention
Inilalarawan ng Reflection ang interleaved local at global attention, pero hindi pa nito inilalathala ang config.json. Ginagamit ng mga placeholder na ito sa pagtatantiya ng KV cache; palitan ang mga ito kapag available na ang totoong mga value.
Mga GPU na kailangan para lang sa weights
Pinakamababang bilang ng device sa bawat precision bago isama ang KV cache, kung 92% ng memory ng bawat device ang magagamit.
| Accelerator | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Paano gumagana ang pagtatantiya
- Weights: 501 bilyong parameter × bits bawat weight ÷ 8. Kasama sa mga GGUF format ang mga block scale nito, kaya humigit-kumulang 4.85 bits ang bilang para sa Q4_K_M.
- KV cache: 2 × KV heads × head dimension × bytes bawat value para sa bawat naka-cache na token sa bawat layer. Ini-cache ng mga global layer ang buong context; ini-cache lang ng mga local layer ang window ng mga ito.
- Saklaw ng overhead ang mga activation, CUDA graph at fragmentation. Makatuwirang panimulang tantiya ang 10% para sa vLLM o SGLang; sukatin ang sarili mong setup.
- Ipinapalagay sa bilang ng mga device na magagamit ang 92% ng memory, at niro-round ito sa mga laki ng tensor-parallel group na 1, 2, 4 o 8 bawat server.
Mga tanong
Maaari ko bang patakbuhin ang Beam sa iisang GPU?
Walang sapat na memory ang anumang consumer o data-center GPU. Kahit sa 4-bit, humigit-kumulang 250 GB ang kailangan ng weights, kaya kailangan mo ng ilang malalaking accelerator o machine na may napakalaking unified memory.
Bakit napakalaki ng memory na kailangan ng modelong may 23B-active parameter?
Ipinapasa ang bawat token sa ilang expert, pero nagbabago ang mga napipili sa bawat token, kaya kailangang handa ang lahat ng expert. Bilis ang itinatakda ng mga active parameter; memory naman ang itinatakda ng kabuuang parameter.
Maaari bang ilagay ang mga expert sa system RAM?
Kayang panatilihin ng ilang engine, gaya ng llama.cpp, ang mga expert weight sa memory ng CPU at i-stream ang mga ito papunta sa GPU. Gumagana ito pero mas mabagal; pag-eksperimento lang ito dapat gamitin.
Kailan magiging eksakto ang mga numerong ito?
Eksakto na ang memory na kailangan ng weights para sa isang partikular na precision. Magiging eksakto ang pagtatantiya sa KV cache kapag inilathala na ng Reflection ang configuration ng model.