Samodzielne hostowanie
Planer pamięci GPU
Beam to model Mixture-of-Experts: przy każdym tokenie działa tylko 23 miliardy parametrów, ale wszystkie 501 miliardów muszą znajdować się w pamięci. Wybierz precyzję, kontekst i sprzęt, aby sprawdzić, czego potrzebujesz.
Założenia dotyczące mechanizmu uwagi
Reflection opisuje naprzemienne warstwy lokalnego i globalnego mechanizmu uwagi, ale nie opublikowało jeszcze pliku config.json. Te założenia służą do oszacowania pamięci podręcznej KV; zmień je, gdy pojawią się rzeczywiste wartości.
Liczba GPU potrzebnych na same wagi
Minimalna liczba urządzeń dla każdej precyzji, przed uwzględnieniem KV cache, przy założeniu, że można wykorzystać 92% pamięci każdego urządzenia.
| Akcelerator | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Jak działa szacowanie
- Wagi: 501 mld parametrów × liczba bitów na wagę ÷ 8. Formaty GGUF uwzględniają skale bloków, więc Q4_K_M to około 4.85 bitów.
- KV cache: 2 × liczba głów KV × wymiar głowy × liczba bajtów na wartość dla każdego buforowanego tokena w każdej warstwie. Warstwy globalne buforują cały kontekst, a warstwy lokalne — tylko swoje okno.
- Narzut obejmuje aktywacje, grafy CUDA i fragmentację. 10% to rozsądny punkt wyjścia dla vLLM lub SGLang; zmierz wartości dla własnej konfiguracji.
- Liczba urządzeń zakłada, że można wykorzystać 92% pamięci, i jest zaokrąglana do wielkości grup tensor-parallel: 1, 2, 4 lub 8 na serwer.
Pytania
Czy mogę uruchomić Beam na jednej karcie GPU?
Żadna konsumencka ani serwerowa karta GPU nie ma wystarczającej ilości pamięci. Nawet przy 4-bitowej precyzji same wagi zajmują około 250 GB, więc potrzebujesz kilku dużych akceleratorów lub maszyny z bardzo dużą pamięcią zunifikowaną.
Dlaczego model z 23B aktywnych parametrów potrzebuje tak dużo pamięci?
Każdy token jest kierowany do kilku ekspertów, ale ich wybór zmienia się z tokena na token, więc każdy ekspert musi być gotowy do użycia. Liczba aktywnych parametrów wpływa na szybkość, a całkowita liczba parametrów — na zużycie pamięci.
Czy eksperci mogą znajdować się w pamięci RAM systemu?
Niektóre silniki, takie jak llama.cpp, mogą przechowywać wagi ekspertów w pamięci CPU i przesyłać je do GPU. To działa, ale jest znacznie wolniejsze; rozważ to tylko na potrzeby eksperymentów.
Kiedy te wartości będą dokładne?
Zużycie pamięci przez wagi jest już dokładne dla danej precyzji. Szacunek KV cache będzie dokładny, gdy Reflection opublikuje konfigurację modelu.