Hosting autonomo
Pianificatore di memoria GPU
Beam è un modello Mixture-of-Experts: solo 23 miliardi di parametri vengono elaborati per ogni token, ma tutti i 501 miliardi devono risiedere in memoria. Scegli precisione, contesto e hardware per vedere cosa serve.
Ipotesi sull’attenzione
Reflection descrive un’attenzione locale e globale intercalata, ma non ha ancora pubblicato config.json. Questi valori provvisori determinano la stima del KV cache; modificali quando saranno disponibili i valori reali.
GPU necessarie solo per i pesi
Numero minimo di dispositivi per precisione, prima di aggiungere la cache KV, considerando utilizzabile il 92% della memoria di ogni dispositivo.
| Acceleratore | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Come funziona la stima
- Pesi: 501 miliardi di parametri × bit per peso ÷ 8. I formati GGUF includono le scale dei blocchi, quindi Q4_K_M corrisponde a circa 4.85 bit.
- Cache KV: 2 × teste KV × dimensione della testa × byte per valore per ogni token memorizzato nella cache in ogni strato. Gli strati globali memorizzano nella cache l'intero contesto; quelli locali solo la propria finestra.
- L'overhead copre le attivazioni, i grafi CUDA e la frammentazione. Il 10% è un buon punto di partenza per vLLM o SGLang; misura la tua configurazione.
- Il numero di dispositivi presuppone che il 92% della memoria sia utilizzabile e arrotonda alle dimensioni dei gruppi di parallelismo tensoriale: 1, 2, 4 o 8 per server.
Domande
Posso eseguire Beam su una sola GPU?
Nessuna GPU consumer o per data center ha memoria sufficiente. Anche a 4 bit, i pesi occupano circa 250 GB, quindi servono diversi acceleratori di fascia alta o una macchina con una quantità molto elevata di memoria unificata.
Perché un modello con 23B parametri attivi richiede così tanta memoria?
A ogni token vengono assegnati pochi esperti, ma questi cambiano da un token all'altro, quindi tutti gli esperti devono essere pronti. I parametri attivi determinano la velocità; i parametri totali determinano la memoria.
Gli esperti possono risiedere nella RAM di sistema?
Alcuni motori, come llama.cpp, possono mantenere i pesi degli esperti nella memoria della CPU e trasferirli in streaming alla GPU. Funziona, ma è molto più lento; valuta questa soluzione solo per gli esperimenti.
Quando questi valori saranno esatti?
La memoria occupata dai pesi è già esatta per una determinata precisione. La stima della cache KV sarà esatta quando Reflection pubblicherà la configurazione del modello.