Hosting autonomo

Pianificatore di memoria GPU

Beam è un modello Mixture-of-Experts: solo 23 miliardi di parametri vengono elaborati per ogni token, ma tutti i 501 miliardi devono risiedere in memoria. Scegli precisione, contesto e hardware per vedere cosa serve.

beam-501b-a23b
Precisione dei pesi
Precisione del KV cache
Ipotesi sull’attenzione

Reflection descrive un’attenzione locale e globale intercalata, ma non ha ancora pubblicato config.json. Questi valori provvisori determinano la stima del KV cache; modificali quando saranno disponibili i valori reali.

Memoria totaleKV cache per token: 26.0 KB
Pesi
501 GB
KV cache
16.6 GB
Overhead
51.8 GB
Memoria totale
569 GB
PesiKV cacheOverhead
GPU NVIDIA H200 141GB necessarie
5 minimo, 8 in pratica
Compatibile con un server da 8 GPU

GPU necessarie solo per i pesi

Numero minimo di dispositivi per precisione, prima di aggiungere la cache KV, considerando utilizzabile il 92% della memoria di ogni dispositivo.

Acceleratore BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Come funziona la stima

  • Pesi: 501 miliardi di parametri × bit per peso ÷ 8. I formati GGUF includono le scale dei blocchi, quindi Q4_K_M corrisponde a circa 4.85 bit.
  • Cache KV: 2 × teste KV × dimensione della testa × byte per valore per ogni token memorizzato nella cache in ogni strato. Gli strati globali memorizzano nella cache l'intero contesto; quelli locali solo la propria finestra.
  • L'overhead copre le attivazioni, i grafi CUDA e la frammentazione. Il 10% è un buon punto di partenza per vLLM o SGLang; misura la tua configurazione.
  • Il numero di dispositivi presuppone che il 92% della memoria sia utilizzabile e arrotonda alle dimensioni dei gruppi di parallelismo tensoriale: 1, 2, 4 o 8 per server.

Domande

Posso eseguire Beam su una sola GPU?

Nessuna GPU consumer o per data center ha memoria sufficiente. Anche a 4 bit, i pesi occupano circa 250 GB, quindi servono diversi acceleratori di fascia alta o una macchina con una quantità molto elevata di memoria unificata.

Perché un modello con 23B parametri attivi richiede così tanta memoria?

A ogni token vengono assegnati pochi esperti, ma questi cambiano da un token all'altro, quindi tutti gli esperti devono essere pronti. I parametri attivi determinano la velocità; i parametri totali determinano la memoria.

Gli esperti possono risiedere nella RAM di sistema?

Alcuni motori, come llama.cpp, possono mantenere i pesi degli esperti nella memoria della CPU e trasferirli in streaming alla GPU. Funziona, ma è molto più lento; valuta questa soluzione solo per gli esperimenti.

Quando questi valori saranno esatti?

La memoria occupata dai pesi è già esatta per una determinata precisione. La stima della cache KV sarà esatta quando Reflection pubblicherà la configurazione del modello.