Hospedagem própria

Planejador de memória de GPU

Beam é um modelo Mixture-of-Experts: apenas 23 bilhões de parâmetros são usados em cada token, mas todos os 501 bilhões precisam ficar na memória. Escolha uma precisão, um contexto e um hardware para ver o que é necessário.

beam-501b-a23b
Precisão dos pesos
Precisão do cache KV
Premissas de atenção

Reflection descreve atenção local e global intercalada, mas ainda não publicou o config.json. Esses valores provisórios determinam a estimativa do cache KV; altere-os quando os valores reais forem divulgados.

Memória totalCache KV por token: 26.0 KB
Pesos
501 GB
Cache KV
16.6 GB
Sobrecarga
51.8 GB
Memória total
569 GB
PesosCache KVSobrecarga
GPUs NVIDIA H200 141GB necessárias
Mínimo de 5; 8 na prática
Cabe em um único servidor com 8 GPUs

GPUs necessárias apenas para os pesos

Dispositivos mínimos por precisão, antes do cache KV, considerando 92% da memória de cada dispositivo disponível.

Acelerador BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Como a estimativa funciona

  • Pesos: 501 bilhões de parâmetros × bits por peso ÷ 8. Os formatos GGUF incluem as escalas de bloco; por isso, Q4_K_M conta como cerca de 4.85 bits.
  • Cache KV: 2 × cabeças KV × dimensão da cabeça × bytes por valor para cada token armazenado em cache em cada camada. As camadas globais armazenam todo o contexto; as camadas locais armazenam apenas sua janela.
  • A sobrecarga considera ativações, CUDA graphs e fragmentação. 10% é um bom ponto de partida para vLLM ou SGLang; meça sua própria configuração.
  • A contagem de dispositivos considera 92% da memória disponível e arredonda para tamanhos de grupo de tensor parallelism de 1, 2, 4 ou 8 por servidor.

Dúvidas

Posso executar o Beam em uma única GPU?

Nenhuma GPU para consumidores ou de data center tem memória suficiente. Mesmo em 4 bits, os pesos ocupam cerca de 250 GB, então você precisa de vários aceleradores grandes ou de uma máquina com memória unificada muito grande.

Por que um modelo com 23B de parâmetros ativos precisa de tanta memória?

Cada token é encaminhado para alguns especialistas, mas eles mudam de um token para outro; por isso, todos os especialistas precisam estar prontos. Os parâmetros ativos determinam a velocidade; o total de parâmetros determina o uso de memória.

Os especialistas podem ficar na RAM do sistema?

Alguns mecanismos, como llama.cpp, podem manter os pesos dos especialistas na memória da CPU e transmiti-los para a GPU. Funciona, mas é muito mais lento; planeje usar essa opção apenas em experimentos.

Quando esses números serão exatos?

O uso de memória dos pesos já é exato para uma determinada precisão. A estimativa do cache KV ficará exata assim que Reflection publicar a configuração do modelo.