Hospedagem própria
Planejador de memória de GPU
Beam é um modelo Mixture-of-Experts: apenas 23 bilhões de parâmetros são usados em cada token, mas todos os 501 bilhões precisam ficar na memória. Escolha uma precisão, um contexto e um hardware para ver o que é necessário.
Premissas de atenção
Reflection descreve atenção local e global intercalada, mas ainda não publicou o config.json. Esses valores provisórios determinam a estimativa do cache KV; altere-os quando os valores reais forem divulgados.
GPUs necessárias apenas para os pesos
Dispositivos mínimos por precisão, antes do cache KV, considerando 92% da memória de cada dispositivo disponível.
| Acelerador | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Como a estimativa funciona
- Pesos: 501 bilhões de parâmetros × bits por peso ÷ 8. Os formatos GGUF incluem as escalas de bloco; por isso, Q4_K_M conta como cerca de 4.85 bits.
- Cache KV: 2 × cabeças KV × dimensão da cabeça × bytes por valor para cada token armazenado em cache em cada camada. As camadas globais armazenam todo o contexto; as camadas locais armazenam apenas sua janela.
- A sobrecarga considera ativações, CUDA graphs e fragmentação. 10% é um bom ponto de partida para vLLM ou SGLang; meça sua própria configuração.
- A contagem de dispositivos considera 92% da memória disponível e arredonda para tamanhos de grupo de tensor parallelism de 1, 2, 4 ou 8 por servidor.
Dúvidas
Posso executar o Beam em uma única GPU?
Nenhuma GPU para consumidores ou de data center tem memória suficiente. Mesmo em 4 bits, os pesos ocupam cerca de 250 GB, então você precisa de vários aceleradores grandes ou de uma máquina com memória unificada muito grande.
Por que um modelo com 23B de parâmetros ativos precisa de tanta memória?
Cada token é encaminhado para alguns especialistas, mas eles mudam de um token para outro; por isso, todos os especialistas precisam estar prontos. Os parâmetros ativos determinam a velocidade; o total de parâmetros determina o uso de memória.
Os especialistas podem ficar na RAM do sistema?
Alguns mecanismos, como llama.cpp, podem manter os pesos dos especialistas na memória da CPU e transmiti-los para a GPU. Funciona, mas é muito mais lento; planeje usar essa opção apenas em experimentos.
Quando esses números serão exatos?
O uso de memória dos pesos já é exato para uma determinada precisão. A estimativa do cache KV ficará exata assim que Reflection publicar a configuração do modelo.