Alojamiento propio

Planificador de memoria GPU

Beam es un modelo Mixture-of-Experts: solo 23B parámetros se procesan con cada token, pero los 501B deben estar en memoria. Elige una precisión, un contexto y hardware para ver qué necesitas.

beam-501b-a23b
Precisión de los pesos
Precisión de la caché KV
Supuestos de atención

Reflection describe una atención local y global intercalada, pero aún no ha publicado config.json. Estos valores provisionales determinan la estimación de la caché KV; cámbialos cuando se conozcan los valores reales.

Memoria totalCaché KV por token: 26.0 KB
Pesos
501 GB
Caché KV
16.6 GB
Sobrecarga
51.8 GB
Memoria total
569 GB
PesosCaché KVSobrecarga
GPU NVIDIA H200 141GB necesarias
5 como mínimo, 8 en la práctica
Cabe en un servidor de 8 GPU

GPU necesarias solo para los pesos

Dispositivos mínimos por precisión, antes de contar la caché KV, suponiendo que se puede usar el 92% de la memoria de cada dispositivo.

Acelerador BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Cómo funciona la estimación

  • Pesos: 501 mil millones de parámetros × bits por peso ÷ 8. Los formatos GGUF incluyen sus escalas de bloque, así que Q4_K_M cuenta como unos 4.85 bits.
  • Caché KV: 2 × cabezas KV × dimensión de cabeza × bytes por valor para cada token almacenado en caché de cada capa. Las capas globales almacenan en caché todo el contexto; las locales, solo su ventana.
  • La sobrecarga incluye activaciones, grafos CUDA y fragmentación. Un 10% es un buen punto de partida para vLLM o SGLang; mide tu propia configuración.
  • El número de dispositivos supone que se puede usar el 92% de la memoria y se redondea a grupos de paralelismo tensorial de 1, 2, 4 u 8 por servidor.

Preguntas

¿Puedo ejecutar Beam en una sola GPU?

Ninguna GPU de consumo o de centro de datos tiene memoria suficiente. Incluso a 4 bits, los pesos ocupan unos 250 GB, así que necesitas varios aceleradores grandes o una máquina con una cantidad muy grande de memoria unificada.

¿Por qué un modelo con 23B de parámetros activos necesita tanta memoria?

Cada token se asigna a unos pocos expertos, pero la selección cambia de un token a otro, así que todos los expertos deben estar listos. Los parámetros activos determinan la velocidad; el total de parámetros determina la memoria.

¿Pueden estar los expertos en la RAM del sistema?

Algunos motores, como llama.cpp, pueden mantener los pesos de los expertos en la memoria de la CPU y transferirlos a la GPU. Funciona, pero es mucho más lento; considéralo solo para experimentos.

¿Cuándo serán exactas estas cifras?

El uso de memoria de los pesos ya es exacto para una precisión determinada. La estimación de la caché KV será exacta cuando Reflection publique la configuración del modelo.