自托管

GPU 内存规划器

Beam 是 Mixture-of-Experts 模型:每个 token 只会用到 230 亿个参数,但全部 5010 亿个参数都必须驻留在内存中。选择精度、上下文长度和硬件,查看所需资源。

beam-501b-a23b
权重精度
KV 缓存精度
注意力机制假设

Reflection 介绍了交错式局部和全局注意力,但尚未发布 config.json。这些占位值用于估算 KV 缓存;实际值公布后请相应调整。

总内存每个 token 的 KV 缓存:26.0 KB
权重
501 GB
KV 缓存
16.6 GB
开销
51.8 GB
总内存
569 GB
权重KV 缓存开销
所需 NVIDIA H200 141GB 数量
至少 5,实际建议 8
可放入一台配备 8 块 GPU 的服务器

仅权重所需的 GPU 数量

各精度下所需的最少设备数(不含 KV 缓存),每台设备可用显存按 92% 计算。

加速器 BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

估算方法

  • 权重:5010 亿个参数 × 每个权重的位数 ÷ 8。GGUF 格式已包含块级缩放因子,因此 Q4_K_M 按约 4.85 位计算。
  • KV 缓存:每个缓存 token 在每一层中占用 2 × KV 头数 × 头维度 × 每个值占用的字节数。全局层会缓存整个上下文;局部层只缓存其窗口。
  • 额外开销包括激活值、CUDA 图和内存碎片。对于 vLLM 或 SGLang,10% 是合理的起点;请根据自己的配置进行测量。
  • 设备数量按 92% 的显存可用计算,并向上取整到每台服务器 1、2、4 或 8 台设备的张量并行组大小。

常见问题

我可以在一张 GPU 上运行 Beam 吗?

没有任何消费级或数据中心 GPU 拥有足够的显存。即使采用 4-bit 精度,权重也需要约 250 GB,因此你需要多张大型加速卡,或配备超大统一内存的机器。

为什么一个 23B 活跃参数的模型需要这么多内存?

每个 token 会被路由到少数几个专家,但路由到哪些专家会随 token 改变,因此必须让所有专家随时可用。活跃参数决定速度;总参数决定内存用量。

专家权重可以放在系统 RAM 中吗?

一些引擎(例如 llama.cpp)可以将专家权重保存在 CPU 内存中,并将其流式传输到 GPU。这样做可行,但速度会慢得多;仅建议在实验时采用。

这些数值什么时候会准确?

给定精度下的权重显存用量已经是精确的。Reflection 发布模型配置后,KV 缓存估算也会变得准确。