自托管
GPU 内存规划器
Beam 是 Mixture-of-Experts 模型:每个 token 只会用到 230 亿个参数,但全部 5010 亿个参数都必须驻留在内存中。选择精度、上下文长度和硬件,查看所需资源。
beam-501b-a23b
权重精度
KV 缓存精度
注意力机制假设
Reflection 介绍了交错式局部和全局注意力,但尚未发布 config.json。这些占位值用于估算 KV 缓存;实际值公布后请相应调整。
总内存每个 token 的 KV 缓存:26.0 KB
权重
501 GB
KV 缓存
16.6 GB
开销
51.8 GB
总内存
569 GB
权重KV 缓存开销
所需 NVIDIA H200 141GB 数量
至少 5,实际建议 8
可放入一台配备 8 块 GPU 的服务器
仅权重所需的 GPU 数量
各精度下所需的最少设备数(不含 KV 缓存),每台设备可用显存按 92% 计算。
| 加速器 | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
估算方法
- 权重:5010 亿个参数 × 每个权重的位数 ÷ 8。GGUF 格式已包含块级缩放因子,因此 Q4_K_M 按约 4.85 位计算。
- KV 缓存:每个缓存 token 在每一层中占用 2 × KV 头数 × 头维度 × 每个值占用的字节数。全局层会缓存整个上下文;局部层只缓存其窗口。
- 额外开销包括激活值、CUDA 图和内存碎片。对于 vLLM 或 SGLang,10% 是合理的起点;请根据自己的配置进行测量。
- 设备数量按 92% 的显存可用计算,并向上取整到每台服务器 1、2、4 或 8 台设备的张量并行组大小。
常见问题
我可以在一张 GPU 上运行 Beam 吗?
没有任何消费级或数据中心 GPU 拥有足够的显存。即使采用 4-bit 精度,权重也需要约 250 GB,因此你需要多张大型加速卡,或配备超大统一内存的机器。
为什么一个 23B 活跃参数的模型需要这么多内存?
每个 token 会被路由到少数几个专家,但路由到哪些专家会随 token 改变,因此必须让所有专家随时可用。活跃参数决定速度;总参数决定内存用量。
专家权重可以放在系统 RAM 中吗?
一些引擎(例如 llama.cpp)可以将专家权重保存在 CPU 内存中,并将其流式传输到 GPU。这样做可行,但速度会慢得多;仅建议在实验时采用。
这些数值什么时候会准确?
给定精度下的权重显存用量已经是精确的。Reflection 发布模型配置后,KV 缓存估算也会变得准确。