Tự host
Công cụ lập kế hoạch bộ nhớ GPU
Beam là mô hình Mixture-of-Experts: chỉ 23 tỷ tham số hoạt động trên mỗi token, nhưng cả 501 tỷ tham số đều phải nằm trong bộ nhớ. Chọn độ chính xác, ngữ cảnh và phần cứng để xem cần những gì.
Giả định về cơ chế attention
Reflection mô tả cơ chế attention cục bộ và toàn cục đan xen, nhưng chưa công bố config.json. Các giá trị tạm này dùng để ước tính KV cache; hãy thay đổi khi có các giá trị thực.
Số GPU cần thiết chỉ tính riêng cho trọng số
Số thiết bị tối thiểu cho mỗi độ chính xác, chưa tính KV cache, với 92% bộ nhớ của mỗi thiết bị có thể sử dụng.
| Bộ tăng tốc | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Cách tính ước lượng
- Trọng số: 501 tỷ tham số × số bit mỗi trọng số ÷ 8. Các định dạng GGUF bao gồm hệ số tỷ lệ theo khối, nên Q4_K_M được tính là khoảng 4.85 bit.
- KV cache: 2 × số KV head × kích thước head × số byte mỗi giá trị cho mỗi token được lưu trong cache ở từng layer. Các layer toàn cục lưu cache cho toàn bộ ngữ cảnh; các layer cục bộ chỉ lưu cache cho cửa sổ của chúng.
- Phần bộ nhớ dự phòng bao gồm activation, CUDA graph và phân mảnh. 10% là mức khởi đầu hợp lý cho vLLM hoặc SGLang; hãy đo trên cấu hình của bạn.
- Số thiết bị giả định 92% bộ nhớ có thể sử dụng và làm tròn theo kích thước nhóm tensor parallel là 1, 2, 4 hoặc 8 trên mỗi máy chủ.
Câu hỏi
Tôi có thể chạy Beam trên một GPU không?
Không có GPU tiêu dùng hay GPU trung tâm dữ liệu nào có đủ bộ nhớ. Ngay cả ở 4-bit, trọng số cũng chiếm khoảng 250 GB, vì vậy bạn cần một số accelerator lớn hoặc một máy có bộ nhớ hợp nhất dung lượng rất lớn.
Vì sao mô hình có 23B tham số kích hoạt lại cần nhiều bộ nhớ đến vậy?
Mỗi token được điều hướng đến một vài chuyên gia, nhưng các chuyên gia được chọn thay đổi theo từng token, nên mọi chuyên gia đều phải luôn sẵn sàng. Số tham số được kích hoạt quyết định tốc độ; tổng số tham số quyết định dung lượng bộ nhớ.
Có thể lưu các chuyên gia trong RAM hệ thống không?
Một số engine, chẳng hạn như llama.cpp, có thể lưu trọng số chuyên gia trong bộ nhớ CPU rồi truyền chúng đến GPU. Cách này dùng được nhưng chậm hơn nhiều; chỉ nên tính đến nếu bạn đang thử nghiệm.
Khi nào các con số này sẽ chính xác?
Dung lượng bộ nhớ cho trọng số đã chính xác với một độ chính xác nhất định. Ước tính KV cache sẽ chính xác khi Reflection công bố cấu hình của mô hình.