자체 호스팅
GPU 메모리 플래너
Beam은 Mixture-of-Experts 모델입니다. 각 토큰을 처리할 때는 23B개의 파라미터만 작동하지만, 501B개 파라미터 전체를 메모리에 올려야 합니다. 정밀도, 컨텍스트, 하드웨어를 선택해 필요한 사양을 확인하세요.
beam-501b-a23b
가중치 정밀도
KV 캐시 정밀도
어텐션 가정
Reflection은 로컬 어텐션과 글로벌 어텐션을 교차 적용한다고 설명했지만, 아직 config.json을 공개하지 않았습니다. 이 임시 값으로 KV 캐시를 추정합니다. 실제 값이 공개되면 변경하세요.
총 메모리토큰당 KV 캐시: 26.0 KB
가중치
501 GB
KV 캐시
16.6 GB
오버헤드
51.8 GB
총 메모리
569 GB
가중치KV 캐시오버헤드
NVIDIA H200 141GB 필요
최소 5, 실제로는 8
8-GPU 서버 한 대에 탑재 가능
가중치만을 위한 GPU 수
각 장치 메모리의 92%를 사용할 수 있다고 가정했을 때 KV 캐시를 제외한 정밀도별 최소 장치 수입니다.
| 가속기 | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
추정 방식
- 가중치: 5010억 개 파라미터 × 가중치당 비트 수 ÷ 8. GGUF 형식에는 블록 스케일이 포함되므로 Q4_K_M은 약 4.85비트로 계산합니다.
- KV 캐시: 캐시되는 모든 토큰과 모든 레이어에 대해 2 × KV 헤드 수 × 헤드 차원 × 값당 바이트 수로 계산합니다. 전역 레이어는 전체 컨텍스트를 캐시하고, 로컬 레이어는 윈도우만 캐시합니다.
- 오버헤드에는 활성화, CUDA 그래프, 메모리 단편화가 포함됩니다. vLLM이나 SGLang에서는 10%부터 시작하는 것이 적절합니다. 실제 설정에서 직접 측정해 보세요.
- 장치 수는 메모리의 92%를 사용할 수 있다고 가정하고, 서버당 텐서 병렬 그룹 크기를 1, 2, 4 또는 8로 올림해 계산합니다.
질문
Beam을 GPU 하나에서 실행할 수 있나요?
소비자용 GPU든 데이터센터 GPU든 메모리가 충분한 제품은 없습니다. 4비트에서도 가중치가 약 250 GB를 차지하므로 대형 가속기 여러 대나 매우 큰 통합 메모리를 갖춘 컴퓨터가 필요합니다.
활성 파라미터가 23B인 모델은 왜 이렇게 많은 메모리가 필요한가요?
각 토큰은 몇몇 전문가로 라우팅되지만, 토큰마다 선택되는 전문가가 달라지므로 모든 전문가를 사용할 준비가 된 상태로 유지해야 합니다. 활성 파라미터 수는 속도를, 전체 파라미터 수는 메모리 사용량을 결정합니다.
전문가를 시스템 RAM에 둘 수 있나요?
llama.cpp 같은 일부 엔진은 전문가 가중치를 CPU 메모리에 두고 GPU로 스트리밍할 수 있습니다. 작동은 하지만 훨씬 느립니다. 실험용으로만 고려하세요.
이 수치는 언제 정확해지나요?
가중치 메모리는 주어진 정밀도에서 이미 정확합니다. Reflection이 모델 설정을 공개하면 KV 캐시 추정치도 정확해집니다.