자체 호스팅

GPU 메모리 플래너

Beam은 Mixture-of-Experts 모델입니다. 각 토큰을 처리할 때는 23B개의 파라미터만 작동하지만, 501B개 파라미터 전체를 메모리에 올려야 합니다. 정밀도, 컨텍스트, 하드웨어를 선택해 필요한 사양을 확인하세요.

beam-501b-a23b
가중치 정밀도
KV 캐시 정밀도
어텐션 가정

Reflection은 로컬 어텐션과 글로벌 어텐션을 교차 적용한다고 설명했지만, 아직 config.json을 공개하지 않았습니다. 이 임시 값으로 KV 캐시를 추정합니다. 실제 값이 공개되면 변경하세요.

총 메모리토큰당 KV 캐시: 26.0 KB
가중치
501 GB
KV 캐시
16.6 GB
오버헤드
51.8 GB
총 메모리
569 GB
가중치KV 캐시오버헤드
NVIDIA H200 141GB 필요
최소 5, 실제로는 8
8-GPU 서버 한 대에 탑재 가능

가중치만을 위한 GPU 수

각 장치 메모리의 92%를 사용할 수 있다고 가정했을 때 KV 캐시를 제외한 정밀도별 최소 장치 수입니다.

가속기 BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

추정 방식

  • 가중치: 5010억 개 파라미터 × 가중치당 비트 수 ÷ 8. GGUF 형식에는 블록 스케일이 포함되므로 Q4_K_M은 약 4.85비트로 계산합니다.
  • KV 캐시: 캐시되는 모든 토큰과 모든 레이어에 대해 2 × KV 헤드 수 × 헤드 차원 × 값당 바이트 수로 계산합니다. 전역 레이어는 전체 컨텍스트를 캐시하고, 로컬 레이어는 윈도우만 캐시합니다.
  • 오버헤드에는 활성화, CUDA 그래프, 메모리 단편화가 포함됩니다. vLLM이나 SGLang에서는 10%부터 시작하는 것이 적절합니다. 실제 설정에서 직접 측정해 보세요.
  • 장치 수는 메모리의 92%를 사용할 수 있다고 가정하고, 서버당 텐서 병렬 그룹 크기를 1, 2, 4 또는 8로 올림해 계산합니다.

질문

Beam을 GPU 하나에서 실행할 수 있나요?

소비자용 GPU든 데이터센터 GPU든 메모리가 충분한 제품은 없습니다. 4비트에서도 가중치가 약 250 GB를 차지하므로 대형 가속기 여러 대나 매우 큰 통합 메모리를 갖춘 컴퓨터가 필요합니다.

활성 파라미터가 23B인 모델은 왜 이렇게 많은 메모리가 필요한가요?

각 토큰은 몇몇 전문가로 라우팅되지만, 토큰마다 선택되는 전문가가 달라지므로 모든 전문가를 사용할 준비가 된 상태로 유지해야 합니다. 활성 파라미터 수는 속도를, 전체 파라미터 수는 메모리 사용량을 결정합니다.

전문가를 시스템 RAM에 둘 수 있나요?

llama.cpp 같은 일부 엔진은 전문가 가중치를 CPU 메모리에 두고 GPU로 스트리밍할 수 있습니다. 작동은 하지만 훨씬 느립니다. 실험용으로만 고려하세요.

이 수치는 언제 정확해지나요?

가중치 메모리는 주어진 정밀도에서 이미 정확합니다. Reflection이 모델 설정을 공개하면 KV 캐시 추정치도 정확해집니다.