Самостоятельный хостинг

Планировщик памяти GPU

Beam — модель Mixture-of-Experts: для обработки каждого токена используются только 23 млрд параметров, но в памяти должны находиться все 501 млрд. Выберите точность, контекст и оборудование, чтобы узнать, что потребуется.

beam-501b-a23b
Точность весов
Точность KV-кэша
Параметры внимания

Reflection описывает чередование локального и глобального внимания, но пока не опубликовала config.json. Эти значения-заглушки используются для расчёта KV-кэша; замените их, когда появятся реальные значения.

Общий объём памятиKV-кэш на токен: 26.0 КБ
Веса
501 GB
KV-кэш
16.6 GB
Накладные расходы
51.8 GB
Общий объём памяти
569 GB
ВесаKV-кэшНакладные расходы
Требуется NVIDIA H200 141GB
Минимум — 5, на практике — 8
Помещается на один сервер с 8 GPU

Количество GPU только для весов

Минимальное число устройств для каждой точности без учёта KV-кэша; предполагается, что доступно 92% памяти каждого устройства.

Ускоритель BF16 / FP16
1,002 GB
FP8
501 GB
GGUF Q4_K_M
304 GB
INT4 / FP4
251 GB
NVIDIA H100 80GB × 14× 7× 5× 4
NVIDIA H200 141GB × 8× 4× 3× 2
NVIDIA B200 180GB × 7× 4× 2× 2
NVIDIA B300 288GB × 4× 2× 2× 1
NVIDIA A100 80GB × 14× 7× 5× 4
NVIDIA RTX PRO 6000 96GB × 12× 6× 4× 3
NVIDIA L40S 48GB × 23× 12× 7× 6
NVIDIA RTX 5090 32GB × 35× 18× 11× 9
NVIDIA RTX 4090 24GB × 46× 23× 14× 12
AMD Instinct MI300X 192GB × 6× 3× 2× 2
AMD Instinct MI325X 256GB × 5× 3× 2× 2
AMD Instinct MI355X 288GB × 4× 2× 2× 1
Apple M3 Ultra 512GB (unified) × 3× 2× 1× 1

Как работает оценка

  • Веса: 501 млрд параметров × бит на вес ÷ 8. Форматы GGUF учитывают блочные масштабы, поэтому Q4_K_M соответствует примерно 4.85 битам.
  • KV-кэш: 2 × число KV-голов × размерность головы × байт на значение для каждого кэшируемого токена в каждом слое. Глобальные слои кэшируют весь контекст, локальные — только своё окно.
  • Запас учитывает активации, графы CUDA и фрагментацию. 10% — разумная отправная точка для vLLM или SGLang; измерьте показатели на своей конфигурации.
  • При расчёте числа устройств предполагается, что доступно 92% памяти; результат округляется до размеров групп тензорного параллелизма: 1, 2, 4 или 8 GPU на сервер.

Вопросы

Можно ли запустить Beam на одном GPU?

Ни одна потребительская или серверная GPU не располагает достаточным объёмом памяти. Даже в 4-битном формате веса занимают около 250 GB, поэтому понадобится несколько мощных ускорителей или устройство с очень большим объёмом унифицированной памяти.

Почему модели с 23B активных параметров требуется так много памяти?

Для каждого токена выбирается несколько экспертов, но их состав меняется от токена к токену, поэтому все эксперты должны быть готовы к работе. Число активных параметров определяет скорость, а общее число параметров — требования к памяти.

Можно ли хранить экспертов в системной оперативной памяти?

Некоторые движки, например llama.cpp, могут хранить веса экспертов в памяти CPU и передавать их на GPU по мере необходимости. Это работает, но заметно медленнее; используйте такой подход только для экспериментов.

Когда эти цифры станут точными?

Объём памяти для весов уже можно точно рассчитать для заданной точности. Оценка KV-кэша станет точной, когда Reflection опубликует конфигурацию модели.