Самостоятельный хостинг
Планировщик памяти GPU
Beam — модель Mixture-of-Experts: для обработки каждого токена используются только 23 млрд параметров, но в памяти должны находиться все 501 млрд. Выберите точность, контекст и оборудование, чтобы узнать, что потребуется.
Параметры внимания
Reflection описывает чередование локального и глобального внимания, но пока не опубликовала config.json. Эти значения-заглушки используются для расчёта KV-кэша; замените их, когда появятся реальные значения.
Количество GPU только для весов
Минимальное число устройств для каждой точности без учёта KV-кэша; предполагается, что доступно 92% памяти каждого устройства.
| Ускоритель | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Как работает оценка
- Веса: 501 млрд параметров × бит на вес ÷ 8. Форматы GGUF учитывают блочные масштабы, поэтому Q4_K_M соответствует примерно 4.85 битам.
- KV-кэш: 2 × число KV-голов × размерность головы × байт на значение для каждого кэшируемого токена в каждом слое. Глобальные слои кэшируют весь контекст, локальные — только своё окно.
- Запас учитывает активации, графы CUDA и фрагментацию. 10% — разумная отправная точка для vLLM или SGLang; измерьте показатели на своей конфигурации.
- При расчёте числа устройств предполагается, что доступно 92% памяти; результат округляется до размеров групп тензорного параллелизма: 1, 2, 4 или 8 GPU на сервер.
Вопросы
Можно ли запустить Beam на одном GPU?
Ни одна потребительская или серверная GPU не располагает достаточным объёмом памяти. Даже в 4-битном формате веса занимают около 250 GB, поэтому понадобится несколько мощных ускорителей или устройство с очень большим объёмом унифицированной памяти.
Почему модели с 23B активных параметров требуется так много памяти?
Для каждого токена выбирается несколько экспертов, но их состав меняется от токена к токену, поэтому все эксперты должны быть готовы к работе. Число активных параметров определяет скорость, а общее число параметров — требования к памяти.
Можно ли хранить экспертов в системной оперативной памяти?
Некоторые движки, например llama.cpp, могут хранить веса экспертов в памяти CPU и передавать их на GPU по мере необходимости. Это работает, но заметно медленнее; используйте такой подход только для экспериментов.
Когда эти цифры станут точными?
Объём памяти для весов уже можно точно рассчитать для заданной точности. Оценка KV-кэша станет точной, когда Reflection опубликует конфигурацию модели.