Auto-hébergement
Planificateur de mémoire GPU
Beam est un modèle Mixture-of-Experts : seuls 23 milliards de paramètres sont utilisés pour chaque token, mais les 501 milliards doivent tenir en mémoire. Choisissez une précision, un contexte et du matériel pour voir ce qu’il vous faut.
Hypothèses sur l’attention
Reflection décrit une attention locale et globale entrelacée, mais n’a pas encore publié le fichier config.json. Ces valeurs provisoires servent à estimer le cache KV ; modifiez-les lorsque les vraies valeurs seront disponibles.
Nombre de GPU nécessaires pour les poids seuls
Nombre minimal de GPU par précision, avant prise en compte du cache KV, avec 92% de la mémoire de chaque GPU utilisable.
| Accélérateur | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Fonctionnement de l’estimation
- Poids : 501 milliards de paramètres × bits par poids ÷ 8. Les formats GGUF incluent les facteurs d’échelle des blocs ; Q4_K_M équivaut donc à environ 4.85 bits.
- Cache KV : 2 × nombre de têtes KV × dimension des têtes × octets par valeur, pour chaque token mis en cache dans chaque couche. Les couches globales mettent en cache l’intégralité du contexte ; les couches locales ne mettent en cache que leur fenêtre.
- La marge couvre les activations, les graphes CUDA et la fragmentation. 10% est un bon point de départ pour vLLM ou SGLang ; mesurez votre propre configuration.
- Le nombre de GPU part du principe que 92% de la mémoire est utilisable et arrondit aux tailles de groupe de parallélisme tensoriel de 1, 2, 4 ou 8 par serveur.
Questions
Puis-je exécuter Beam sur un seul GPU ?
Aucun GPU grand public ou de centre de données n’a suffisamment de mémoire. Même en 4 bits, les poids occupent environ 250 GB ; il vous faut donc plusieurs accélérateurs haut de gamme ou une machine dotée d’une très grande mémoire unifiée.
Pourquoi un modèle avec 23 milliards de paramètres actifs nécessite-t-il autant de mémoire ?
Chaque token est acheminé vers quelques experts, mais les experts sélectionnés varient d’un token à l’autre : chacun doit donc être prêt. Le nombre de paramètres actifs détermine la vitesse ; le nombre total de paramètres détermine la mémoire.
Les experts peuvent-ils résider dans la RAM système ?
Certains moteurs, comme llama.cpp, peuvent garder les poids des experts dans la mémoire du CPU et les transférer vers le GPU. Cela fonctionne, mais c’est beaucoup plus lent ; ne prévoyez cette solution que pour des expérimentations.
Quand ces chiffres seront-ils exacts ?
La mémoire occupée par les poids se calcule déjà exactement pour une précision donnée. L’estimation du cache KV sera exacte dès que Reflection publiera la configuration du modèle.