Hosting mandiri
Perencana memori GPU
Beam adalah model Mixture-of-Experts: hanya 23 miliar parameter yang bekerja pada setiap token, tetapi semua 501 miliar parameter harus dimuat di memori. Pilih presisi, konteks, dan perangkat keras untuk mengetahui kebutuhan sistem.
Asumsi attention
Reflection menjelaskan bahwa model menggunakan attention lokal dan global yang diselingi, tetapi belum menerbitkan config.json. Nilai sementara ini digunakan untuk memperkirakan KV cache; ubah nilainya setelah nilai sebenarnya tersedia.
Jumlah GPU yang dibutuhkan untuk bobot saja
Jumlah minimum perangkat untuk setiap presisi sebelum memperhitungkan KV cache, dengan 92% memori tiap perangkat yang dapat digunakan.
| Akselerator | BF16 / FP16 1,002 GB | FP8 501 GB | GGUF Q4_K_M 304 GB | INT4 / FP4 251 GB |
|---|---|---|---|---|
| NVIDIA H100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA H200 141GB | × 8 | × 4 | × 3 | × 2 |
| NVIDIA B200 180GB | × 7 | × 4 | × 2 | × 2 |
| NVIDIA B300 288GB | × 4 | × 2 | × 2 | × 1 |
| NVIDIA A100 80GB | × 14 | × 7 | × 5 | × 4 |
| NVIDIA RTX PRO 6000 96GB | × 12 | × 6 | × 4 | × 3 |
| NVIDIA L40S 48GB | × 23 | × 12 | × 7 | × 6 |
| NVIDIA RTX 5090 32GB | × 35 | × 18 | × 11 | × 9 |
| NVIDIA RTX 4090 24GB | × 46 | × 23 | × 14 | × 12 |
| AMD Instinct MI300X 192GB | × 6 | × 3 | × 2 | × 2 |
| AMD Instinct MI325X 256GB | × 5 | × 3 | × 2 | × 2 |
| AMD Instinct MI355X 288GB | × 4 | × 2 | × 2 | × 1 |
| Apple M3 Ultra 512GB (unified) | × 3 | × 2 | × 1 | × 1 |
Cara kerja estimasi
- Bobot: 501 miliar parameter × bit per bobot ÷ 8. Format GGUF mencakup skala bloknya, jadi Q4_K_M dihitung sekitar 4.85 bit.
- KV cache: 2 × jumlah head KV × dimensi head × byte per nilai untuk setiap token yang di-cache di setiap layer. Layer global menyimpan seluruh konteks; layer lokal hanya menyimpan jendelanya.
- Overhead mencakup aktivasi, CUDA graphs, dan fragmentasi. 10% adalah perkiraan awal yang wajar untuk vLLM atau SGLang; ukur konfigurasi Anda sendiri.
- Jumlah perangkat mengasumsikan 92% memori dapat digunakan dan dibulatkan ke ukuran grup tensor parallel 1, 2, 4, atau 8 per server.
Pertanyaan
Bisakah saya menjalankan Beam di satu GPU?
Tidak ada GPU konsumen atau pusat data yang memiliki cukup memori. Bahkan pada 4-bit, bobotnya memerlukan sekitar 250 GB, jadi Anda membutuhkan beberapa akselerator besar atau mesin dengan memori terpadu berkapasitas sangat besar.
Mengapa model dengan 23B parameter aktif membutuhkan begitu banyak memori?
Setiap token diarahkan ke beberapa pakar, tetapi pakar yang dipilih berubah dari satu token ke token berikutnya, jadi semua pakar harus selalu siap. Jumlah parameter aktif menentukan kecepatan; jumlah total parameter menentukan kebutuhan memori.
Bisakah pakar disimpan di RAM sistem?
Beberapa engine, seperti llama.cpp, dapat menyimpan bobot pakar di memori CPU dan mengalirkannya ke GPU. Cara ini bisa digunakan, tetapi jauh lebih lambat; pertimbangkan hanya untuk eksperimen.
Kapan angka-angka ini akan akurat?
Penggunaan memori bobot sudah akurat untuk presisi tertentu. Estimasi KV cache akan akurat setelah Reflection menerbitkan konfigurasi modelnya.