Reasoning tidak bisa dinonaktifkan
Beam selalu melakukan reasoning. reasoning_effort menentukan tingkatnya, dari low hingga max, dengan medium sebagai nilai default. Nilai seperti none atau minimal akan menghasilkan error 400.
Alat untuk developer
Rencanakan GPU untuk hosting mandiri, perkirakan token dan biaya, buat kode API yang siap digunakan, dan siapkan coding agent Anda. Setiap angka mengacu pada dokumentasi Reflection sendiri.
Cari tahu berapa VRAM yang dibutuhkan Beam pada setiap presisi dan panjang konteks, serta berapa jumlah GPU yang diperlukan.
02 / costPerkirakan jumlah token per permintaan dengan reasoning, volume harian terhadap batas rate limit, dan biaya self-hosting.
03 / codeKode curl, Python, dan TypeScript yang siap digunakan untuk streaming, tool calls, output JSON, dan chat multi-giliran.
04 / agentsKonfigurasi siap salin untuk Mirror CLI, Pi, OpenCode, dan Hermes Agent dengan Beam.
API ini mengikuti OpenAI Chat Completions, jadi OpenAI SDK resmi dapat digunakan setelah Anda mengganti URL dasar dan kunci API.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam selalu melakukan reasoning. reasoning_effort menentukan tingkatnya, dari low hingga max, dengan medium sebagai nilai default. Nilai seperti none atau minimal akan menghasilkan error 400.
Dalam chat multi-giliran dan pemanggilan tool, sertakan kembali setiap pesan assistant sebelumnya beserta reasoning_content-nya. Tanpanya, API akan menjawab dengan error 400 missing_required_parameter.
Token reasoning dihitung dalam max_completion_tokens. Jika nilainya terlalu rendah, Anda akan mendapat finish_reason "length" dengan jawaban kosong.
Tidak mendukung input gambar, audio, atau file, maupun API Responses, Embeddings, atau Batch. Agent harus menggunakan penyedia Chat Completions yang kompatibel dengan OpenAI.
stop diterima tetapi diabaikan; n harus bernilai 1; logprobs dan logit_bias tidak didukung; user dan metadata akan menghasilkan error.
Batas berlaku per organisasi, per menit, dan per hari UTC. Patuhi Retry-After; x-should-retry: false berarti kuota harian sudah habis hingga 00:00 UTC.
Belum. Reflection telah berjanji akan merilis bobot terbuka di bawah Apache 2.0 pada Oktober 2026. Sampai saat itu, Beam hanya tersedia melalui API beta dengan daftar tunggu.
Semua 501 miliar parameter harus muat di memori: sekitar 1 TB pada BF16, sekitar 500 GB pada FP8, dan sekitar 250 GB pada 4-bit, ditambah KV cache. Ini membutuhkan server dengan beberapa GPU; gunakan perencana memori untuk konfigurasi Anda.
Ya, untuk Chat Completions dan Models. Arahkan SDK ke https://api.reflection.ai/openai/v1 dan gunakan ID model Beam-501B-A23B. Streaming, pemanggilan tool, dan output skema JSON didukung.
Reflection belum mengumumkan harga untuk versi beta. Kalkulator biaya memungkinkan Anda memasukkan harga sendiri dan menunjukkan pengaruh token penalaran terhadap total biaya.