Reasoning lässt sich nicht deaktivieren
Beam führt immer Reasoning aus. reasoning_effort legt fest, wie viel – von low bis max. Standardmäßig gilt medium. Werte wie none oder minimal führen zu einem 400-Fehler.
Entwickler-Tools
Plane GPUs fürs Self-Hosting, schätze Tokenzahl und Kosten, generiere funktionierenden API-Code und richte deinen Coding-Agent ein. Alle Zahlen basieren auf der offiziellen Dokumentation von Reflection.
Wie viel VRAM Beam bei jeder Präzision und Kontextlänge benötigt und wie viele GPUs dafür nötig sind.
02 / costSchätze Tokens pro Anfrage einschließlich Reasoning, das tägliche Volumen im Verhältnis zu Rate-Limits und die Kosten fürs Selbsthosting.
03 / codeFunktionierende curl-, Python- und TypeScript-Beispiele für Streaming, Tool-Aufrufe, JSON-Ausgabe und mehrstufige Chats.
04 / agentsSofort einsatzbereite Konfigurationen für Mirror CLI, Pi, OpenCode und Hermes Agent mit Beam.
Die API folgt OpenAI Chat Completions. Deshalb funktionieren die offiziellen OpenAI SDKs, sobald du Basis-URL und Schlüssel änderst.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam führt immer Reasoning aus. reasoning_effort legt fest, wie viel – von low bis max. Standardmäßig gilt medium. Werte wie none oder minimal führen zu einem 400-Fehler.
Gib bei mehrteiligen Chats und Tool-Aufrufen jede vorherige assistant-Nachricht zusammen mit ihrem reasoning_content zurück. Andernfalls antwortet die API mit 400 missing_required_parameter.
Reasoning-Tokens zählen zu max_completion_tokens. Ist der Wert zu niedrig, erhältst du finish_reason "length" und eine leere Antwort.
Keine Bild-, Audio- oder Dateieingaben und keine Responses-, Embeddings- oder Batch-APIs. Agents müssen einen OpenAI-kompatiblen Chat-Completions-Anbieter verwenden.
stop wird akzeptiert, aber ignoriert; n muss 1 sein; logprobs und logit_bias werden nicht unterstützt; user und metadata führen zu einem Fehler.
Die Limits gelten pro Organisation, pro Minute und pro UTC-Tag. Beachte Retry-After; x-should-retry: false bedeutet, dass das Tageslimit bis 00:00 UTC ausgeschöpft ist.
Noch nicht. Reflection hat für einen späteren Zeitpunkt im Oktober 2026 Open Weights unter Apache 2.0 zugesagt. Bis dahin ist Beam nur über die Beta-API mit Warteliste verfügbar.
Alle 501 Milliarden Parameter müssen in den Speicher passen: etwa 1 TB bei BF16, etwa 500 GB bei FP8 und etwa 250 GB bei 4-bit, zuzüglich des KV-Caches. Dafür brauchst du einen Multi-GPU-Server. Nutze den Speicherplaner für dein Setup.
Ja, für Chat Completions und Models. Stelle das SDK auf https://api.reflection.ai/openai/v1 ein und verwende die Modell-ID Beam-501B-A23B. Streaming, Tool-Aufrufe und JSON-Schema-Ausgaben werden unterstützt.
Reflection hat noch keine Preise für die Beta veröffentlicht. Im Kostenrechner kannst du deinen eigenen Preis eingeben und sehen, wie sich Reasoning-Tokens auf die Gesamtkosten auswirken.