Entwickler-Tools

Mit Reflection Beam entwickeln

Plane GPUs fürs Self-Hosting, schätze Tokenzahl und Kosten, generiere funktionierenden API-Code und richte deinen Coding-Agent ein. Alle Zahlen basieren auf der offiziellen Dokumentation von Reflection.

Zum Codegenerator GPU-Speicherplaner

Das Wichtigste

Modell-ID
Beam-501B-A23B
Basis-URL
https://api.reflection.ai/openai/v1
Parameter
501B insgesamt, 23B aktiv
Kontextfenster
262,144 Tokens
Maximale Ausgabe
131,072 Tokens
Reasoning-Aufwand
low · medium · high · xhigh · max

Tools

Deine erste Anfrage in 30 Sekunden

Die API folgt OpenAI Chat Completions. Deshalb funktionieren die offiziellen OpenAI SDKs, sobald du Basis-URL und Schlüssel änderst.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Sechs häufige Stolperfallen

Reasoning lässt sich nicht deaktivieren

Beam führt immer Reasoning aus. reasoning_effort legt fest, wie viel – von low bis max. Standardmäßig gilt medium. Werte wie none oder minimal führen zu einem 400-Fehler.

Reasoning mit zurücksenden

Gib bei mehrteiligen Chats und Tool-Aufrufen jede vorherige assistant-Nachricht zusammen mit ihrem reasoning_content zurück. Andernfalls antwortet die API mit 400 missing_required_parameter.

Reasoning verbraucht dein Token-Budget

Reasoning-Tokens zählen zu max_completion_tokens. Ist der Wert zu niedrig, erhältst du finish_reason "length" und eine leere Antwort.

Nur Text, nur Chat Completions

Keine Bild-, Audio- oder Dateieingaben und keine Responses-, Embeddings- oder Batch-APIs. Agents müssen einen OpenAI-kompatiblen Chat-Completions-Anbieter verwenden.

Einige Parameter bewirken nichts

stop wird akzeptiert, aber ignoriert; n muss 1 sein; logprobs und logit_bias werden nicht unterstützt; user und metadata führen zu einem Fehler.

429 bedeutet warten, nicht sofort erneut versuchen

Die Limits gelten pro Organisation, pro Minute und pro UTC-Tag. Beachte Retry-After; x-should-retry: false bedeutet, dass das Tageslimit bis 00:00 UTC ausgeschöpft ist.

Mehr über Beam

FAQ

Kann ich die Gewichte von Beam herunterladen?

Noch nicht. Reflection hat für einen späteren Zeitpunkt im Oktober 2026 Open Weights unter Apache 2.0 zugesagt. Bis dahin ist Beam nur über die Beta-API mit Warteliste verfügbar.

Welche Hardware brauche ich für Self-Hosting?

Alle 501 Milliarden Parameter müssen in den Speicher passen: etwa 1 TB bei BF16, etwa 500 GB bei FP8 und etwa 250 GB bei 4-bit, zuzüglich des KV-Caches. Dafür brauchst du einen Multi-GPU-Server. Nutze den Speicherplaner für dein Setup.

Ist die API mit dem OpenAI SDK kompatibel?

Ja, für Chat Completions und Models. Stelle das SDK auf https://api.reflection.ai/openai/v1 ein und verwende die Modell-ID Beam-501B-A23B. Streaming, Tool-Aufrufe und JSON-Schema-Ausgaben werden unterstützt.

Wie viel kostet die API?

Reflection hat noch keine Preise für die Beta veröffentlicht. Im Kostenrechner kannst du deinen eigenen Preis eingeben und sehen, wie sich Reasoning-Tokens auf die Gesamtkosten auswirken.