Redeneren kan niet worden uitgeschakeld
Beam redeneert altijd. reasoning_effort bepaalt hoeveel, van low tot max; medium is de standaardwaarde. Waarden zoals none of minimal geven een 400-fout.
Ontwikkelaarstools
Plan GPU's voor zelfhosting, schat tokens en kosten, genereer werkende API-code en configureer je coding agent. Elk getal is gebaseerd op de eigen documentatie van Reflection.
Hoeveel VRAM Beam nodig heeft per precisie en contextlengte, en hoeveel GPU's daarvoor nodig zijn.
02 / costSchat tokens per verzoek met redeneringen, dagelijks volume ten opzichte van rate limits en de kosten van zelfhosting.
03 / codeWerkende curl-, Python- en TypeScript-code voor streaming, tool calls, JSON-uitvoer en chats met meerdere beurten.
04 / agentsKant-en-klare configuraties voor Mirror CLI, Pi, OpenCode en Hermes Agent met Beam.
De API volgt OpenAI Chat Completions, dus de officiële OpenAI SDK's werken zodra je de basis-URL en sleutel wijzigt.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam redeneert altijd. reasoning_effort bepaalt hoeveel, van low tot max; medium is de standaardwaarde. Waarden zoals none of minimal geven een 400-fout.
Stuur bij chats met meerdere beurten en toolaanroepen elk eerder assistant-bericht opnieuw mee, inclusief reasoning_content. Zonder deze parameter geeft de API de fout 400 missing_required_parameter.
Redeneertokens tellen mee voor max_completion_tokens. Stel je dit te laag in, dan krijg je finish_reason "length" en een leeg antwoord.
Geen invoer van afbeeldingen, audio of bestanden, en geen Responses-, Embeddings- of Batch-API's. Agents moeten een OpenAI-compatibele Chat Completions-provider gebruiken.
stop wordt geaccepteerd maar genegeerd; n moet 1 zijn; logprobs en logit_bias worden niet ondersteund; user en metadata geven een foutmelding.
Limieten gelden per organisatie, per minuut en per UTC-dag. Houd je aan Retry-After; x-should-retry: false betekent dat het dagbudget op is tot 00:00 UTC.
Nog niet. Reflection heeft beloofd de gewichten later in oktober 2026 open source uit te brengen onder Apache 2.0. Tot die tijd is Beam alleen beschikbaar via de bèta-API met wachtlijst.
Alle 501 miljard parameters moeten in het geheugen passen: ongeveer 1 TB bij BF16, ongeveer 500 GB bij FP8 en ongeveer 250 GB bij 4-bit, plus de KV-cache. Daarvoor is een server met meerdere GPU's nodig; gebruik de geheugenplanner voor jouw configuratie.
Ja, voor Chat Completions en Models. Stel https://api.reflection.ai/openai/v1 in als endpoint van de SDK en gebruik de model-ID Beam-501B-A23B. Streaming, toolaanroepen en JSON-schema-uitvoer worden ondersteund.
Reflection heeft nog geen prijzen voor de bèta gepubliceerd. Met de kostencalculator kun je je eigen prijs invoeren en zien hoe redeneertokens het totaal beïnvloeden.