Ontwikkelaarstools

Bouwen met Reflection Beam

Plan GPU's voor zelfhosting, schat tokens en kosten, genereer werkende API-code en configureer je coding agent. Elk getal is gebaseerd op de eigen documentatie van Reflection.

Aan de slag met de codegenerator GPU-geheugenplanner

De basis

Model-ID
Beam-501B-A23B
Basis-URL
https://api.reflection.ai/openai/v1
Parameters
501B totaal, 23B actief
Contextvenster
262,144 tokens
Maximale uitvoer
131,072 tokens
Redeneerinspanning
low · medium · high · xhigh · max

Tools

Je eerste verzoek in 30 seconden

De API volgt OpenAI Chat Completions, dus de officiële OpenAI SDK's werken zodra je de basis-URL en sleutel wijzigt.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Zes dingen waar mensen vaak tegenaan lopen

Redeneren kan niet worden uitgeschakeld

Beam redeneert altijd. reasoning_effort bepaalt hoeveel, van low tot max; medium is de standaardwaarde. Waarden zoals none of minimal geven een 400-fout.

Redeneringen meesturen

Stuur bij chats met meerdere beurten en toolaanroepen elk eerder assistant-bericht opnieuw mee, inclusief reasoning_content. Zonder deze parameter geeft de API de fout 400 missing_required_parameter.

Redeneringen verbruiken je tokentegoed

Redeneertokens tellen mee voor max_completion_tokens. Stel je dit te laag in, dan krijg je finish_reason "length" en een leeg antwoord.

Alleen tekst, alleen Chat Completions

Geen invoer van afbeeldingen, audio of bestanden, en geen Responses-, Embeddings- of Batch-API's. Agents moeten een OpenAI-compatibele Chat Completions-provider gebruiken.

Sommige parameters doen niets

stop wordt geaccepteerd maar genegeerd; n moet 1 zijn; logprobs en logit_bias worden niet ondersteund; user en metadata geven een foutmelding.

429 betekent wachten, niet meteen opnieuw proberen

Limieten gelden per organisatie, per minuut en per UTC-dag. Houd je aan Retry-After; x-should-retry: false betekent dat het dagbudget op is tot 00:00 UTC.

Meer over Beam

FAQ

Kan ik de gewichten van Beam downloaden?

Nog niet. Reflection heeft beloofd de gewichten later in oktober 2026 open source uit te brengen onder Apache 2.0. Tot die tijd is Beam alleen beschikbaar via de bèta-API met wachtlijst.

Welke hardware is nodig om Beam zelf te hosten?

Alle 501 miljard parameters moeten in het geheugen passen: ongeveer 1 TB bij BF16, ongeveer 500 GB bij FP8 en ongeveer 250 GB bij 4-bit, plus de KV-cache. Daarvoor is een server met meerdere GPU's nodig; gebruik de geheugenplanner voor jouw configuratie.

Is de API compatibel met de OpenAI SDK?

Ja, voor Chat Completions en Models. Stel https://api.reflection.ai/openai/v1 in als endpoint van de SDK en gebruik de model-ID Beam-501B-A23B. Streaming, toolaanroepen en JSON-schema-uitvoer worden ondersteund.

Wat kost de API?

Reflection heeft nog geen prijzen voor de bèta gepubliceerd. Met de kostencalculator kun je je eigen prijs invoeren en zien hoe redeneertokens het totaal beïnvloeden.