Hindi maaaring i-off ang reasoning
Palaging nagsasagawa ng reasoning ang Beam. Tinutukoy ng reasoning_effort ang antas nito, mula low hanggang max, at medium ang default. Nagbabalik ng 400 error ang mga value tulad ng none o minimal.
Mga tool para sa developer
Magplano ng mga GPU para sa self-hosting, magtantya ng mga token at gastos, bumuo ng gumaganang API code, at mag-set up ng coding agent mo. Nakabatay ang bawat numero sa dokumentasyon mismo ng Reflection.
Alamin kung gaano karaming VRAM ang kailangan ng Beam sa bawat precision at haba ng context, at kung ilang GPU ang kailangan.
02 / costTantiyahin ang mga token kada request kasama ang reasoning, ang pang-araw-araw na volume kaugnay ng mga limitasyon sa rate, at ang gastos sa sariling hosting.
03 / codeHandang gamitin na curl, Python, at TypeScript para sa streaming, mga tool call, JSON output, at mga multi-turn na chat.
04 / agentsHandang kopyahing setup para sa Mirror CLI, Pi, OpenCode, at Hermes Agent gamit ang Beam.
Sinusunod ng API ang OpenAI Chat Completions, kaya gagana ang mga opisyal na OpenAI SDK kapag pinalitan mo ang base URL at key.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Palaging nagsasagawa ng reasoning ang Beam. Tinutukoy ng reasoning_effort ang antas nito, mula low hanggang max, at medium ang default. Nagbabalik ng 400 error ang mga value tulad ng none o minimal.
Sa mga multi-turn na chat at tool call, ibalik ang bawat naunang mensahe ng assistant kasama ang reasoning_content nito. Kung hindi, magbabalik ang API ng 400 missing_required_parameter.
Kasama sa max_completion_tokens ang mga reasoning token. Kung masyadong mababa ang itinakda mo, makakakuha ka ng finish_reason "length" at walang laman na sagot.
Walang input na larawan, audio, o file, at walang Responses, Embeddings, o Batch API. Kailangang gumamit ang mga agent ng provider na tugma sa OpenAI Chat Completions.
Tinatanggap ang stop pero hindi ito pinapansin; dapat 1 ang n; hindi sinusuportahan ang logprobs at logit_bias; nagbabalik ng error ang user at metadata.
Nalalapat ang mga limitasyon kada organisasyon, kada minuto at kada araw ng UTC. Sundin ang Retry-After; nangangahulugang ubos na ang pang-araw-araw na budget ang x-should-retry: false hanggang 00:00 UTC.
Hindi pa. Nangako ang Reflection na ilalabas ang mga open weight sa ilalim ng Apache 2.0 sa bandang huling bahagi ng Oktubre 2026. Hanggang noon, sa beta API na may waitlist lang magagamit ang Beam.
Kailangang magkasya sa memorya ang lahat ng 501 bilyong parameter: humigit-kumulang 1 TB sa BF16, humigit-kumulang 500 GB sa FP8 at humigit-kumulang 250 GB sa 4-bit, bukod pa sa KV cache. Kailangan dito ng multi-GPU server; gamitin ang memory planner para sa iyong setup.
Oo, para sa Chat Completions at Models. Ituro ang SDK sa https://api.reflection.ai/openai/v1 at gamitin ang model ID na Beam-501B-A23B. Gumagana ang streaming, tool calling at mga output na JSON schema.
Hindi pa naglalathala ang Reflection ng mga presyo para sa beta. Maaari kang maglagay ng sarili mong presyo sa cost calculator, na magpapakita kung paano nakaaapekto sa kabuuan ang mga reasoning token.