推論はオフにできません
Beamは常に推論を行います。reasoning_effortで推論の強度をlowからmaxまで指定でき、デフォルトはmediumです。noneやminimalなどの値を指定すると、400エラーが返ります。
開発者向けツール
セルフホスティング用のGPUを計画し、トークン数とコストを見積もり、動作するAPIコードを生成して、コーディングエージェントをセットアップできます。すべての数値はReflectionの公式ドキュメントに基づいています。
精度とコンテキスト長ごとにBeamに必要なVRAMとGPU数を確認できます。
02 / cost推論を含むリクエストごとのトークン数、レート制限に対する1日の利用量、セルフホスト費用を見積もります。
03 / codeストリーミング、ツール呼び出し、JSON出力、複数ターンのチャットに使えるcurl・Python・TypeScriptのコードを生成します。
04 / agentsBeam向けのMirror CLI、Pi、OpenCode、Hermes Agentの設定をコピーしてすぐ使えます。
このAPIはOpenAI Chat Completionsに準拠しているため、ベースURLとキーを変更すれば、公式のOpenAI SDKをそのまま使えます。
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beamは常に推論を行います。reasoning_effortで推論の強度をlowからmaxまで指定でき、デフォルトはmediumです。noneやminimalなどの値を指定すると、400エラーが返ります。
複数ターンのチャットやツール呼び出しでは、それ以前の各assistantメッセージをreasoning_contentとともに返してください。これがないと、APIは400 missing_required_parameterを返します。
推論トークンはmax_completion_tokensに含まれます。値が小さすぎると、finish_reasonが"length"になり、回答が空になることがあります。
画像、音声、ファイルの入力には対応していません。また、Responses、Embeddings、Batch APIにも対応していません。エージェントでは、OpenAI互換のChat Completionsプロバイダーを使用してください。
stop は受け付けられますが無視されます。n は 1 である必要があります。logprobs と logit_bias はサポートされていません。user を指定するとエラーが返されます。
制限は組織ごと、分ごと、UTC の日ごとに適用されます。Retry-After に従ってください。x-should-retry: false は、00:00 UTC まで日次の利用上限に達していることを意味します。
まだできません。Reflection は 2026年10月後半に Apache 2.0 の下で重みを公開することを約束しています。それまでは、ウェイトリスト制のベータ API からのみ Beam を利用できます。
5010億個のパラメータすべてをメモリに収める必要があります。目安は BF16 で約 1 TB、FP8 で約 500 GB、4-bit で約 250 GB です。これに加えて KV キャッシュ分のメモリも必要です。複数 GPU を搭載したサーバーが必要になります。お使いの環境に合わせてメモリプランナーをご利用ください。
はい。Chat Completions と Models に対応しています。SDK の接続先を https://api.reflection.ai/openai/v1 に設定し、モデル ID に Beam-501B-A23B を指定してください。ストリーミング、ツール呼び出し、JSON Schema 出力にも対応しています。
Reflection はベータ版の価格をまだ公表していません。料金計算ツールでは独自の価格を入力でき、推論トークンが合計料金に与える影響を確認できます。