開発者向けツール

Reflection Beamで開発

セルフホスティング用のGPUを計画し、トークン数とコストを見積もり、動作するAPIコードを生成して、コーディングエージェントをセットアップできます。すべての数値はReflectionの公式ドキュメントに基づいています。

コードジェネレーターを使って始める GPUメモリプランナー

基本情報

モデルID
Beam-501B-A23B
ベースURL
https://api.reflection.ai/openai/v1
パラメータ
合計 501B、アクティブ 23B
コンテキストウィンドウ
262,144トークン
最大出力
131,072トークン
推論の強度
low · medium · high · xhigh · max

ツール

30秒で最初のリクエストを送信

このAPIはOpenAI Chat Completionsに準拠しているため、ベースURLとキーを変更すれば、公式のOpenAI SDKをそのまま使えます。

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

つまずきやすいポイント6つ

推論はオフにできません

Beamは常に推論を行います。reasoning_effortで推論の強度をlowからmaxまで指定でき、デフォルトはmediumです。noneやminimalなどの値を指定すると、400エラーが返ります。

推論を送り返す

複数ターンのチャットやツール呼び出しでは、それ以前の各assistantメッセージをreasoning_contentとともに返してください。これがないと、APIは400 missing_required_parameterを返します。

推論はトークン予算を消費します

推論トークンはmax_completion_tokensに含まれます。値が小さすぎると、finish_reasonが"length"になり、回答が空になることがあります。

テキストのみ、Chat Completionsのみ

画像、音声、ファイルの入力には対応していません。また、Responses、Embeddings、Batch APIにも対応していません。エージェントでは、OpenAI互換のChat Completionsプロバイダーを使用してください。

一部のパラメータは機能しません

stop は受け付けられますが無視されます。n は 1 である必要があります。logprobs と logit_bias はサポートされていません。user を指定するとエラーが返されます。

429 が返されたら、すぐに再試行せず待ってください

制限は組織ごと、分ごと、UTC の日ごとに適用されます。Retry-After に従ってください。x-should-retry: false は、00:00 UTC まで日次の利用上限に達していることを意味します。

Beam について詳しく見る

よくある質問

Beam の重みをダウンロードできますか?

まだできません。Reflection は 2026年10月後半に Apache 2.0 の下で重みを公開することを約束しています。それまでは、ウェイトリスト制のベータ API からのみ Beam を利用できます。

セルフホストにはどのくらいのハードウェアが必要ですか?

5010億個のパラメータすべてをメモリに収める必要があります。目安は BF16 で約 1 TB、FP8 で約 500 GB、4-bit で約 250 GB です。これに加えて KV キャッシュ分のメモリも必要です。複数 GPU を搭載したサーバーが必要になります。お使いの環境に合わせてメモリプランナーをご利用ください。

API は OpenAI SDK と互換性がありますか?

はい。Chat Completions と Models に対応しています。SDK の接続先を https://api.reflection.ai/openai/v1 に設定し、モデル ID に Beam-501B-A23B を指定してください。ストリーミング、ツール呼び出し、JSON Schema 出力にも対応しています。

API の料金はいくらですか?

Reflection はベータ版の価格をまだ公表していません。料金計算ツールでは独自の価格を入力でき、推論トークンが合計料金に与える影響を確認できます。