无法关闭推理
Beam 始终会进行推理。reasoning_effort 用于选择推理强度,范围从 low 到 max,默认值为 medium。使用 none 或 minimal 等值会返回 400 错误。
开发者工具
规划自托管所需的 GPU,估算 token 数量和成本,生成可用的 API 代码,并配置你的编程代理。所有数据均依据 Reflection 的官方文档。
该 API 遵循 OpenAI Chat Completions 规范,因此只需更改基础 URL 和密钥,就能使用官方 OpenAI SDK。
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam 始终会进行推理。reasoning_effort 用于选择推理强度,范围从 low 到 max,默认值为 medium。使用 none 或 minimal 等值会返回 400 错误。
在多轮对话和工具调用中,需要在每条先前的 assistant 消息中传回 reasoning_content。否则,API 会返回 400 missing_required_parameter。
推理 token 会计入 max_completion_tokens。设置过低会导致 finish_reason 为 "length",且答案为空。
不支持图像、音频或文件输入,也不支持 Responses、Embeddings 或 Batch API。代理必须使用兼容 OpenAI 的 Chat Completions 提供方。
stop 会被接受但忽略;n 必须为 1;不支持 logprobs 和 logit_bias;user 和 metadata 会返回错误。
限制按组织、分钟和 UTC 日计算。请遵守 Retry-After;x-should-retry: false 表示每日额度已用完,直到 00:00 UTC 才会恢复。
目前还不行。Reflection 承诺将在 2026 年 10 月下旬以 Apache 2.0 许可开放权重。在此之前,Beam 只能通过需要排队等候的 Beta API 使用。
全部 5010 亿个参数都必须装入内存:BF16 约需 1 TB,FP8 约需 500 GB,4 位量化约需 250 GB,此外还需要 KV 缓存。这需要一台多 GPU 服务器;请使用显存规划工具配置你的环境。
是的,支持 Chat Completions 和 Models。将 SDK 指向 https://api.reflection.ai/openai/v1,并使用模型 ID Beam-501B-A23B。流式传输、工具调用和 JSON Schema 输出均可使用。
Reflection 尚未公布 Beta 版的价格。费用计算器允许你输入自己的价格,并显示推理 token 如何影响总费用。