Não é possível desativar o raciocínio
Beam sempre raciocina. reasoning_effort define o nível, de low a max, e medium é o padrão. Valores como none ou minimal retornam um erro 400.
Ferramentas para desenvolvedores
Planeje GPUs para hospedagem própria, estime tokens e custos, gere código de API funcional e configure seu agente de programação. Todos os números são baseados na documentação oficial da Reflection.
Quanta VRAM o Beam precisa em cada precisão e tamanho de contexto, e quantas GPUs isso exige.
02 / costEstime os tokens por solicitação com raciocínio, o volume diário em relação aos limites de requisições e o custo de hospedagem própria.
03 / codeExemplos funcionais em curl, Python e TypeScript para streaming, chamadas de ferramentas, saída JSON e conversas com várias interações.
04 / agentsConfiguração pronta para copiar do Mirror CLI, Pi, OpenCode e Hermes Agent com o Beam.
A API segue o OpenAI Chat Completions, então os SDKs oficiais da OpenAI funcionam após você alterar a URL base e a chave.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam sempre raciocina. reasoning_effort define o nível, de low a max, e medium é o padrão. Valores como none ou minimal retornam um erro 400.
Em conversas com várias interações e chamadas de ferramentas, envie cada mensagem anterior de assistant junto com reasoning_content. Sem isso, a API responde com 400 missing_required_parameter.
Os tokens de raciocínio contam para max_completion_tokens. Se o valor for muito baixo, você recebe finish_reason "length" e uma resposta vazia.
Não aceita entrada de imagem, áudio ou arquivos, nem oferece as APIs Responses, Embeddings ou Batch. Agentes precisam usar um provedor Chat Completions compatível com a OpenAI.
stop é aceito, mas ignorado; n deve ser 1; logprobs e logit_bias não são compatíveis; user e metadata retornam um erro.
Os limites se aplicam por organização, por minuto e por dia UTC. Respeite Retry-After; x-should-retry: false significa que o limite diário foi atingido e só será renovado às 00:00 UTC.
Ainda não. A Reflection prometeu disponibilizar os pesos abertos sob Apache 2.0 mais tarde, em outubro de 2026. Até lá, Beam estará disponível somente pela API beta, que exige entrar na lista de espera.
Todos os 501 bilhões de parâmetros precisam caber na memória: cerca de 1 TB em BF16, cerca de 500 GB em FP8 e cerca de 250 GB em 4 bits, além do cache KV. Isso requer um servidor com várias GPUs; use o planejador de memória para configurar seu ambiente.
Sim, para Chat Completions e Models. Configure o SDK para usar https://api.reflection.ai/openai/v1 e o ID do modelo Beam-501B-A23B. Streaming, chamadas de ferramentas e saídas em JSON Schema funcionam.
A Reflection ainda não publicou os preços da versão beta. A calculadora de custos permite inserir seu próprio preço e mostra como os tokens de raciocínio afetam o total.