Ferramentas para desenvolvedores

Desenvolva com o Reflection Beam

Planeje GPUs para hospedagem própria, estime tokens e custos, gere código de API funcional e configure seu agente de programação. Todos os números são baseados na documentação oficial da Reflection.

Comece pelo gerador de código Planejador de memória de GPU

O essencial

ID do modelo
Beam-501B-A23B
URL base
https://api.reflection.ai/openai/v1
Parâmetros
501B no total, 23B ativos
Janela de contexto
262,144 tokens
Saída máxima
131,072 tokens
Esforço de raciocínio
low · medium · high · xhigh · max

Ferramentas

Faça sua primeira requisição em 30 segundos

A API segue o OpenAI Chat Completions, então os SDKs oficiais da OpenAI funcionam após você alterar a URL base e a chave.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Seis pontos que costumam causar problemas

Não é possível desativar o raciocínio

Beam sempre raciocina. reasoning_effort define o nível, de low a max, e medium é o padrão. Valores como none ou minimal retornam um erro 400.

Envie o raciocínio de volta

Em conversas com várias interações e chamadas de ferramentas, envie cada mensagem anterior de assistant junto com reasoning_content. Sem isso, a API responde com 400 missing_required_parameter.

O raciocínio consome seu limite de tokens

Os tokens de raciocínio contam para max_completion_tokens. Se o valor for muito baixo, você recebe finish_reason "length" e uma resposta vazia.

Somente texto, somente Chat Completions

Não aceita entrada de imagem, áudio ou arquivos, nem oferece as APIs Responses, Embeddings ou Batch. Agentes precisam usar um provedor Chat Completions compatível com a OpenAI.

Alguns parâmetros não fazem nada

stop é aceito, mas ignorado; n deve ser 1; logprobs e logit_bias não são compatíveis; user e metadata retornam um erro.

429 significa aguardar, não tentar novamente agora

Os limites se aplicam por organização, por minuto e por dia UTC. Respeite Retry-After; x-should-retry: false significa que o limite diário foi atingido e só será renovado às 00:00 UTC.

Saiba mais sobre Beam

Perguntas frequentes

Posso baixar os pesos do Beam?

Ainda não. A Reflection prometeu disponibilizar os pesos abertos sob Apache 2.0 mais tarde, em outubro de 2026. Até lá, Beam estará disponível somente pela API beta, que exige entrar na lista de espera.

De quanto hardware preciso para hospedar o modelo por conta própria?

Todos os 501 bilhões de parâmetros precisam caber na memória: cerca de 1 TB em BF16, cerca de 500 GB em FP8 e cerca de 250 GB em 4 bits, além do cache KV. Isso requer um servidor com várias GPUs; use o planejador de memória para configurar seu ambiente.

A API é compatível com o OpenAI SDK?

Sim, para Chat Completions e Models. Configure o SDK para usar https://api.reflection.ai/openai/v1 e o ID do modelo Beam-501B-A23B. Streaming, chamadas de ferramentas e saídas em JSON Schema funcionam.

Quanto custa a API?

A Reflection ainda não publicou os preços da versão beta. A calculadora de custos permite inserir seu próprio preço e mostra como os tokens de raciocínio afetam o total.