추론은 끌 수 없습니다
Beam은 항상 추론합니다. reasoning_effort로 추론 강도를 low부터 max까지 설정할 수 있으며, 기본값은 medium입니다. none이나 minimal 같은 값은 400 오류를 반환합니다.
개발자 도구
셀프 호스팅을 위한 GPU를 계획하고, 토큰과 비용을 추산하고, 바로 쓸 수 있는 API 코드를 생성하고, 코딩 에이전트를 설정하세요. 모든 수치는 Reflection의 자체 문서를 기반으로 합니다.
정밀도와 컨텍스트 길이에 따라 Beam에 필요한 VRAM과 필요한 GPU 수를 확인하세요.
02 / cost추론을 포함한 요청당 토큰 수, 일일 요청량의 속도 제한 대비 현황, 자체 호스팅 비용을 추정합니다.
03 / code스트리밍, 도구 호출, JSON 출력, 멀티턴 채팅을 위한 바로 실행 가능한 curl, Python, TypeScript 코드입니다.
04 / agentsBeam을 사용하는 Mirror CLI, Pi, OpenCode, Hermes Agent용으로 바로 복사해 쓸 수 있는 설정입니다.
API는 OpenAI Chat Completions를 따르므로 기본 URL과 키를 바꾸면 공식 OpenAI SDK를 사용할 수 있습니다.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam은 항상 추론합니다. reasoning_effort로 추론 강도를 low부터 max까지 설정할 수 있으며, 기본값은 medium입니다. none이나 minimal 같은 값은 400 오류를 반환합니다.
다중 턴 대화와 도구 호출에서는 이전 assistant 메시지를 각각 reasoning_content와 함께 다시 보내세요. reasoning_content가 없으면 API는 400 missing_required_parameter를 반환합니다.
추론 토큰은 max_completion_tokens에 포함됩니다. 값을 너무 낮게 설정하면 finish_reason이 "length"가 되고 응답은 비어 있게 됩니다.
이미지, 오디오 또는 파일 입력은 지원하지 않으며, Responses, Embeddings 또는 Batch API도 지원하지 않습니다. 에이전트는 OpenAI 호환 Chat Completions 제공자를 사용해야 합니다.
stop은 허용되지만 무시됩니다. n은 1이어야 합니다. logprobs와 logit_bias는 지원되지 않으며, user와 metadata를 사용하면 오류가 반환됩니다.
한도는 조직별, 분당 및 UTC 기준 일일로 적용됩니다. Retry-After를 준수하세요. x-should-retry: false는 00:00 UTC까지 일일 한도가 소진되었음을 의미합니다.
아직은 불가능합니다. Reflection은 2026년 10월 말에 Apache 2.0 라이선스로 가중치를 공개하겠다고 약속했습니다. 그때까지 Beam은 대기자 명단에 등록된 베타 API를 통해서만 사용할 수 있습니다.
5010억 개의 파라미터를 모두 메모리에 올려야 합니다. BF16 기준 약 1 TB, FP8 기준 약 500 GB, 4비트 기준 약 250 GB가 필요하며, 여기에 KV 캐시 공간도 추가로 필요합니다. 여러 GPU를 탑재한 서버가 필요합니다. 사용 환경에 맞는 메모리 플래너를 이용해 보세요.
Chat Completions와 Models는 지원합니다. SDK가 https://api.reflection.ai/openai/v1을 사용하도록 설정하고 모델 ID로 Beam-501B-A23B를 지정하세요. 스트리밍, 도구 호출 및 JSON 스키마 출력도 지원됩니다.
Reflection은 베타 가격을 아직 공개하지 않았습니다. 비용 계산기에 원하는 가격을 입력하면 추론 토큰이 총비용에 미치는 영향을 확인할 수 있습니다.