개발자 도구

Reflection Beam으로 빌드하기

셀프 호스팅을 위한 GPU를 계획하고, 토큰과 비용을 추산하고, 바로 쓸 수 있는 API 코드를 생성하고, 코딩 에이전트를 설정하세요. 모든 수치는 Reflection의 자체 문서를 기반으로 합니다.

코드 생성기로 시작하기 GPU 메모리 플래너

기본 정보

모델 ID
Beam-501B-A23B
기본 URL
https://api.reflection.ai/openai/v1
파라미터
총 501B개, 활성 23B개
컨텍스트 창
262,144개 토큰
최대 출력
131,072개 토큰
추론 강도
low · medium · high · xhigh · max

도구

30초 만에 첫 요청 보내기

API는 OpenAI Chat Completions를 따르므로 기본 URL과 키를 바꾸면 공식 OpenAI SDK를 사용할 수 있습니다.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

많이 헷갈리는 여섯 가지

추론은 끌 수 없습니다

Beam은 항상 추론합니다. reasoning_effort로 추론 강도를 low부터 max까지 설정할 수 있으며, 기본값은 medium입니다. none이나 minimal 같은 값은 400 오류를 반환합니다.

추론 내용 다시 보내기

다중 턴 대화와 도구 호출에서는 이전 assistant 메시지를 각각 reasoning_content와 함께 다시 보내세요. reasoning_content가 없으면 API는 400 missing_required_parameter를 반환합니다.

추론에도 토큰 예산이 사용됩니다

추론 토큰은 max_completion_tokens에 포함됩니다. 값을 너무 낮게 설정하면 finish_reason이 "length"가 되고 응답은 비어 있게 됩니다.

텍스트 전용, Chat Completions 전용

이미지, 오디오 또는 파일 입력은 지원하지 않으며, Responses, Embeddings 또는 Batch API도 지원하지 않습니다. 에이전트는 OpenAI 호환 Chat Completions 제공자를 사용해야 합니다.

일부 매개변수는 아무런 효과가 없습니다

stop은 허용되지만 무시됩니다. n은 1이어야 합니다. logprobs와 logit_bias는 지원되지 않으며, user와 metadata를 사용하면 오류가 반환됩니다.

429가 발생하면 즉시 재시도하지 말고 기다리세요

한도는 조직별, 분당 및 UTC 기준 일일로 적용됩니다. Retry-After를 준수하세요. x-should-retry: false는 00:00 UTC까지 일일 한도가 소진되었음을 의미합니다.

Beam에 대해 자세히 알아보기

자주 묻는 질문

Beam의 가중치를 다운로드할 수 있나요?

아직은 불가능합니다. Reflection은 2026년 10월 말에 Apache 2.0 라이선스로 가중치를 공개하겠다고 약속했습니다. 그때까지 Beam은 대기자 명단에 등록된 베타 API를 통해서만 사용할 수 있습니다.

자체 호스팅에는 어느 정도의 하드웨어가 필요한가요?

5010억 개의 파라미터를 모두 메모리에 올려야 합니다. BF16 기준 약 1 TB, FP8 기준 약 500 GB, 4비트 기준 약 250 GB가 필요하며, 여기에 KV 캐시 공간도 추가로 필요합니다. 여러 GPU를 탑재한 서버가 필요합니다. 사용 환경에 맞는 메모리 플래너를 이용해 보세요.

API가 OpenAI SDK와 호환되나요?

Chat Completions와 Models는 지원합니다. SDK가 https://api.reflection.ai/openai/v1을 사용하도록 설정하고 모델 ID로 Beam-501B-A23B를 지정하세요. 스트리밍, 도구 호출 및 JSON 스키마 출력도 지원됩니다.

API 비용은 얼마인가요?

Reflection은 베타 가격을 아직 공개하지 않았습니다. 비용 계산기에 원하는 가격을 입력하면 추론 토큰이 총비용에 미치는 영향을 확인할 수 있습니다.