Công cụ dành cho nhà phát triển

Phát triển với Reflection Beam

Lập kế hoạch GPU để tự lưu trữ, ước tính token và chi phí, tạo mã API có thể chạy và thiết lập tác nhân lập trình. Mọi con số đều dựa trên tài liệu của Reflection.

Bắt đầu với trình tạo mã Công cụ lập kế hoạch bộ nhớ GPU

Những điều cơ bản

Model ID
Beam-501B-A23B
Base URL
https://api.reflection.ai/openai/v1
Tham số
Tổng cộng 501B, đang hoạt động 23B
Cửa sổ ngữ cảnh
262,144 token
Đầu ra tối đa
131,072 token
Mức độ suy luận
low · medium · high · xhigh · max

Công cụ

Gửi yêu cầu đầu tiên trong 30 giây

API tuân theo OpenAI Chat Completions, vì vậy các SDK chính thức của OpenAI sẽ hoạt động sau khi bạn thay đổi base URL và khóa.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Sáu điểm dễ gây nhầm lẫn

Không thể tắt suy luận

Beam luôn suy luận. reasoning_effort xác định mức độ suy luận, từ low đến max; medium là mặc định. Các giá trị như none hoặc minimal sẽ trả về lỗi 400.

Gửi lại nội dung suy luận

Trong các cuộc trò chuyện nhiều lượt và lệnh gọi công cụ, hãy gửi lại từng tin nhắn assistant trước đó cùng với reasoning_content. Nếu thiếu nội dung này, API sẽ trả về lỗi 400 missing_required_parameter.

Token suy luận được tính vào hạn mức token

Token suy luận được tính vào max_completion_tokens. Nếu đặt giới hạn quá thấp, bạn sẽ nhận được finish_reason "length" cùng câu trả lời trống.

Chỉ văn bản, chỉ Chat Completions

Không hỗ trợ đầu vào hình ảnh, âm thanh hoặc tệp, cũng như các API Responses, Embeddings hay Batch. Tác nhân phải sử dụng nhà cung cấp Chat Completions tương thích với OpenAI.

Một số tham số không có tác dụng

stop được chấp nhận nhưng bị bỏ qua; n phải là 1; không hỗ trợ logprobs và logit_bias; user và metadata sẽ trả về lỗi.

429 nghĩa là hãy chờ, không phải thử lại ngay

Giới hạn được áp dụng theo từng tổ chức, mỗi phút và mỗi ngày UTC. Hãy tuân theo Retry-After; x-should-retry: false nghĩa là ngân sách trong ngày đã hết cho đến 00:00 UTC.

Tìm hiểu thêm về Beam

Câu hỏi thường gặp

Tôi có thể tải trọng số của Beam không?

Chưa. Reflection đã cam kết phát hành trọng số mở theo Apache 2.0 vào cuối tháng 10 năm 2026. Cho đến lúc đó, Beam chỉ có thể được sử dụng thông qua API beta dành cho người trong danh sách chờ.

Cần phần cứng thế nào để tự lưu trữ?

Toàn bộ 501 tỷ tham số phải nằm trong bộ nhớ: khoảng 1 TB ở BF16, khoảng 500 GB ở FP8 và khoảng 250 GB ở 4-bit, chưa tính KV cache. Bạn sẽ cần máy chủ nhiều GPU; hãy dùng công cụ lập kế hoạch bộ nhớ để cấu hình theo nhu cầu.

API có tương thích với OpenAI SDK không?

Có, với Chat Completions và Models. Trỏ SDK đến https://api.reflection.ai/openai/v1 và dùng ID mô hình Beam-501B-A23B. Tính năng truyền phát, gọi công cụ và đầu ra theo JSON schema đều hoạt động.

API có giá bao nhiêu?

Reflection chưa công bố giá cho bản beta. Công cụ tính chi phí cho phép bạn nhập mức giá của riêng mình và xem token suy luận ảnh hưởng thế nào đến tổng chi phí.