Không thể tắt suy luận
Beam luôn suy luận. reasoning_effort xác định mức độ suy luận, từ low đến max; medium là mặc định. Các giá trị như none hoặc minimal sẽ trả về lỗi 400.
Công cụ dành cho nhà phát triển
Lập kế hoạch GPU để tự lưu trữ, ước tính token và chi phí, tạo mã API có thể chạy và thiết lập tác nhân lập trình. Mọi con số đều dựa trên tài liệu của Reflection.
Xem Beam cần bao nhiêu VRAM ở từng độ chính xác và độ dài ngữ cảnh, cũng như cần bao nhiêu GPU.
02 / costƯớc tính số token mỗi yêu cầu khi bật reasoning, khối lượng hằng ngày so với giới hạn tốc độ và chi phí tự lưu trữ.
03 / codeMã curl, Python và TypeScript chạy được để xử lý streaming, lời gọi công cụ, đầu ra JSON và hội thoại nhiều lượt.
04 / agentsCấu hình sẵn để sao chép cho Mirror CLI, Pi, OpenCode và Hermes Agent với Beam.
API tuân theo OpenAI Chat Completions, vì vậy các SDK chính thức của OpenAI sẽ hoạt động sau khi bạn thay đổi base URL và khóa.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam luôn suy luận. reasoning_effort xác định mức độ suy luận, từ low đến max; medium là mặc định. Các giá trị như none hoặc minimal sẽ trả về lỗi 400.
Trong các cuộc trò chuyện nhiều lượt và lệnh gọi công cụ, hãy gửi lại từng tin nhắn assistant trước đó cùng với reasoning_content. Nếu thiếu nội dung này, API sẽ trả về lỗi 400 missing_required_parameter.
Token suy luận được tính vào max_completion_tokens. Nếu đặt giới hạn quá thấp, bạn sẽ nhận được finish_reason "length" cùng câu trả lời trống.
Không hỗ trợ đầu vào hình ảnh, âm thanh hoặc tệp, cũng như các API Responses, Embeddings hay Batch. Tác nhân phải sử dụng nhà cung cấp Chat Completions tương thích với OpenAI.
stop được chấp nhận nhưng bị bỏ qua; n phải là 1; không hỗ trợ logprobs và logit_bias; user và metadata sẽ trả về lỗi.
Giới hạn được áp dụng theo từng tổ chức, mỗi phút và mỗi ngày UTC. Hãy tuân theo Retry-After; x-should-retry: false nghĩa là ngân sách trong ngày đã hết cho đến 00:00 UTC.
Chưa. Reflection đã cam kết phát hành trọng số mở theo Apache 2.0 vào cuối tháng 10 năm 2026. Cho đến lúc đó, Beam chỉ có thể được sử dụng thông qua API beta dành cho người trong danh sách chờ.
Toàn bộ 501 tỷ tham số phải nằm trong bộ nhớ: khoảng 1 TB ở BF16, khoảng 500 GB ở FP8 và khoảng 250 GB ở 4-bit, chưa tính KV cache. Bạn sẽ cần máy chủ nhiều GPU; hãy dùng công cụ lập kế hoạch bộ nhớ để cấu hình theo nhu cầu.
Có, với Chat Completions và Models. Trỏ SDK đến https://api.reflection.ai/openai/v1 và dùng ID mô hình Beam-501B-A23B. Tính năng truyền phát, gọi công cụ và đầu ra theo JSON schema đều hoạt động.
Reflection chưa công bố giá cho bản beta. Công cụ tính chi phí cho phép bạn nhập mức giá của riêng mình và xem token suy luận ảnh hưởng thế nào đến tổng chi phí.