ปิดการให้เหตุผลไม่ได้
Beam ใช้การให้เหตุผลเสมอ reasoning_effort ใช้กำหนดระดับ ตั้งแต่ low ถึง max โดยค่าเริ่มต้นคือ medium ค่าอย่าง none หรือ minimal จะทำให้เกิดข้อผิดพลาด 400
เครื่องมือสำหรับนักพัฒนา
วางแผน GPU สำหรับโฮสต์เอง ประเมินจำนวนโทเค็นและค่าใช้จ่าย สร้างโค้ด API ที่ใช้งานได้ และตั้งค่า coding agent ของคุณ ตัวเลขทั้งหมดอ้างอิงเอกสารของ Reflection โดยตรง
เริ่มต้นด้วยเครื่องมือสร้างโค้ด เครื่องมือวางแผนหน่วยความจำ GPU
ดูว่า Beam ต้องใช้ VRAM เท่าใดในแต่ละระดับความแม่นยำและความยาวบริบท รวมถึงต้องใช้ GPU กี่ตัว
02 / costประเมินจำนวนโทเค็นต่อคำขอเมื่อรวมการให้เหตุผล ปริมาณการใช้งานต่อวันเทียบกับขีดจำกัดอัตราการใช้งาน และค่าใช้จ่ายในการโฮสต์เอง
03 / codeตัวอย่าง curl, Python และ TypeScript ที่ใช้งานได้จริง สำหรับการสตรีม การเรียกใช้เครื่องมือ เอาต์พุต JSON และแชตหลายเทิร์น
04 / agentsการตั้งค่าพร้อมคัดลอกสำหรับ Mirror CLI, Pi, OpenCode และ Hermes Agent ที่ใช้กับ Beam ได้
API ใช้รูปแบบ OpenAI Chat Completions ดังนั้น SDK อย่างเป็นทางการของ OpenAI จึงใช้งานได้ เพียงเปลี่ยน URL พื้นฐานและคีย์
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam ใช้การให้เหตุผลเสมอ reasoning_effort ใช้กำหนดระดับ ตั้งแต่ low ถึง max โดยค่าเริ่มต้นคือ medium ค่าอย่าง none หรือ minimal จะทำให้เกิดข้อผิดพลาด 400
ในการแชตหลายรอบและการเรียกใช้เครื่องมือ ให้ส่งข้อความ assistant ก่อนหน้าทุกรายการกลับไปพร้อม reasoning_content หากไม่ส่ง API จะตอบกลับข้อผิดพลาด 400 missing_required_parameter
โทเค็นสำหรับการให้เหตุผลจะนับรวมใน max_completion_tokens หากตั้งค่าไว้ต่ำเกินไป คุณจะได้ finish_reason "length" และคำตอบว่างเปล่า
ไม่รองรับอินพุตรูปภาพ เสียง หรือไฟล์ และไม่มี API สำหรับ Responses, Embeddings หรือ Batch agent ต้องใช้ผู้ให้บริการ Chat Completions ที่เข้ากันได้กับ OpenAI
ระบบยอมรับ stop แต่ไม่สนใจค่านี้; n ต้องเป็น 1; ไม่รองรับ logprobs และ logit_bias; user และ metadata จะทำให้เกิดข้อผิดพลาด
ขีดจำกัดมีผลต่อองค์กร ต่อนาที และต่อวันตาม UTC ให้ทำตาม Retry-After; x-should-retry: false หมายความว่าโควตารายวันหมดแล้วจนถึง 00:00 UTC
ยังไม่ได้ Reflection ให้คำมั่นว่าจะเปิดเผยน้ำหนักโมเดลภายใต้ Apache 2.0 ในช่วงปลายเดือนตุลาคม 2026 จนกว่าจะถึงตอนนั้น Beam จะใช้งานได้ผ่าน API รุ่นเบต้าที่ต้องเข้าร่วมรายชื่อรอเท่านั้น
พารามิเตอร์ทั้ง 501 พันล้านตัวต้องอยู่ในหน่วยความจำ: ประมาณ 1 TB ที่ BF16, ประมาณ 500 GB ที่ FP8 และประมาณ 250 GB ที่ 4-bit โดยยังไม่รวม KV cache ซึ่งต้องใช้เซิร์ฟเวอร์หลาย GPU ใช้เครื่องมือวางแผนหน่วยความจำเพื่อคำนวณสำหรับการตั้งค่าของคุณ
ได้ สำหรับ Chat Completions และ Models ตั้งค่า SDK ให้ชี้ไปที่ https://api.reflection.ai/openai/v1 แล้วใช้ model ID Beam-501B-A23B รองรับการสตรีม การเรียกใช้เครื่องมือ และเอาต์พุต JSON Schema
Reflection ยังไม่ได้ประกาศราคาสำหรับรุ่นเบต้า เครื่องคำนวณค่าใช้จ่ายช่วยให้คุณป้อนราคาที่ต้องการเอง และแสดงให้เห็นว่าโทเค็น reasoning ส่งผลต่อค่าใช้จ่ายรวมอย่างไร