لا يمكن إيقاف الاستدلال
يستدِل Beam دائمًا. تحدد reasoning_effort مقدار الاستدلال، من low إلى max، والقيمة الافتراضية هي medium. تؤدي قيم مثل none أو minimal إلى خطأ 400.
أدوات المطورين
خطط لوحدات GPU للاستضافة الذاتية، وقدّر عدد التوكنات والتكلفة، وأنشئ شيفرة API جاهزة للعمل واضبط وكيل البرمجة لديك. يستند كل رقم إلى وثائق Reflection نفسها.
مقدار ذاكرة VRAM التي يحتاج إليها Beam عند كل دقة وطول للسياق، وعدد وحدات GPU المطلوبة.
02 / costقدّر عدد التوكنات لكل طلب مع الاستدلال، وحجم الاستخدام اليومي مقارنةً بحدود المعدل، وتكلفة الاستضافة الذاتية.
03 / codeأمثلة جاهزة للعمل باستخدام curl وPython وTypeScript للبث، واستدعاءات الأدوات، ومخرجات JSON، والمحادثات متعددة الأدوار.
04 / agentsإعدادات جاهزة للنسخ لـ Mirror CLI وPi وOpenCode وHermes Agent لاستخدامها مع Beam.
تتبع واجهة API مواصفات OpenAI Chat Completions، لذا تعمل حزم OpenAI SDK الرسمية بعد تغيير عنوان URL الأساسي والمفتاح.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) يستدِل Beam دائمًا. تحدد reasoning_effort مقدار الاستدلال، من low إلى max، والقيمة الافتراضية هي medium. تؤدي قيم مثل none أو minimal إلى خطأ 400.
في المحادثات متعددة الأدوار واستدعاءات الأدوات، أرسِل كل رسالة assistant سابقة مع reasoning_content. من دون ذلك، تُرجع واجهة API الخطأ 400 missing_required_parameter.
تُحتسب توكنات الاستدلال ضمن max_completion_tokens. إذا ضبطته على قيمة منخفضة جدًا، فستحصل على finish_reason "length" وإجابة فارغة.
لا يدعم إدخال الصور أو الصوت أو الملفات، ولا واجهات Responses أو Embeddings أو Batch API. يجب أن تستخدم الوكلاء مزوّد Chat Completions متوافقًا مع OpenAI.
يُقبل stop لكن يُتجاهل؛ يجب أن تكون قيمة n هي 1؛ ولا يتوفر دعم لـ logprobs وlogit_bias؛ ويؤدي استخدام user وmetadata إلى خطأ.
تُطبَّق الحدود لكل مؤسسة، ولكل دقيقة ولكل يوم حسب التوقيت العالمي المنسق (UTC). التزم بـ Retry-After؛ وتعني x-should-retry: false أن الحصة اليومية قد نفدت حتى 00:00 UTC.
ليس بعد. وعدت Reflection بإتاحة الأوزان المفتوحة بموجب Apache 2.0 لاحقًا في أكتوبر 2026. وحتى ذلك الحين، لا يتوفر Beam إلا عبر واجهة API التجريبية التي تتطلب الانضمام إلى قائمة الانتظار.
يجب أن تتسع الذاكرة لجميع المعاملات البالغ عددها 501 مليارًا: نحو 1 TB بتنسيق BF16، ونحو 500 GB بتنسيق FP8، ونحو 250 GB بتنسيق 4-bit، بالإضافة إلى ذاكرة KV المؤقتة. يتطلب ذلك خادمًا مزودًا بعدة وحدات GPU؛ استخدم مخطط الذاكرة لتحديد الإعداد المناسب لك.
نعم، بالنسبة إلى Chat Completions وModels. وجّه SDK إلى https://api.reflection.ai/openai/v1 واستخدم معرّف النموذج Beam-501B-A23B. يتوفر البث واستدعاء الأدوات ومخرجات JSON Schema.
لم تنشر Reflection أسعار الفترة التجريبية. تتيح لك حاسبة التكلفة إدخال السعر الذي تحدده، وتوضّح تأثير رموز الاستدلال في التكلفة الإجمالية.