Рассуждения нельзя отключить
Beam всегда выполняет рассуждения. Параметр reasoning_effort задаёт их объём: от low до max. По умолчанию используется medium. Значения вроде none или minimal приводят к ошибке 400.
Инструменты для разработчиков
Планируйте конфигурации GPU для самостоятельного хостинга, оценивайте количество токенов и стоимость, генерируйте готовый код для API и настраивайте своего агента для программирования. Все цифры основаны на собственной документации Reflection.
Сколько VRAM требуется Beam для каждой точности и длины контекстного окна и сколько для этого нужно GPU.
02 / costОцените количество токенов на запрос с учётом рассуждений, суточный объём с учётом лимитов запросов и стоимость самостоятельного размещения.
03 / codeРабочие примеры на curl, Python и TypeScript для потоковой передачи, вызовов инструментов, вывода JSON и многоходовых диалогов.
04 / agentsГотовые к копированию настройки Beam для Mirror CLI, Pi, OpenCode и Hermes Agent.
API использует Chat Completions от OpenAI, поэтому официальные SDK OpenAI заработают, если изменить базовый URL и ключ.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam всегда выполняет рассуждения. Параметр reasoning_effort задаёт их объём: от low до max. По умолчанию используется medium. Значения вроде none или minimal приводят к ошибке 400.
В многоходовых диалогах и при вызове инструментов передавайте каждое предыдущее сообщение assistant вместе с его reasoning_content. Без него API вернёт ошибку 400 missing_required_parameter.
Токены рассуждений учитываются в max_completion_tokens. Если задать слишком низкое значение, вы получите finish_reason "length" и пустой ответ.
Нельзя передавать изображения, аудио и файлы. API Responses, Embeddings и Batch не поддерживаются. Агенты должны использовать совместимый с OpenAI провайдер Chat Completions.
stop принимается, но игнорируется; n должен быть равен 1; logprobs и logit_bias не поддерживаются; user и metadata приводят к ошибке.
Лимиты действуют для каждой организации, за минуту и за день по UTC. Соблюдайте Retry-After; x-should-retry: false означает, что дневной лимит исчерпан до 00:00 UTC.
Пока нет. Reflection обещает открыть веса по лицензии Apache 2.0 до конца октября 2026 года. До тех пор Beam доступен только через бета-API с листом ожидания.
Все 501 млрд параметров должны помещаться в память: около 1 TB при BF16, около 500 GB при FP8 и около 250 GB при 4-bit, плюс KV-кэш. Понадобится сервер с несколькими GPU; подберите конфигурацию с помощью планировщика памяти.
Да, для Chat Completions и Models. Укажите в SDK адрес https://api.reflection.ai/openai/v1 и используйте ID модели Beam-501B-A23B. Поддерживаются потоковая передача, вызов инструментов и структурированный вывод по JSON Schema.
Reflection пока не опубликовала цены на период бета-тестирования. Калькулятор стоимости позволяет указать собственную цену и показывает, как токены рассуждений влияют на общую стоимость.