Инструменты для разработчиков

Разрабатывайте с Reflection Beam

Планируйте конфигурации GPU для самостоятельного хостинга, оценивайте количество токенов и стоимость, генерируйте готовый код для API и настраивайте своего агента для программирования. Все цифры основаны на собственной документации Reflection.

Начать с генератора кода Планировщик памяти GPU

Главное

ID модели
Beam-501B-A23B
Базовый URL
https://api.reflection.ai/openai/v1
Параметры
всего: 501B, активных: 23B
Контекстное окно
262,144 токенов
Максимальный вывод
131,072 токенов
Уровень рассуждений
low · medium · high · xhigh · max

Инструменты

Ваш первый запрос за 30 секунд

API использует Chat Completions от OpenAI, поэтому официальные SDK OpenAI заработают, если изменить базовый URL и ключ.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Шесть важных нюансов

Рассуждения нельзя отключить

Beam всегда выполняет рассуждения. Параметр reasoning_effort задаёт их объём: от low до max. По умолчанию используется medium. Значения вроде none или minimal приводят к ошибке 400.

Передавайте рассуждения в ответе

В многоходовых диалогах и при вызове инструментов передавайте каждое предыдущее сообщение assistant вместе с его reasoning_content. Без него API вернёт ошибку 400 missing_required_parameter.

Токены рассуждений расходуют ваш лимит

Токены рассуждений учитываются в max_completion_tokens. Если задать слишком низкое значение, вы получите finish_reason "length" и пустой ответ.

Только текст и Chat Completions

Нельзя передавать изображения, аудио и файлы. API Responses, Embeddings и Batch не поддерживаются. Агенты должны использовать совместимый с OpenAI провайдер Chat Completions.

Некоторые параметры ничего не делают

stop принимается, но игнорируется; n должен быть равен 1; logprobs и logit_bias не поддерживаются; user и metadata приводят к ошибке.

429 — нужно подождать, а не повторять запрос сразу

Лимиты действуют для каждой организации, за минуту и за день по UTC. Соблюдайте Retry-After; x-should-retry: false означает, что дневной лимит исчерпан до 00:00 UTC.

Подробнее о Beam

FAQ

Можно ли скачать веса Beam?

Пока нет. Reflection обещает открыть веса по лицензии Apache 2.0 до конца октября 2026 года. До тех пор Beam доступен только через бета-API с листом ожидания.

Какое оборудование нужно для самостоятельного хостинга?

Все 501 млрд параметров должны помещаться в память: около 1 TB при BF16, около 500 GB при FP8 и около 250 GB при 4-bit, плюс KV-кэш. Понадобится сервер с несколькими GPU; подберите конфигурацию с помощью планировщика памяти.

Совместим ли API с OpenAI SDK?

Да, для Chat Completions и Models. Укажите в SDK адрес https://api.reflection.ai/openai/v1 и используйте ID модели Beam-501B-A23B. Поддерживаются потоковая передача, вызов инструментов и структурированный вывод по JSON Schema.

Сколько стоит API?

Reflection пока не опубликовала цены на период бета-тестирования. Калькулятор стоимости позволяет указать собственную цену и показывает, как токены рассуждений влияют на общую стоимость.