Nie można wyłączyć rozumowania
Beam zawsze przeprowadza rozumowanie. reasoning_effort określa jego intensywność — od low do max; domyślna wartość to medium. Wartości takie jak none lub minimal powodują błąd 400.
Narzędzia dla programistów
Planuj zasoby GPU do samodzielnego hostowania, szacuj liczbę tokenów i koszty, generuj działający kod API i konfiguruj swojego agenta programistycznego. Wszystkie liczby pochodzą z dokumentacji Reflection.
Ile pamięci VRAM potrzebuje Beam przy różnych precyzjach i długościach kontekstu oraz ile GPU potrzeba.
02 / costSzacuj liczbę tokenów na żądanie, także tych przeznaczonych na rozumowanie, dzienny wolumen względem limitów szybkości oraz koszt samodzielnego hostowania.
03 / codeGotowy do użycia kod curl, Python i TypeScript do strumieniowania, wywołań narzędzi, odpowiedzi w formacie JSON i czatów wieloturowych.
04 / agentsGotowe do skopiowania konfiguracje Beam dla Mirror CLI, Pi, OpenCode i Hermes Agent.
API jest zgodne z OpenAI Chat Completions, więc oficjalne SDK OpenAI działają po zmianie bazowego URL i klucza.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam zawsze przeprowadza rozumowanie. reasoning_effort określa jego intensywność — od low do max; domyślna wartość to medium. Wartości takie jak none lub minimal powodują błąd 400.
W czatach wieloetapowych i wywołaniach narzędzi odsyłaj każdą wcześniejszą wiadomość assistant wraz z jej reasoning_content. Bez tego API zwraca błąd 400 missing_required_parameter.
Tokeny rozumowania są wliczane do max_completion_tokens. Jeśli ustawisz tę wartość zbyt nisko, otrzymasz finish_reason "length" i pustą odpowiedź.
Brak obsługi obrazów, dźwięku i plików, a także API Responses, Embeddings i Batch. Agenci muszą korzystać z dostawcy Chat Completions zgodnego z OpenAI.
stop jest akceptowany, ale ignorowany; n musi wynosić 1; logprobs i logit_bias nie są obsługiwane; user i metadata powodują błąd.
Limity obowiązują na organizację, minutę i dzień UTC. Przestrzegaj Retry-After; x-should-retry: false oznacza, że dzienny limit został wyczerpany i będzie dostępny ponownie o 00:00 UTC.
Jeszcze nie. Reflection zapowiedziało udostępnienie otwartych wag na licencji Apache 2.0 w dalszej części października 2026 r. Do tego czasu Beam będzie dostępny wyłącznie przez API beta z listą oczekujących.
Wszystkie 501 miliardów parametrów musi zmieścić się w pamięci: około 1 TB przy BF16, około 500 GB przy FP8 i około 250 GB przy 4-bitowej kwantyzacji, plus pamięć podręczna KV. Potrzebny będzie serwer z wieloma GPU; dobierz konfigurację za pomocą planera pamięci.
Tak, w przypadku Chat Completions i Models. Ustaw w SDK adres https://api.reflection.ai/openai/v1 i użyj identyfikatora modelu Beam-501B-A23B. Strumieniowanie, wywoływanie narzędzi i odpowiedzi zgodne ze schematem JSON są obsługiwane.
Reflection nie opublikowało cen wersji beta. Kalkulator kosztów pozwala wprowadzić własną cenę i pokazuje, jak tokeny rozumowania wpływają na łączny koszt.