Narzędzia dla programistów

Twórz z Reflection Beam

Planuj zasoby GPU do samodzielnego hostowania, szacuj liczbę tokenów i koszty, generuj działający kod API i konfiguruj swojego agenta programistycznego. Wszystkie liczby pochodzą z dokumentacji Reflection.

Zacznij od generatora kodu Planer pamięci GPU

Najważniejsze informacje

ID modelu
Beam-501B-A23B
Bazowy URL
https://api.reflection.ai/openai/v1
Parametry
Łącznie: 501B, aktywnych: 23B
Okno kontekstu
262,144 tokenów
Maks. liczba tokenów wyjściowych
131,072 tokenów
Intensywność rozumowania
low · medium · high · xhigh · max

Narzędzia

Pierwsze żądanie w 30 sekund

API jest zgodne z OpenAI Chat Completions, więc oficjalne SDK OpenAI działają po zmianie bazowego URL i klucza.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Sześć rzeczy, które często sprawiają problemy

Nie można wyłączyć rozumowania

Beam zawsze przeprowadza rozumowanie. reasoning_effort określa jego intensywność — od low do max; domyślna wartość to medium. Wartości takie jak none lub minimal powodują błąd 400.

Odsyłaj rozumowanie

W czatach wieloetapowych i wywołaniach narzędzi odsyłaj każdą wcześniejszą wiadomość assistant wraz z jej reasoning_content. Bez tego API zwraca błąd 400 missing_required_parameter.

Tokeny rozumowania zużywają limit tokenów

Tokeny rozumowania są wliczane do max_completion_tokens. Jeśli ustawisz tę wartość zbyt nisko, otrzymasz finish_reason "length" i pustą odpowiedź.

Tylko tekst, tylko Chat Completions

Brak obsługi obrazów, dźwięku i plików, a także API Responses, Embeddings i Batch. Agenci muszą korzystać z dostawcy Chat Completions zgodnego z OpenAI.

Niektóre parametry nic nie robią

stop jest akceptowany, ale ignorowany; n musi wynosić 1; logprobs i logit_bias nie są obsługiwane; user i metadata powodują błąd.

429 oznacza, że trzeba poczekać, a nie ponawiać próbę od razu

Limity obowiązują na organizację, minutę i dzień UTC. Przestrzegaj Retry-After; x-should-retry: false oznacza, że dzienny limit został wyczerpany i będzie dostępny ponownie o 00:00 UTC.

Więcej o Beam

FAQ

Czy mogę pobrać wagi Beam?

Jeszcze nie. Reflection zapowiedziało udostępnienie otwartych wag na licencji Apache 2.0 w dalszej części października 2026 r. Do tego czasu Beam będzie dostępny wyłącznie przez API beta z listą oczekujących.

Jakiego sprzętu potrzeba do samodzielnego hostowania?

Wszystkie 501 miliardów parametrów musi zmieścić się w pamięci: około 1 TB przy BF16, około 500 GB przy FP8 i około 250 GB przy 4-bitowej kwantyzacji, plus pamięć podręczna KV. Potrzebny będzie serwer z wieloma GPU; dobierz konfigurację za pomocą planera pamięci.

Czy API jest zgodne z OpenAI SDK?

Tak, w przypadku Chat Completions i Models. Ustaw w SDK adres https://api.reflection.ai/openai/v1 i użyj identyfikatora modelu Beam-501B-A23B. Strumieniowanie, wywoływanie narzędzi i odpowiedzi zgodne ze schematem JSON są obsługiwane.

Ile kosztuje API?

Reflection nie opublikowało cen wersji beta. Kalkulator kosztów pozwala wprowadzić własną cenę i pokazuje, jak tokeny rozumowania wpływają na łączny koszt.