Strumenti per sviluppatori

Crea con Reflection Beam

Pianifica le GPU per l'hosting autonomo, stima token e costi, genera codice API funzionante e configura il tuo agente di coding. Ogni numero si basa sulla documentazione ufficiale di Reflection.

Inizia con il generatore di codice Pianificatore di memoria GPU

Informazioni essenziali

ID modello
Beam-501B-A23B
URL di base
https://api.reflection.ai/openai/v1
Parametri
501B totali, 23B attivi
Finestra di contesto
262,144 token
Output massimo
131,072 token
Livello di ragionamento
low · medium · high · xhigh · max

Strumenti

La tua prima richiesta in 30 secondi

L'API segue OpenAI Chat Completions, quindi gli SDK ufficiali di OpenAI funzionano dopo aver modificato l'URL di base e la chiave.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Sei aspetti che possono creare problemi

Il ragionamento non si può disattivare

Beam ragiona sempre. reasoning_effort determina quanto, da low a max; il valore predefinito è medium. Valori come none o minimal generano un errore 400.

Invia di nuovo il ragionamento

Nelle chat con più turni e nelle chiamate agli strumenti, restituisci ogni messaggio assistant precedente con il relativo reasoning_content. Senza, l'API risponde con 400 missing_required_parameter.

I token di ragionamento consumano il tuo budget di token

I token di ragionamento rientrano in max_completion_tokens. Se lo imposti su un valore troppo basso, otterrai finish_reason "length" e una risposta vuota.

Solo testo e Chat Completions

Nessun input di immagini, audio o file e nessuna API Responses, Embeddings o Batch. Gli agenti devono usare un provider Chat Completions compatibile con OpenAI.

Alcuni parametri non hanno effetto

stop è accettato ma ignorato; n deve essere 1; logprobs e logit_bias non sono supportati; user e metadata restituiscono un errore.

429 significa aspettare, non riprovare subito

I limiti si applicano per organizzazione, al minuto e al giorno UTC. Rispetta Retry-After; x-should-retry: false significa che il budget giornaliero è esaurito fino alle 00:00 UTC.

Scopri di più su Beam

Domande frequenti

Posso scaricare i pesi di Beam?

Non ancora. Reflection ha promesso di rilasciare pesi aperti con licenza Apache 2.0 più avanti, a ottobre 2026. Fino ad allora, Beam è disponibile solo tramite l’API beta con accesso su invito.

Di quale hardware ho bisogno per l’hosting autonomo?

Tutti i 501 miliardi di parametri devono essere caricati in memoria: circa 1 TB in BF16, circa 500 GB in FP8 e circa 250 GB a 4-bit, oltre alla cache KV. Serve un server multi-GPU; usa il pianificatore di memoria per configurare il tuo setup.

L’API è compatibile con OpenAI SDK?

Sì, per Chat Completions e Models. Indirizza l’SDK a https://api.reflection.ai/openai/v1 e usa l’ID modello Beam-501B-A23B. Lo streaming, le chiamate agli strumenti e gli output con schema JSON sono supportati.

Quanto costa l’API?

Reflection non ha ancora pubblicato i prezzi della beta. Il calcolatore dei costi ti permette di inserire il tuo prezzo e mostra come i token di ragionamento incidono sul totale.