Il ragionamento non si può disattivare
Beam ragiona sempre. reasoning_effort determina quanto, da low a max; il valore predefinito è medium. Valori come none o minimal generano un errore 400.
Strumenti per sviluppatori
Pianifica le GPU per l'hosting autonomo, stima token e costi, genera codice API funzionante e configura il tuo agente di coding. Ogni numero si basa sulla documentazione ufficiale di Reflection.
Inizia con il generatore di codice Pianificatore di memoria GPU
Quanta VRAM richiede Beam a ogni livello di precisione e lunghezza del contesto, e quante GPU servono.
02 / costStima i token per richiesta con il ragionamento, il volume giornaliero rispetto ai limiti di velocità e il costo del self-hosting.
03 / codeEsempi funzionanti in curl, Python e TypeScript per lo streaming, le chiamate agli strumenti, l'output JSON e le chat multi-turno.
04 / agentsConfigurazione pronta da copiare per usare Beam con Mirror CLI, Pi, OpenCode e Hermes Agent.
L'API segue OpenAI Chat Completions, quindi gli SDK ufficiali di OpenAI funzionano dopo aver modificato l'URL di base e la chiave.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam ragiona sempre. reasoning_effort determina quanto, da low a max; il valore predefinito è medium. Valori come none o minimal generano un errore 400.
Nelle chat con più turni e nelle chiamate agli strumenti, restituisci ogni messaggio assistant precedente con il relativo reasoning_content. Senza, l'API risponde con 400 missing_required_parameter.
I token di ragionamento rientrano in max_completion_tokens. Se lo imposti su un valore troppo basso, otterrai finish_reason "length" e una risposta vuota.
Nessun input di immagini, audio o file e nessuna API Responses, Embeddings o Batch. Gli agenti devono usare un provider Chat Completions compatibile con OpenAI.
stop è accettato ma ignorato; n deve essere 1; logprobs e logit_bias non sono supportati; user e metadata restituiscono un errore.
I limiti si applicano per organizzazione, al minuto e al giorno UTC. Rispetta Retry-After; x-should-retry: false significa che il budget giornaliero è esaurito fino alle 00:00 UTC.
Non ancora. Reflection ha promesso di rilasciare pesi aperti con licenza Apache 2.0 più avanti, a ottobre 2026. Fino ad allora, Beam è disponibile solo tramite l’API beta con accesso su invito.
Tutti i 501 miliardi di parametri devono essere caricati in memoria: circa 1 TB in BF16, circa 500 GB in FP8 e circa 250 GB a 4-bit, oltre alla cache KV. Serve un server multi-GPU; usa il pianificatore di memoria per configurare il tuo setup.
Sì, per Chat Completions e Models. Indirizza l’SDK a https://api.reflection.ai/openai/v1 e usa l’ID modello Beam-501B-A23B. Lo streaming, le chiamate agli strumenti e gli output con schema JSON sono supportati.
Reflection non ha ancora pubblicato i prezzi della beta. Il calcolatore dei costi ti permette di inserire il tuo prezzo e mostra come i token di ragionamento incidono sul totale.