Impossible de désactiver le raisonnement
Beam raisonne toujours. reasoning_effort permet de choisir le niveau, de low à max ; medium est la valeur par défaut. Les valeurs comme none ou minimal renvoient une erreur 400.
Outils pour développeurs
Planifiez les GPU pour l’auto-hébergement, estimez les tokens et les coûts, générez du code API fonctionnel et configurez votre agent de programmation. Chaque chiffre provient de la documentation de Reflection.
Commencez par le générateur de code Planificateur de mémoire GPU
Découvrez la quantité de VRAM nécessaire à Beam selon la précision et la longueur du contexte, ainsi que le nombre de GPU requis.
02 / costEstimez le nombre de tokens par requête avec raisonnement, le volume quotidien par rapport aux limites de débit et le coût de l’auto-hébergement.
03 / codeDes exemples fonctionnels en curl, Python et TypeScript pour le streaming, les appels d’outils, la sortie JSON et les conversations à plusieurs tours.
04 / agentsUne configuration prête à copier pour Mirror CLI, Pi, OpenCode et Hermes Agent avec Beam.
L’API suit OpenAI Chat Completions : les SDK officiels OpenAI fonctionnent après modification de l’URL de base et de la clé.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam raisonne toujours. reasoning_effort permet de choisir le niveau, de low à max ; medium est la valeur par défaut. Les valeurs comme none ou minimal renvoient une erreur 400.
Dans les conversations à plusieurs tours et les appels d’outils, renvoyez chaque message assistant précédent avec son reasoning_content. Sans cela, l’API renvoie 400 missing_required_parameter.
Les tokens de raisonnement sont comptabilisés dans max_completion_tokens. Si la valeur est trop basse, vous obtenez finish_reason "length" et une réponse vide.
Aucune entrée image, audio ou fichier, et pas d’API Responses, Embeddings ou Batch. Les agents doivent utiliser un fournisseur Chat Completions compatible avec OpenAI.
stop est accepté mais ignoré ; n doit être égal à 1 ; logprobs et logit_bias ne sont pas pris en charge ; user et metadata renvoient une erreur.
Les limites s’appliquent par organisation, par minute et par jour UTC. Respectez Retry-After ; x-should-retry: false signifie que le quota journalier est épuisé jusqu’à 00:00 UTC.
Pas encore. Reflection a promis de publier les poids ouverts sous Apache 2.0 en octobre 2026. D’ici là, Beam est disponible uniquement via l’API bêta sur liste d’attente.
Les 501 milliards de paramètres doivent tenir en mémoire : environ 1 TB en BF16, environ 500 GB en FP8 et environ 250 GB en 4-bit, auxquels s’ajoute le cache KV. Il vous faut un serveur équipé de plusieurs GPU ; utilisez le planificateur de mémoire pour configurer votre installation.
Oui, pour Chat Completions et Models. Configurez l’SDK pour utiliser https://api.reflection.ai/openai/v1 et l’ID de modèle Beam-501B-A23B. Le streaming, les appels d’outils et les sorties JSON schema sont pris en charge.
Reflection n’a pas encore publié les tarifs de la bêta. Le calculateur de coûts vous permet de saisir votre propre tarif et montre l’incidence des jetons de raisonnement sur le total.