Outils pour développeurs

Développez avec Reflection Beam

Planifiez les GPU pour l’auto-hébergement, estimez les tokens et les coûts, générez du code API fonctionnel et configurez votre agent de programmation. Chaque chiffre provient de la documentation de Reflection.

Commencez par le générateur de code Planificateur de mémoire GPU

L’essentiel

ID du modèle
Beam-501B-A23B
URL de base
https://api.reflection.ai/openai/v1
Paramètres
501B au total, 23B actifs
Fenêtre de contexte
262,144 tokens
Sortie maximale
131,072 tokens
Niveau de raisonnement
low · medium · high · xhigh · max

Outils

Votre première requête en 30 secondes

L’API suit OpenAI Chat Completions : les SDK officiels OpenAI fonctionnent après modification de l’URL de base et de la clé.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Six pièges à éviter

Impossible de désactiver le raisonnement

Beam raisonne toujours. reasoning_effort permet de choisir le niveau, de low à max ; medium est la valeur par défaut. Les valeurs comme none ou minimal renvoient une erreur 400.

Renvoyer le raisonnement

Dans les conversations à plusieurs tours et les appels d’outils, renvoyez chaque message assistant précédent avec son reasoning_content. Sans cela, l’API renvoie 400 missing_required_parameter.

Le raisonnement consomme votre budget de tokens

Les tokens de raisonnement sont comptabilisés dans max_completion_tokens. Si la valeur est trop basse, vous obtenez finish_reason "length" et une réponse vide.

Texte uniquement, Chat Completions uniquement

Aucune entrée image, audio ou fichier, et pas d’API Responses, Embeddings ou Batch. Les agents doivent utiliser un fournisseur Chat Completions compatible avec OpenAI.

Certains paramètres ne font rien

stop est accepté mais ignoré ; n doit être égal à 1 ; logprobs et logit_bias ne sont pas pris en charge ; user et metadata renvoient une erreur.

429 signifie qu’il faut attendre, pas réessayer tout de suite

Les limites s’appliquent par organisation, par minute et par jour UTC. Respectez Retry-After ; x-should-retry: false signifie que le quota journalier est épuisé jusqu’à 00:00 UTC.

En savoir plus sur Beam

FAQ

Puis-je télécharger les poids de Beam ?

Pas encore. Reflection a promis de publier les poids ouverts sous Apache 2.0 en octobre 2026. D’ici là, Beam est disponible uniquement via l’API bêta sur liste d’attente.

Quel matériel faut-il pour l’auto-hébergement ?

Les 501 milliards de paramètres doivent tenir en mémoire : environ 1 TB en BF16, environ 500 GB en FP8 et environ 250 GB en 4-bit, auxquels s’ajoute le cache KV. Il vous faut un serveur équipé de plusieurs GPU ; utilisez le planificateur de mémoire pour configurer votre installation.

L’API est-elle compatible avec l’OpenAI SDK ?

Oui, pour Chat Completions et Models. Configurez l’SDK pour utiliser https://api.reflection.ai/openai/v1 et l’ID de modèle Beam-501B-A23B. Le streaming, les appels d’outils et les sorties JSON schema sont pris en charge.

Combien coûte l’API ?

Reflection n’a pas encore publié les tarifs de la bêta. Le calculateur de coûts vous permet de saisir votre propre tarif et montre l’incidence des jetons de raisonnement sur le total.