No se puede desactivar el razonamiento
Beam siempre razona. reasoning_effort determina cuánto, desde low hasta max; medium es el valor predeterminado. Los valores none y minimal devuelven un error 400.
Herramientas para desarrolladores
Planifica GPU para alojar el modelo por tu cuenta, calcula tokens y costes, genera código funcional para la API y configura tu agente de programación. Todas las cifras se basan en la documentación de Reflection.
Empieza con el generador de código Planificador de memoria GPU
Cuánta VRAM necesita Beam según la precisión y la longitud del contexto, y cuántas GPU hacen falta.
02 / costCalcula los tokens por solicitud con razonamiento, el volumen diario según los límites de velocidad y el coste de alojarlo por tu cuenta.
03 / codeEjemplos funcionales en curl, Python y TypeScript para streaming, llamadas a herramientas, salida JSON y conversaciones de varios turnos.
04 / agentsConfiguración lista para copiar de Mirror CLI, Pi, OpenCode y Hermes Agent con Beam.
La API sigue el formato OpenAI Chat Completions, así que los SDK oficiales de OpenAI funcionan con solo cambiar la URL base y la clave.
pip install openai
export REFLECTION_API_KEY="<your API key>" import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.reflection.ai/openai/v1",
api_key=os.environ["REFLECTION_API_KEY"],
)
messages = [
{"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]
completion = client.chat.completions.create(
model="Beam-501B-A23B",
messages=messages,
reasoning_effort="medium",
)
message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content) Beam siempre razona. reasoning_effort determina cuánto, desde low hasta max; medium es el valor predeterminado. Los valores none y minimal devuelven un error 400.
En los chats de varios turnos y las llamadas a herramientas, incluye cada mensaje anterior de assistant junto con su reasoning_content. Si no lo haces, la API responde con 400 missing_required_parameter.
Los tokens de razonamiento cuentan para max_completion_tokens. Si lo configuras demasiado bajo, obtendrás finish_reason "length" y una respuesta vacía.
No se admiten entradas de imagen, audio ni archivos, ni las API de Responses, Embeddings o Batch. Los agentes deben usar un proveedor compatible con OpenAI Chat Completions.
stop se acepta, pero se ignora; n debe ser 1; logprobs y logit_bias no son compatibles; user y metadata devuelven un error.
Los límites se aplican por organización, por minuto y por día UTC. Respeta Retry-After; x-should-retry: false significa que el presupuesto diario se ha agotado hasta las 00:00 UTC.
Todavía no. Reflection ha prometido publicar los pesos abiertos bajo Apache 2.0 más adelante, en octubre de 2026. Hasta entonces, Beam solo está disponible mediante la API beta con lista de espera.
Los 501 mil millones de parámetros deben caber en la memoria: aproximadamente 1 TB en BF16, 500 GB en FP8 y 250 GB en 4 bits, además de la caché KV. Se necesita un servidor con varias GPU; usa el planificador de memoria para tu configuración.
Sí, con Chat Completions y Models. Configura el SDK para usar https://api.reflection.ai/openai/v1 y el ID de modelo Beam-501B-A23B. La transmisión en tiempo real, las llamadas a herramientas y las salidas con esquema JSON son compatibles.
Reflection aún no ha publicado los precios de la beta. La calculadora de costos te permite introducir tus propios precios y muestra cómo afectan los tokens de razonamiento al total.