Herramientas para desarrolladores

Desarrolla con Reflection Beam

Planifica GPU para alojar el modelo por tu cuenta, calcula tokens y costes, genera código funcional para la API y configura tu agente de programación. Todas las cifras se basan en la documentación de Reflection.

Empieza con el generador de código Planificador de memoria GPU

Lo esencial

ID del modelo
Beam-501B-A23B
URL base
https://api.reflection.ai/openai/v1
Parámetros
501B en total, 23B activos
Ventana de contexto
262,144 tokens
Salida máxima
131,072 tokens
Nivel de razonamiento
low · medium · high · xhigh · max

Herramientas

Tu primera solicitud en 30 segundos

La API sigue el formato OpenAI Chat Completions, así que los SDK oficiales de OpenAI funcionan con solo cambiar la URL base y la clave.

bash
pip install openai
export REFLECTION_API_KEY="<your API key>"
python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.reflection.ai/openai/v1",
    api_key=os.environ["REFLECTION_API_KEY"],
)

messages = [
    {"role": "user", "content": "Explain the difference between a process and a thread in three sentences."},
]

completion = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=messages,
    reasoning_effort="medium",
)

message = completion.choices[0].message
print("Reasoning:", getattr(message, "reasoning_content", None))
print(message.content)

Seis aspectos que suelen dar problemas

No se puede desactivar el razonamiento

Beam siempre razona. reasoning_effort determina cuánto, desde low hasta max; medium es el valor predeterminado. Los valores none y minimal devuelven un error 400.

Devuelve el razonamiento

En los chats de varios turnos y las llamadas a herramientas, incluye cada mensaje anterior de assistant junto con su reasoning_content. Si no lo haces, la API responde con 400 missing_required_parameter.

El razonamiento consume tu límite de tokens

Los tokens de razonamiento cuentan para max_completion_tokens. Si lo configuras demasiado bajo, obtendrás finish_reason "length" y una respuesta vacía.

Solo texto y Chat Completions

No se admiten entradas de imagen, audio ni archivos, ni las API de Responses, Embeddings o Batch. Los agentes deben usar un proveedor compatible con OpenAI Chat Completions.

Algunos parámetros no hacen nada

stop se acepta, pero se ignora; n debe ser 1; logprobs y logit_bias no son compatibles; user y metadata devuelven un error.

429 significa que debes esperar, no volver a intentarlo ahora

Los límites se aplican por organización, por minuto y por día UTC. Respeta Retry-After; x-should-retry: false significa que el presupuesto diario se ha agotado hasta las 00:00 UTC.

Más información sobre Beam

Preguntas frecuentes

¿Puedo descargar los pesos de Beam?

Todavía no. Reflection ha prometido publicar los pesos abiertos bajo Apache 2.0 más adelante, en octubre de 2026. Hasta entonces, Beam solo está disponible mediante la API beta con lista de espera.

¿Qué hardware se necesita para alojarlo por cuenta propia?

Los 501 mil millones de parámetros deben caber en la memoria: aproximadamente 1 TB en BF16, 500 GB en FP8 y 250 GB en 4 bits, además de la caché KV. Se necesita un servidor con varias GPU; usa el planificador de memoria para tu configuración.

¿La API es compatible con OpenAI SDK?

Sí, con Chat Completions y Models. Configura el SDK para usar https://api.reflection.ai/openai/v1 y el ID de modelo Beam-501B-A23B. La transmisión en tiempo real, las llamadas a herramientas y las salidas con esquema JSON son compatibles.

¿Cuánto cuesta la API?

Reflection aún no ha publicado los precios de la beta. La calculadora de costos te permite introducir tus propios precios y muestra cómo afectan los tokens de razonamiento al total.