Cómo usar
Cómo usar Beam hoy
Beam está en una beta gradual. Aquí tienes todas las formas de acceder ahora mismo, código funcional para la API compatible con OpenAI y lo que cambiará cuando se publiquen los pesos abiertos.
Tus opciones ahora mismo
API beta de Reflection
Regístrate en la plataforma de Reflection y únete a la lista de espera. Cuando se habilite el acceso, podrás crear claves de API y usar Beam mediante un endpoint compatible con OpenAI.
Unirse a la lista de esperaMirror CLI
El agente de programación propio de Reflection para el terminal, disponible en macOS (Apple Silicon) y Linux. Usa Beam de forma predeterminada y requiere la misma clave de API.
Inicio rápido de MirrorChatea en el navegador
BeamAI.chat es un sitio de chat independiente que cambiará a Beam en cuanto esté disponible públicamente. Hasta entonces, funciona con un modelo abierto comparable y lo indica claramente.
Abrir BeamAI.chatDescargar los pesos
Aún no es posible. Reflection ha prometido publicar los pesos bajo Apache 2.0 más adelante, en octubre de 2026. Hacemos un seguimiento diario del lanzamiento.
Seguimiento del lanzamientoDe cero a la primera solicitud
- 01
Unirse a la lista de espera
Crea una cuenta en platform.reflection.ai. Los nuevos registros deben esperar a que se habilite su acceso.
- 02
Crear una clave de API
En la plataforma, abre API Keys y crea una clave. Guárdala en la variable de entorno REFLECTION_API_KEY.
- 03
Configura tu cliente para Reflection
Usa la URL base https://api.reflection.ai/openai/v1 con cualquier SDK de OpenAI y el ID de modelo Beam-501B-A23B.
- 04
Enviar una finalización de chat
Llama a Chat Completions como de costumbre. Si quieres, configura reasoning_effort para ajustar el equilibrio entre velocidad y profundidad.
Ejemplos de código
El endpoint sigue el formato de OpenAI Chat Completions, así que los SDK oficiales de OpenAI funcionan si cambias la URL base y la clave.
Primera solicitud
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Transmisión en streaming
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Variables de entorno
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Nivel de razonamiento
Beam siempre razona; no se puede desactivar. El parámetro reasoning_effort controla cuánto. El valor predeterminado es medium.
| Valor | Comportamiento |
|---|---|
| low | Menos razonamiento y menor latencia. Para tareas sencillas. |
| medium | Equilibrio entre calidad y latencia. Se usa si omites el parámetro. |
| high | Más razonamiento para problemas difíciles. |
| xhigh | Más razonamiento que con high. |
| max | El máximo razonamiento, para los problemas más difíciles. |
Los tokens de razonamiento cuentan para max_completion_tokens y los límites de frecuencia. Si el límite es demasiado bajo, el modelo puede quedarse sin tokens mientras sigue razonando y devolver una respuesta vacía con finish_reason "length". El texto de razonamiento se devuelve por separado en reasoning_content.
Qué funciona y qué no
Compatible
- POST /chat/completions, GET /models, GET /models/{model}
- Transmisión en streaming, incluido el uso en el fragmento final
- Llamada a herramientas con tool_choice y parallel_tool_calls
- Salidas estructuradas: json_object y json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Roles system, developer, user, assistant y tool
No compatible
- API de Responses, Embeddings, Images, Audio, Files, Batch y Assistants
- Entradas de imagen, audio o archivos: Beam solo admite texto
- n distinto de 1, logprobs, logit_bias
- Parámetros como user, metadata, audio o prediction (devuelven un error)
- Se aceptan las secuencias de parada, pero no tienen efecto
Límites de uso
Los límites se aplican por organización, a las solicitudes y los tokens por minuto y por día UTC, además de establecer un máximo de solicitudes simultáneas. Si se supera alguno, se devuelve HTTP 429 con un encabezado Retry-After. Los límites diarios se restablecen a las 00:00 UTC. Reflection aún no ha publicado cómo solicitar límites más altos, y no hay una lista pública de precios para la beta.
Agentes de programación
Mirror CLI se conecta a Beam con solo una clave de API. Pi, OpenCode y Hermes funcionan mediante la configuración de proveedor compatible con OpenAI: URL base https://api.reflection.ai/openai/v1, modelo Beam-501B-A23B y clave de REFLECTION_API_KEY. Mirror no es compatible con Windows nativo.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultEjecutar Beam por tu cuenta
Cuando se publiquen los pesos, Beam podrá ejecutarse con motores de código abierto; Reflection afirma que está trabajando en integraciones y socios de lanzamiento. Prevé mucha memoria: los 501 mil millones de parámetros deben estar en la memoria de la GPU, aunque solo 23 mil millones estén activos por token. Eso equivale aproximadamente a 1 TB en BF16, 500 GB en FP8 y 250 GB en 4 bits, sin contar la caché KV.