Saltar al contenido
reflectionbeam

Cómo usar

Cómo usar Beam hoy

Beam está en una beta gradual. Aquí tienes todas las formas de acceder ahora mismo, código funcional para la API compatible con OpenAI y lo que cambiará cuando se publiquen los pesos abiertos.

Tus opciones ahora mismo

De cero a la primera solicitud

  1. 01

    Unirse a la lista de espera

    Crea una cuenta en platform.reflection.ai. Los nuevos registros deben esperar a que se habilite su acceso.

  2. 02

    Crear una clave de API

    En la plataforma, abre API Keys y crea una clave. Guárdala en la variable de entorno REFLECTION_API_KEY.

  3. 03

    Configura tu cliente para Reflection

    Usa la URL base https://api.reflection.ai/openai/v1 con cualquier SDK de OpenAI y el ID de modelo Beam-501B-A23B.

  4. 04

    Enviar una finalización de chat

    Llama a Chat Completions como de costumbre. Si quieres, configura reasoning_effort para ajustar el equilibrio entre velocidad y profundidad.

Ejemplos de código

El endpoint sigue el formato de OpenAI Chat Completions, así que los SDK oficiales de OpenAI funcionan si cambias la URL base y la clave.

Primera solicitud

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Transmisión en streaming

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Variables de entorno

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Nivel de razonamiento

Beam siempre razona; no se puede desactivar. El parámetro reasoning_effort controla cuánto. El valor predeterminado es medium.

ValorComportamiento
lowMenos razonamiento y menor latencia. Para tareas sencillas.
mediumEquilibrio entre calidad y latencia. Se usa si omites el parámetro.
highMás razonamiento para problemas difíciles.
xhighMás razonamiento que con high.
maxEl máximo razonamiento, para los problemas más difíciles.

Los tokens de razonamiento cuentan para max_completion_tokens y los límites de frecuencia. Si el límite es demasiado bajo, el modelo puede quedarse sin tokens mientras sigue razonando y devolver una respuesta vacía con finish_reason "length". El texto de razonamiento se devuelve por separado en reasoning_content.

Qué funciona y qué no

Compatible

  • POST /chat/completions, GET /models, GET /models/{model}
  • Transmisión en streaming, incluido el uso en el fragmento final
  • Llamada a herramientas con tool_choice y parallel_tool_calls
  • Salidas estructuradas: json_object y json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Roles system, developer, user, assistant y tool

No compatible

  • API de Responses, Embeddings, Images, Audio, Files, Batch y Assistants
  • Entradas de imagen, audio o archivos: Beam solo admite texto
  • n distinto de 1, logprobs, logit_bias
  • Parámetros como user, metadata, audio o prediction (devuelven un error)
  • Se aceptan las secuencias de parada, pero no tienen efecto

Límites de uso

Los límites se aplican por organización, a las solicitudes y los tokens por minuto y por día UTC, además de establecer un máximo de solicitudes simultáneas. Si se supera alguno, se devuelve HTTP 429 con un encabezado Retry-After. Los límites diarios se restablecen a las 00:00 UTC. Reflection aún no ha publicado cómo solicitar límites más altos, y no hay una lista pública de precios para la beta.

Agentes de programación

Mirror CLI se conecta a Beam con solo una clave de API. Pi, OpenCode y Hermes funcionan mediante la configuración de proveedor compatible con OpenAI: URL base https://api.reflection.ai/openai/v1, modelo Beam-501B-A23B y clave de REFLECTION_API_KEY. Mirror no es compatible con Windows nativo.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Ejecutar Beam por tu cuenta

Cuando se publiquen los pesos, Beam podrá ejecutarse con motores de código abierto; Reflection afirma que está trabajando en integraciones y socios de lanzamiento. Prevé mucha memoria: los 501 mil millones de parámetros deben estar en la memoria de la GPU, aunque solo 23 mil millones estén activos por token. Eso equivale aproximadamente a 1 TB en BF16, 500 GB en FP8 y 250 GB en 4 bits, sin contar la caché KV.