Vai al contenuto
reflectionbeam

Come usarlo

Come usare Beam oggi

Beam è in fase beta con accesso graduale. Ecco tutti i modi per accedervi subito, codice funzionante per l’API compatibile con OpenAI e cosa cambierà quando saranno disponibili i pesi aperti.

Le opzioni disponibili ora

Dalla registrazione alla prima richiesta

  1. 01

    Unisciti alla lista d’attesa

    Crea un account su platform.reflection.ai. I nuovi iscritti dovranno attendere che venga abilitato il loro accesso.

  2. 02

    Crea una chiave API

    Nella piattaforma, apri API Keys e crea una chiave. Salvala nella variabile d’ambiente REFLECTION_API_KEY.

  3. 03

    Indirizza il client a Reflection

    Usa l’URL di base https://api.reflection.ai/openai/v1 con qualsiasi SDK OpenAI e l’ID del modello Beam-501B-A23B.

  4. 04

    Invia una richiesta di completamento chat

    Usa Chat Completions come di consueto. Facoltativamente, imposta reasoning_effort per bilanciare velocità e profondità.

Esempi di codice

L'endpoint segue il formato OpenAI Chat Completions, quindi gli SDK ufficiali di OpenAI funzionano dopo aver modificato l'URL di base e la chiave.

Prima richiesta

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Streaming

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Variabili d'ambiente

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Intensità del ragionamento

Beam ragiona sempre: non è possibile disattivare questa funzione. Il parametro reasoning_effort controlla quanto ragionamento applica. Il valore predefinito è medium.

ValoreComportamento
lowMinimo ragionamento e latenza più bassa. Per attività semplici.
mediumEquilibrio tra qualità e latenza. Viene usato se ometti il parametro.
highPiù ragionamento per i problemi più difficili.
xhighPiù ragionamento rispetto a high.
maxIl massimo ragionamento, per i problemi più difficili.

I token di ragionamento vengono conteggiati in max_completion_tokens e nei limiti di frequenza. Se il limite è troppo basso, il modello potrebbe esaurirlo mentre sta ancora ragionando e restituire una risposta vuota con finish_reason "length". Il testo del ragionamento viene restituito separatamente in reasoning_content.

Cosa funziona e cosa no

Supportato

  • POST /chat/completions, GET /models, GET /models/{model}
  • Streaming, incluso l'utilizzo nell'ultimo chunk
  • Chiamate agli strumenti con tool_choice e parallel_tool_calls
  • Output strutturati: json_object e json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Ruoli system, developer, user, assistant e tool

Non supportato

  • API di Responses, Embeddings, Images, Audio, Files, Batch e Assistants
  • Input di immagini, audio o file: Beam accetta solo testo
  • n diverso da 1, logprobs, logit_bias
  • Parametri come user, metadata, audio o prediction (restituiscono un errore)
  • Le sequenze stop sono accettate, ma non hanno effetto

Limiti di frequenza

I limiti si applicano per organizzazione, alle richieste e ai token al minuto e per giorno UTC, oltre a un limite alle richieste simultanee. Se superi uno di questi limiti, ricevi HTTP 429 con un header Retry-After. I limiti giornalieri si azzerano alle 00:00 UTC. Reflection non ha ancora pubblicato le modalità per richiedere limiti più elevati e non esiste un listino prezzi pubblico per la beta.

Agenti di programmazione

Mirror CLI si connette a Beam usando solo una chiave API. Pi, OpenCode e Hermes funzionano tramite le impostazioni del provider compatibile con OpenAI: URL di base https://api.reflection.ai/openai/v1, modello Beam-501B-A23B, chiave da REFLECTION_API_KEY. Mirror non supporta Windows in modalità nativa.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Eseguire Beam in autonomia

Quando i pesi saranno disponibili, Beam potrà essere eseguito con motori open source; Reflection afferma che sta lavorando a integrazioni e partner per il lancio. Prevedi un elevato fabbisogno di memoria: tutti i 501 miliardi di parametri devono risiedere nella memoria della GPU, anche se solo 23 miliardi sono attivi per token. Si tratta di circa 1 TB in BF16, 500 GB in FP8 e 250 GB a 4 bit, senza contare la cache KV.