Come usarlo
Come usare Beam oggi
Beam è in fase beta con accesso graduale. Ecco tutti i modi per accedervi subito, codice funzionante per l’API compatibile con OpenAI e cosa cambierà quando saranno disponibili i pesi aperti.
Le opzioni disponibili ora
API beta di Reflection
Registrati sulla piattaforma Reflection e unisciti alla lista d’attesa. Una volta abilitato l’accesso, potrai creare chiavi API e usare Beam tramite un endpoint compatibile con OpenAI.
Unisciti alla lista d’attesaMirror CLI
L’agente di programmazione di Reflection per il terminale, disponibile su macOS (Apple Silicon) e Linux. Usa Beam per impostazione predefinita e richiede la stessa chiave API.
Guida rapida a MirrorChat nel browser
BeamAI.chat è un sito di chat indipendente che passerà a Beam non appena sarà disponibile al pubblico. Nel frattempo usa un modello aperto comparabile e lo indica chiaramente.
Apri BeamAI.chatScarica i pesi
Non è ancora possibile. Reflection ha promesso di distribuire i pesi con licenza Apache 2.0 più avanti, a ottobre 2026. Seguiamo ogni giorno gli aggiornamenti sul rilascio.
Tracker del rilascioDalla registrazione alla prima richiesta
- 01
Unisciti alla lista d’attesa
Crea un account su platform.reflection.ai. I nuovi iscritti dovranno attendere che venga abilitato il loro accesso.
- 02
Crea una chiave API
Nella piattaforma, apri API Keys e crea una chiave. Salvala nella variabile d’ambiente REFLECTION_API_KEY.
- 03
Indirizza il client a Reflection
Usa l’URL di base https://api.reflection.ai/openai/v1 con qualsiasi SDK OpenAI e l’ID del modello Beam-501B-A23B.
- 04
Invia una richiesta di completamento chat
Usa Chat Completions come di consueto. Facoltativamente, imposta reasoning_effort per bilanciare velocità e profondità.
Esempi di codice
L'endpoint segue il formato OpenAI Chat Completions, quindi gli SDK ufficiali di OpenAI funzionano dopo aver modificato l'URL di base e la chiave.
Prima richiesta
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Streaming
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Variabili d'ambiente
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Intensità del ragionamento
Beam ragiona sempre: non è possibile disattivare questa funzione. Il parametro reasoning_effort controlla quanto ragionamento applica. Il valore predefinito è medium.
| Valore | Comportamento |
|---|---|
| low | Minimo ragionamento e latenza più bassa. Per attività semplici. |
| medium | Equilibrio tra qualità e latenza. Viene usato se ometti il parametro. |
| high | Più ragionamento per i problemi più difficili. |
| xhigh | Più ragionamento rispetto a high. |
| max | Il massimo ragionamento, per i problemi più difficili. |
I token di ragionamento vengono conteggiati in max_completion_tokens e nei limiti di frequenza. Se il limite è troppo basso, il modello potrebbe esaurirlo mentre sta ancora ragionando e restituire una risposta vuota con finish_reason "length". Il testo del ragionamento viene restituito separatamente in reasoning_content.
Cosa funziona e cosa no
Supportato
- POST /chat/completions, GET /models, GET /models/{model}
- Streaming, incluso l'utilizzo nell'ultimo chunk
- Chiamate agli strumenti con tool_choice e parallel_tool_calls
- Output strutturati: json_object e json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Ruoli system, developer, user, assistant e tool
Non supportato
- API di Responses, Embeddings, Images, Audio, Files, Batch e Assistants
- Input di immagini, audio o file: Beam accetta solo testo
- n diverso da 1, logprobs, logit_bias
- Parametri come user, metadata, audio o prediction (restituiscono un errore)
- Le sequenze stop sono accettate, ma non hanno effetto
Limiti di frequenza
I limiti si applicano per organizzazione, alle richieste e ai token al minuto e per giorno UTC, oltre a un limite alle richieste simultanee. Se superi uno di questi limiti, ricevi HTTP 429 con un header Retry-After. I limiti giornalieri si azzerano alle 00:00 UTC. Reflection non ha ancora pubblicato le modalità per richiedere limiti più elevati e non esiste un listino prezzi pubblico per la beta.
Agenti di programmazione
Mirror CLI si connette a Beam usando solo una chiave API. Pi, OpenCode e Hermes funzionano tramite le impostazioni del provider compatibile con OpenAI: URL di base https://api.reflection.ai/openai/v1, modello Beam-501B-A23B, chiave da REFLECTION_API_KEY. Mirror non supporta Windows in modalità nativa.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultEseguire Beam in autonomia
Quando i pesi saranno disponibili, Beam potrà essere eseguito con motori open source; Reflection afferma che sta lavorando a integrazioni e partner per il lancio. Prevedi un elevato fabbisogno di memoria: tutti i 501 miliardi di parametri devono risiedere nella memoria della GPU, anche se solo 23 miliardi sono attivi per token. Si tratta di circa 1 TB in BF16, 500 GB in FP8 e 250 GB a 4 bit, senza contare la cache KV.