Anleitung
Beam heute verwenden
Beam befindet sich in einer schrittweisen Beta-Phase. Hier findest du alle Möglichkeiten, jetzt darauf zuzugreifen, funktionierenden Code für die OpenAI-kompatible API und Infos dazu, was sich ändert, wenn die offenen Gewichte verfügbar sind.
Deine Möglichkeiten auf einen Blick
Reflection-Beta-API
Registriere dich auf der Reflection-Plattform und setze dich auf die Warteliste. Sobald dein Zugang freigeschaltet ist, kannst du API-Schlüssel erstellen und Beam über einen OpenAI-kompatiblen Endpunkt aufrufen.
Auf die Warteliste setzenMirror CLI
Der Coding-Agent von Reflection für das Terminal, verfügbar für macOS (Apple Silicon) und Linux. Er verwendet standardmäßig Beam und benötigt denselben API-Schlüssel.
Mirror-SchnellstartIm Browser chatten
BeamAI.chat ist eine unabhängige Chat-Seite, die zu Beam wechselt, sobald das Modell öffentlich verfügbar ist. Bis dahin läuft dort ein vergleichbares offenes Modell, worauf die Seite klar hinweist.
BeamAI.chat öffnenGewichte herunterladen
Noch nicht möglich. Reflection hat angekündigt, die Gewichte später im Oktober 2026 unter Apache 2.0 zu veröffentlichen. Wir verfolgen die Veröffentlichung täglich.
VeröffentlichungsübersichtVom Start bis zur ersten Anfrage
- 01
Auf die Warteliste setzen
Erstelle ein Konto auf platform.reflection.ai. Neue Registrierungen müssen warten, bis ihr Zugang freigeschaltet ist.
- 02
API-Schlüssel erstellen
Öffne in der Plattform den Bereich API Keys und erstelle einen Schlüssel. Speichere ihn in der Umgebungsvariable REFLECTION_API_KEY.
- 03
Client auf Reflection ausrichten
Verwende die Basis-URL https://api.reflection.ai/openai/v1 mit einem beliebigen OpenAI-SDK und die Modell-ID Beam-501B-A23B.
- 04
Chat Completions senden
Rufe Chat Completions wie gewohnt auf. Optional kannst du reasoning_effort festlegen, um Geschwindigkeit gegen mehr Detailtiefe abzuwägen.
Codebeispiele
Der Endpunkt folgt dem OpenAI-Chat-Completions-Format. Daher funktionieren die offiziellen OpenAI-SDKs, wenn du die Basis-URL und den API-Schlüssel änderst.
Erste Anfrage
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Streaming
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Umgebungsvariablen
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Aufwand für Schlussfolgerungen
Beam zieht immer Schlussfolgerungen; es gibt keine Möglichkeit, dies auszuschalten. Der Parameter reasoning_effort steuert den Umfang. Der Standardwert ist medium.
| Wert | Verhalten |
|---|---|
| low | Am wenigsten Schlussfolgerungen, geringste Latenz. Für einfache Aufgaben. |
| medium | Ausgewogenes Verhältnis zwischen Qualität und Latenz. Wird verwendet, wenn du den Parameter weglässt. |
| high | Mehr Schlussfolgerungen für schwierigere Probleme. |
| xhigh | Mehr Schlussfolgerungen als bei high. |
| max | Am meisten Schlussfolgerungen für die schwierigsten Probleme. |
Tokens für Schlussfolgerungen werden auf max_completion_tokens und die Ratenbegrenzungen angerechnet. Ist das Limit zu niedrig, kann dem Modell während des Schlussfolgerns das Kontingent ausgehen. Dann gibt es eine leere Antwort mit finish_reason "length" zurück. Der Text der Schlussfolgerungen wird separat in reasoning_content zurückgegeben.
Was funktioniert und was nicht
Unterstützt
- POST /chat/completions, GET /models, GET /models/{model}
- Streaming, einschließlich Nutzungsdaten im letzten Chunk
- Tool-Aufrufe mit tool_choice und parallel_tool_calls
- Strukturierte Ausgaben: json_object und json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Rollen system, developer, user, assistant und tool
Nicht unterstützt
- Responses-, Embeddings-, Images-, Audio-, Files-, Batch- und Assistants-APIs
- Bild-, Audio- oder Dateieingaben: Beam verarbeitet nur Text
- n ungleich 1, logprobs, logit_bias
- Parameter wie user, metadata, audio oder prediction (sie führen zu einem Fehler)
- Stopsequenzen werden akzeptiert, haben aber keine Wirkung
Ratenlimits
Die Limits gelten pro Organisation und umfassen Anfragen und Tokens pro Minute und pro UTC-Tag sowie eine Obergrenze für gleichzeitige Anfragen. Wird ein Limit überschritten, wird HTTP 429 mit einem Retry-After-Header zurückgegeben. Tageslimits werden um 00:00 UTC zurückgesetzt. Reflection hat noch nicht veröffentlicht, wie höhere Limits beantragt werden können, und es gibt keine öffentliche Preisliste für die Beta.
Coding-Agenten
Mirror CLI verbindet sich mit Beam – dafür wird nur ein API-Schlüssel benötigt. Pi, OpenCode und Hermes funktionieren über ihre OpenAI-kompatiblen Anbietereinstellungen: Basis-URL https://api.reflection.ai/openai/v1, Modell Beam-501B-A23B, Schlüssel aus REFLECTION_API_KEY. Mirror unterstützt kein natives Windows.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultBeam selbst ausführen
Sobald die Gewichte verfügbar sind, lässt sich Beam mit Open-Source-Engines ausführen; Reflection zufolge arbeitet das Unternehmen an Integrationen und Launch-Partnern. Planen Sie viel Speicher ein: Alle 501 Milliarden Parameter müssen im GPU-Speicher liegen, obwohl pro Token nur 23 Milliarden aktiv sind. Das entspricht etwa 1 TB bei BF16, 500 GB bei FP8 und 250 GB bei 4 Bit, jeweils ohne KV-Cache.