Zum Inhalt springen
reflectionbeam

Anleitung

Beam heute verwenden

Beam befindet sich in einer schrittweisen Beta-Phase. Hier findest du alle Möglichkeiten, jetzt darauf zuzugreifen, funktionierenden Code für die OpenAI-kompatible API und Infos dazu, was sich ändert, wenn die offenen Gewichte verfügbar sind.

Deine Möglichkeiten auf einen Blick

Vom Start bis zur ersten Anfrage

  1. 01

    Auf die Warteliste setzen

    Erstelle ein Konto auf platform.reflection.ai. Neue Registrierungen müssen warten, bis ihr Zugang freigeschaltet ist.

  2. 02

    API-Schlüssel erstellen

    Öffne in der Plattform den Bereich API Keys und erstelle einen Schlüssel. Speichere ihn in der Umgebungsvariable REFLECTION_API_KEY.

  3. 03

    Client auf Reflection ausrichten

    Verwende die Basis-URL https://api.reflection.ai/openai/v1 mit einem beliebigen OpenAI-SDK und die Modell-ID Beam-501B-A23B.

  4. 04

    Chat Completions senden

    Rufe Chat Completions wie gewohnt auf. Optional kannst du reasoning_effort festlegen, um Geschwindigkeit gegen mehr Detailtiefe abzuwägen.

Codebeispiele

Der Endpunkt folgt dem OpenAI-Chat-Completions-Format. Daher funktionieren die offiziellen OpenAI-SDKs, wenn du die Basis-URL und den API-Schlüssel änderst.

Erste Anfrage

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Streaming

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Umgebungsvariablen

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Aufwand für Schlussfolgerungen

Beam zieht immer Schlussfolgerungen; es gibt keine Möglichkeit, dies auszuschalten. Der Parameter reasoning_effort steuert den Umfang. Der Standardwert ist medium.

WertVerhalten
lowAm wenigsten Schlussfolgerungen, geringste Latenz. Für einfache Aufgaben.
mediumAusgewogenes Verhältnis zwischen Qualität und Latenz. Wird verwendet, wenn du den Parameter weglässt.
highMehr Schlussfolgerungen für schwierigere Probleme.
xhighMehr Schlussfolgerungen als bei high.
maxAm meisten Schlussfolgerungen für die schwierigsten Probleme.

Tokens für Schlussfolgerungen werden auf max_completion_tokens und die Ratenbegrenzungen angerechnet. Ist das Limit zu niedrig, kann dem Modell während des Schlussfolgerns das Kontingent ausgehen. Dann gibt es eine leere Antwort mit finish_reason "length" zurück. Der Text der Schlussfolgerungen wird separat in reasoning_content zurückgegeben.

Was funktioniert und was nicht

Unterstützt

  • POST /chat/completions, GET /models, GET /models/{model}
  • Streaming, einschließlich Nutzungsdaten im letzten Chunk
  • Tool-Aufrufe mit tool_choice und parallel_tool_calls
  • Strukturierte Ausgaben: json_object und json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Rollen system, developer, user, assistant und tool

Nicht unterstützt

  • Responses-, Embeddings-, Images-, Audio-, Files-, Batch- und Assistants-APIs
  • Bild-, Audio- oder Dateieingaben: Beam verarbeitet nur Text
  • n ungleich 1, logprobs, logit_bias
  • Parameter wie user, metadata, audio oder prediction (sie führen zu einem Fehler)
  • Stopsequenzen werden akzeptiert, haben aber keine Wirkung

Ratenlimits

Die Limits gelten pro Organisation und umfassen Anfragen und Tokens pro Minute und pro UTC-Tag sowie eine Obergrenze für gleichzeitige Anfragen. Wird ein Limit überschritten, wird HTTP 429 mit einem Retry-After-Header zurückgegeben. Tageslimits werden um 00:00 UTC zurückgesetzt. Reflection hat noch nicht veröffentlicht, wie höhere Limits beantragt werden können, und es gibt keine öffentliche Preisliste für die Beta.

Coding-Agenten

Mirror CLI verbindet sich mit Beam – dafür wird nur ein API-Schlüssel benötigt. Pi, OpenCode und Hermes funktionieren über ihre OpenAI-kompatiblen Anbietereinstellungen: Basis-URL https://api.reflection.ai/openai/v1, Modell Beam-501B-A23B, Schlüssel aus REFLECTION_API_KEY. Mirror unterstützt kein natives Windows.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Beam selbst ausführen

Sobald die Gewichte verfügbar sind, lässt sich Beam mit Open-Source-Engines ausführen; Reflection zufolge arbeitet das Unternehmen an Integrationen und Launch-Partnern. Planen Sie viel Speicher ein: Alle 501 Milliarden Parameter müssen im GPU-Speicher liegen, obwohl pro Token nur 23 Milliarden aktiv sind. Das entspricht etwa 1 TB bei BF16, 500 GB bei FP8 und 250 GB bei 4 Bit, jeweils ohne KV-Cache.