Ga naar de inhoud
reflectionbeam

Gebruiken

Zo gebruik je Beam vandaag

Beam wordt geleidelijk beschikbaar in bèta. Hier vind je alle manieren om er nu toegang toe te krijgen, werkende code voor de OpenAI-compatibele API en wat er verandert zodra de open gewichten beschikbaar komen.

Je opties op dit moment

Van nul naar je eerste verzoek

  1. 01

    Zet jezelf op de wachtlijst

    Maak een account aan op platform.reflection.ai. Nieuwe aanmeldingen moeten wachten tot hun toegang is ingeschakeld.

  2. 02

    Maak een API-sleutel aan

    Open API Keys op het platform en maak een sleutel aan. Sla deze op in de omgevingsvariabele REFLECTION_API_KEY.

  3. 03

    Stel je client in op Reflection

    Gebruik de basis-URL https://api.reflection.ai/openai/v1 met elke OpenAI-SDK en de model-ID Beam-501B-A23B.

  4. 04

    Verstuur een chatcompletion

    Roep Chat Completions aan zoals gebruikelijk. Stel desgewenst reasoning_effort in om snelheid tegen diepgang af te wegen.

Codevoorbeelden

Het endpoint volgt de indeling van OpenAI Chat Completions, dus de officiële OpenAI-SDK's werken nadat je de basis-URL en sleutel hebt aangepast.

Eerste verzoek

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Streaming

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Omgevingsvariabelen

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Redeneerniveau

Beam redeneert altijd; je kunt dit niet uitschakelen. De parameter reasoning_effort bepaalt hoeveel. De standaardwaarde is medium.

WaardeGedrag
lowMinste redenering, laagste latentie. Voor eenvoudige taken.
mediumEvenwicht tussen kwaliteit en latentie. Wordt gebruikt als je de parameter weglaat.
highMeer redenering voor moeilijkere problemen.
xhighMeer redenering dan bij high.
maxDe meeste redenering, voor de moeilijkste problemen.

Redeneertokens tellen mee voor max_completion_tokens en de snelheidslimieten. Als de limiet te laag is, kan het model tijdens het redeneren zonder tokens komen te zitten en een leeg antwoord teruggeven met finish_reason "length". De redeneringstekst wordt afzonderlijk teruggegeven in reasoning_content.

Wat wel en niet werkt

Ondersteund

  • POST /chat/completions, GET /models, GET /models/{model}
  • Streaming, inclusief gebruik in het laatste deel
  • Toolaanroepen met tool_choice en parallel_tool_calls
  • Gestructureerde uitvoer: json_object en json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • De rollen system, developer, user, assistant en tool

Niet ondersteund

  • Responses-, Embeddings-, Images-, Audio-, Files-, Batch- en Assistants-API's
  • Invoer voor afbeeldingen, audio of bestanden: Beam werkt alleen met tekst
  • n anders dan 1, logprobs, logit_bias
  • Parameters zoals user, metadata, audio of prediction (die geven een foutmelding)
  • stop-sequenties worden geaccepteerd, maar hebben geen effect

Snelheidslimieten

Limieten gelden per organisatie voor het aantal aanvragen en tokens per minuut en per UTC-dag, plus een maximum voor gelijktijdige aanvragen. Als je een limiet overschrijdt, krijg je HTTP 429 met een Retry-After-header. Daglimieten worden om 00:00 UTC gereset. Reflection heeft nog niet bekendgemaakt hoe je hogere limieten kunt aanvragen en er is geen openbare prijslijst voor de bèta.

Codeerassistenten

Mirror CLI maakt verbinding met Beam met alleen een API-sleutel. Pi, OpenCode en Hermes werken via hun OpenAI-compatibele providerinstellingen: basis-URL https://api.reflection.ai/openai/v1, model Beam-501B-A23B, sleutel uit REFLECTION_API_KEY. Mirror biedt geen ondersteuning voor native Windows.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Beam zelf draaien

Zodra de gewichten beschikbaar zijn, kan Beam worden gedraaid met opensource-engines; Reflection zegt te werken aan integraties en launchpartners. Houd rekening met een grote geheugencapaciteit: alle 501 miljard parameters moeten in het GPU-geheugen staan, ook al zijn er per token maar 23 miljard actief. Dat is ongeveer 1 TB bij BF16, 500 GB bij FP8 en 250 GB bij 4-bit, exclusief de KV-cache.