Przejdź do treści
reflectionbeam

Jak używać

Jak korzystać z Beam już dziś

Beam jest stopniowo udostępniany w wersji beta. Oto wszystkie dostępne obecnie sposoby dostępu, działający kod do zgodnego z OpenAI API oraz informacje o tym, co się zmieni po udostępnieniu otwartych wag.

Dostępne opcje

Od zera do pierwszego żądania

  1. 01

    Dołącz do listy oczekujących

    Utwórz konto na platform.reflection.ai. Nowi użytkownicy muszą poczekać na przyznanie dostępu.

  2. 02

    Utwórz klucz API

    Na platformie otwórz sekcję API Keys i utwórz klucz. Zapisz go w zmiennej środowiskowej REFLECTION_API_KEY.

  3. 03

    Skonfiguruj klienta do połączenia z Reflection

    Użyj adresu bazowego https://api.reflection.ai/openai/v1 z dowolnym SDK OpenAI oraz identyfikatora modelu Beam-501B-A23B.

  4. 04

    Wyślij żądanie Chat Completions

    Wywołuj Chat Completions jak zwykle. Opcjonalnie ustaw reasoning_effort, aby wybrać kompromis między szybkością a głębią.

Przykłady kodu

Endpoint jest zgodny z formatem OpenAI Chat Completions, więc oficjalne SDK OpenAI działają po zmianie bazowego URL-a i klucza.

Pierwsze żądanie

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Strumieniowanie

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Zmienne środowiskowe

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Poziom rozumowania

Beam zawsze rozumuje — nie można tego wyłączyć. Parametr reasoning_effort określa, jak intensywnie. Domyślna wartość to medium.

WartośćDziałanie
lowNajmniej rozumowania i najniższe opóźnienie. Do prostych zadań.
mediumRównowaga między jakością a opóźnieniem. Używana, gdy pomijasz ten parametr.
highWięcej rozumowania przy trudniejszych problemach.
xhighWięcej rozumowania niż w przypadku high.
maxNajwięcej rozumowania — do najtrudniejszych problemów.

Tokeny rozumowania są wliczane do max_completion_tokens i limitów szybkości. Jeśli limit jest zbyt niski, model może go wyczerpać podczas rozumowania i zwrócić pustą odpowiedź z finish_reason "length". Tekst rozumowania jest zwracany osobno w reasoning_content.

Co działa, a co nie

Obsługiwane

  • POST /chat/completions, GET /models, GET /models/{model}
  • Strumieniowanie, w tym informacje o użyciu w ostatnim fragmencie
  • Wywoływanie narzędzi za pomocą tool_choice i parallel_tool_calls
  • Ustrukturyzowane dane wyjściowe: json_object i json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Role system, developer, user, assistant i tool

Nieobsługiwane

  • Interfejsy API Responses, Embeddings, Images, Audio, Files, Batch i Assistants
  • Dane wejściowe w postaci obrazów, dźwięku lub plików: Beam obsługuje tylko tekst
  • n inne niż 1, logprobs, logit_bias
  • Parametry takie jak user, metadata, audio lub prediction (powodują zwrócenie błędu)
  • Sekwencje stop są akceptowane, ale nie mają żadnego efektu

Limity szybkości

Limity obowiązują dla każdej organizacji i dotyczą liczby żądań i tokenów na minutę oraz na dzień UTC, a także maksymalnej liczby równoczesnych żądań. Przekroczenie dowolnego z nich powoduje zwrócenie HTTP 429 z nagłówkiem Retry-After. Limity dzienne są resetowane o 00:00 UTC. Reflection nie opublikowało jeszcze informacji, jak wnioskować o wyższe limity, a cennik wersji beta nie jest publicznie dostępny.

Agenci programistyczni

Mirror CLI łączy się z Beam za pomocą samego klucza API. Pi, OpenCode i Hermes działają przez ustawienia dostawcy zgodnego z OpenAI: adres bazowy https://api.reflection.ai/openai/v1, model Beam-501B-A23B, klucz z REFLECTION_API_KEY. Mirror nie obsługuje natywnie systemu Windows.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Uruchamianie Beam we własnym środowisku

Gdy wagi zostaną udostępnione, Beam będzie można uruchamiać za pomocą silników open source; Reflection informuje, że pracuje nad integracjami i partnerami premierowymi. Przygotuj się na duże zapotrzebowanie na pamięć: wszystkie 501 miliardów parametrów musi znajdować się w pamięci GPU, mimo że na każdy token aktywnych jest tylko 23 miliardy. To około 1 TB przy BF16, 500 GB przy FP8 i 250 GB przy 4 bitach, bez uwzględnienia pamięci podręcznej KV.