Passer au contenu
reflectionbeam

Comment utiliser

Comment utiliser Beam dès aujourd’hui

Beam est en bêta progressive. Voici toutes les façons d’y accéder dès maintenant, du code fonctionnel pour l’API compatible avec OpenAI et les changements à prévoir à l’arrivée des poids ouverts.

Vos options pour le moment

De zéro à votre première requête

  1. 01

    Rejoindre la liste d’attente

    Créez un compte sur platform.reflection.ai. Les nouveaux inscrits doivent attendre l’activation de leur accès.

  2. 02

    Créer une clé API

    Dans la plateforme, ouvrez Clés API et créez une clé. Enregistrez-la dans la variable d’environnement REFLECTION_API_KEY.

  3. 03

    Configurer votre client pour Reflection

    Utilisez l’URL de base https://api.reflection.ai/openai/v1 avec n’importe quel SDK OpenAI, et l’identifiant de modèle Beam-501B-A23B.

  4. 04

    Envoyer une complétion de chat

    Appelez Chat Completions comme d'habitude. Vous pouvez définir reasoning_effort pour arbitrer entre vitesse et profondeur.

Exemples de code

Le point de terminaison suit le format OpenAI Chat Completions : les SDK officiels OpenAI fonctionnent donc après modification de l'URL de base et de la clé.

Première requête

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Diffusion en continu

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Variables d'environnement

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Effort de raisonnement

Beam raisonne toujours ; il est impossible de désactiver cette fonction. Le paramètre reasoning_effort contrôle le niveau de raisonnement. La valeur par défaut est medium.

ValeurComportement
lowRaisonnement minimal, latence la plus faible. Pour les tâches simples.
mediumÉquilibre entre qualité et latence. Utilisé si vous omettez le paramètre.
highDavantage de raisonnement pour les problèmes plus difficiles.
xhighDavantage de raisonnement qu'avec high.
maxLe niveau de raisonnement le plus élevé, pour les problèmes les plus difficiles.

Les jetons de raisonnement sont comptabilisés dans max_completion_tokens et les limites de débit. Si la limite est trop basse, le modèle peut manquer de jetons pendant son raisonnement et renvoyer une réponse vide avec finish_reason "length". Le texte de raisonnement est renvoyé séparément dans reasoning_content.

Ce qui fonctionne et ce qui ne fonctionne pas

Pris en charge

  • POST /chat/completions, GET /models, GET /models/{model}
  • Diffusion en continu, avec l'utilisation incluse dans le dernier fragment
  • Appel d'outils avec tool_choice et parallel_tool_calls
  • Sorties structurées : json_object et json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Rôles system, developer, user, assistant et tool

Non pris en charge

  • API de réponses, d'embeddings, d'images, d'audio, de fichiers, de traitement par lots et d'assistants
  • Entrées image, audio ou fichier : Beam est exclusivement textuel
  • n différent de 1, logprobs, logit_bias
  • Paramètres tels que user, metadata, audio ou prediction (ils renvoient une erreur)
  • Les séquences d'arrêt sont acceptées, mais n'ont aucun effet

Limites de débit

Les limites s'appliquent par organisation, en requêtes et en jetons par minute et par jour UTC, ainsi qu'à un plafond de requêtes simultanées. Tout dépassement entraîne une réponse HTTP 429 avec un en-tête Retry-After. Les limites quotidiennes sont réinitialisées à 00:00 UTC. Reflection n'a pas encore publié la marche à suivre pour demander des limites plus élevées, et il n'existe pas de liste de prix publique pour la bêta.

Agents de programmation

Mirror CLI se connecte à Beam avec une simple clé API. Pi, OpenCode et Hermes fonctionnent via leurs paramètres de fournisseur compatibles avec OpenAI : URL de base https://api.reflection.ai/openai/v1, modèle Beam-501B-A23B, clé obtenue via REFLECTION_API_KEY. Mirror ne prend pas en charge Windows en natif.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Exécuter Beam vous-même

Lorsque les poids seront disponibles, Beam pourra être déployé avec des moteurs open source ; Reflection indique travailler sur des intégrations et des partenaires de lancement. Prévoyez beaucoup de mémoire : les 501 milliards de paramètres doivent tenir dans la mémoire GPU, même si seuls 23 milliards sont actifs par jeton. Cela représente environ 1 TB en BF16, 500 GB en FP8 et 250 GB en 4 bits, sans compter le cache KV.