Comment utiliser
Comment utiliser Beam dès aujourd’hui
Beam est en bêta progressive. Voici toutes les façons d’y accéder dès maintenant, du code fonctionnel pour l’API compatible avec OpenAI et les changements à prévoir à l’arrivée des poids ouverts.
Vos options pour le moment
API bêta de Reflection
Inscrivez-vous sur la plateforme Reflection et rejoignez la liste d’attente. Une fois l’accès activé, vous pourrez créer des clés API et appeler Beam via un point de terminaison compatible avec OpenAI.
Rejoindre la liste d’attenteMirror CLI
L’agent de programmation de Reflection pour le terminal, disponible sur macOS (Apple Silicon) et Linux. Il utilise Beam par défaut et nécessite la même clé API.
Démarrage rapide de MirrorDiscuter dans le navigateur
BeamAI.chat est un site de discussion indépendant qui passera à Beam dès que le modèle sera accessible au public. D’ici là, il utilise un modèle ouvert comparable et l’indique clairement.
Ouvrir BeamAI.chatTélécharger les poids
Ce n’est pas encore possible. Reflection a promis de publier les poids sous licence Apache 2.0 plus tard en octobre 2026. Nous suivons la publication au quotidien.
Suivi de la sortieDe zéro à votre première requête
- 01
Rejoindre la liste d’attente
Créez un compte sur platform.reflection.ai. Les nouveaux inscrits doivent attendre l’activation de leur accès.
- 02
Créer une clé API
Dans la plateforme, ouvrez Clés API et créez une clé. Enregistrez-la dans la variable d’environnement REFLECTION_API_KEY.
- 03
Configurer votre client pour Reflection
Utilisez l’URL de base https://api.reflection.ai/openai/v1 avec n’importe quel SDK OpenAI, et l’identifiant de modèle Beam-501B-A23B.
- 04
Envoyer une complétion de chat
Appelez Chat Completions comme d'habitude. Vous pouvez définir reasoning_effort pour arbitrer entre vitesse et profondeur.
Exemples de code
Le point de terminaison suit le format OpenAI Chat Completions : les SDK officiels OpenAI fonctionnent donc après modification de l'URL de base et de la clé.
Première requête
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Diffusion en continu
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Variables d'environnement
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Effort de raisonnement
Beam raisonne toujours ; il est impossible de désactiver cette fonction. Le paramètre reasoning_effort contrôle le niveau de raisonnement. La valeur par défaut est medium.
| Valeur | Comportement |
|---|---|
| low | Raisonnement minimal, latence la plus faible. Pour les tâches simples. |
| medium | Équilibre entre qualité et latence. Utilisé si vous omettez le paramètre. |
| high | Davantage de raisonnement pour les problèmes plus difficiles. |
| xhigh | Davantage de raisonnement qu'avec high. |
| max | Le niveau de raisonnement le plus élevé, pour les problèmes les plus difficiles. |
Les jetons de raisonnement sont comptabilisés dans max_completion_tokens et les limites de débit. Si la limite est trop basse, le modèle peut manquer de jetons pendant son raisonnement et renvoyer une réponse vide avec finish_reason "length". Le texte de raisonnement est renvoyé séparément dans reasoning_content.
Ce qui fonctionne et ce qui ne fonctionne pas
Pris en charge
- POST /chat/completions, GET /models, GET /models/{model}
- Diffusion en continu, avec l'utilisation incluse dans le dernier fragment
- Appel d'outils avec tool_choice et parallel_tool_calls
- Sorties structurées : json_object et json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Rôles system, developer, user, assistant et tool
Non pris en charge
- API de réponses, d'embeddings, d'images, d'audio, de fichiers, de traitement par lots et d'assistants
- Entrées image, audio ou fichier : Beam est exclusivement textuel
- n différent de 1, logprobs, logit_bias
- Paramètres tels que user, metadata, audio ou prediction (ils renvoient une erreur)
- Les séquences d'arrêt sont acceptées, mais n'ont aucun effet
Limites de débit
Les limites s'appliquent par organisation, en requêtes et en jetons par minute et par jour UTC, ainsi qu'à un plafond de requêtes simultanées. Tout dépassement entraîne une réponse HTTP 429 avec un en-tête Retry-After. Les limites quotidiennes sont réinitialisées à 00:00 UTC. Reflection n'a pas encore publié la marche à suivre pour demander des limites plus élevées, et il n'existe pas de liste de prix publique pour la bêta.
Agents de programmation
Mirror CLI se connecte à Beam avec une simple clé API. Pi, OpenCode et Hermes fonctionnent via leurs paramètres de fournisseur compatibles avec OpenAI : URL de base https://api.reflection.ai/openai/v1, modèle Beam-501B-A23B, clé obtenue via REFLECTION_API_KEY. Mirror ne prend pas en charge Windows en natif.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultExécuter Beam vous-même
Lorsque les poids seront disponibles, Beam pourra être déployé avec des moteurs open source ; Reflection indique travailler sur des intégrations et des partenaires de lancement. Prévoyez beaucoup de mémoire : les 501 milliards de paramètres doivent tenir dans la mémoire GPU, même si seuls 23 milliards sont actifs par jeton. Cela représente environ 1 TB en BF16, 500 GB en FP8 et 250 GB en 4 bits, sans compter le cache KV.