Passer au contenu
reflectionbeam

Fiche du modèle

Caractéristiques de Beam

Tout ce que Reflection AI a publié sur la conception et l’entraînement de Beam. Les chiffres proviennent de l’annonce officielle et de la documentation destinée aux développeurs ; les estimations sont signalées.

En bref

DéveloppeurReflection AI (New York)
Annoncé2026-10-05
Type de modèleModèle de langage à mélange d’experts clairsemé
Nombre total de paramètres501B
Paramètres actifs par jeton23B
Couches52
Mécanisme d’attentionAttention locale et globale entrelacée
Fenêtre de contexte (bêta de l’API)256K tokens
Longueur de contexte atteinte en cours d’entraînement1M tokens
Sortie maximale (API)128K tokens
Date limite des connaissances2026-06-30
ModalitéTexte en entrée, texte en sortie
RaisonnementToujours activé, avec un réglage de l’effort de raisonnement
Fonctionnalités de l’APIAppel d’outils, sorties structurées, diffusion en continu
Licence des poidsApache 2.0 (poids promis pour plus tard en octobre 2026)
Identifiant de modèle pour l’APIBeam-501B-A23B

Pourquoi 501B au total, mais seulement 23B actifs ?

Dans un modèle à mélange d’experts, chaque couche contient de nombreux petits réseaux « experts » et un routeur en sélectionne quelques-uns pour chaque token. Beam compte 501 milliards de paramètres, mais chaque token n’en traverse qu’environ 23 milliards.

Résultat : le calcul par token est proche de celui d’un modèle dense de 23B, ce qui rend Beam moins coûteux à servir, tandis que sa capacité totale reste importante. Le revers de la médaille, c’est la mémoire. Les 501B paramètres doivent toujours tenir dans la mémoire des GPU pour servir le modèle.

Reflection indique que son routage est particulièrement équilibré : à la fin du préentraînement, l’expert le plus sollicité ne traitait que 1,04× la charge moyenne, de sorte que tous les experts sont utilisés.

501B100%
23B4.6%

Comment Beam a été entraîné

Préentraînement

23,8 billions de tokens issus du Web, de sources publiques et de jeux de données sous licence, avec une forte priorité accordée au code, à la rédaction technique et aux disciplines STEM. Environ 95 % des tokens bruts du Web ont été filtrés. Entraînement sur 6 144 GPU NVIDIA GB300 NVL72 en moins de quatre semaines, avec un débit utile de 92,3 % vers la fin.

Entraînement intermédiaire

Une étape conçue pour préparer le modèle à l’apprentissage par renforcement : des documents longs riches en raisonnement, des dépôts de code et des tâches à long horizon. C’est à cette étape que le contexte effectif de Beam a été étendu à 1 million de tokens.

Apprentissage par renforcement

Plus de 100 millions de trajectoires sur 10,500 GPU GB300 pendant quatre semaines, dans près d’un million d’environnements de programmation, d’agents et de STEM, et environ 1,3 milliard de bacs à sable. Reflection parle de l’une des plus grandes campagnes d’apprentissage par renforcement menées par un laboratoire ouvert et indique que les scores continuaient d’augmenter à la fin de la campagne.

Sécurité et alignement

Un modèle distinct axé sur la sécurité et l’alignement a été entraîné à partir de la même base, puis fusionné avec le modèle RL par distillation on-policy multi-enseignants. Reflection indique qu’elle publiera des évaluations de sécurité dans le rapport technique et rendra open source ses évaluations internes de sécurité.

Effort de raisonnement et efficacité en tokens

Beam a été entraîné avec une pénalité de longueur qui récompense les bonnes réponses et décourage les tokens inutiles. Dans l’API, vous choisissez un niveau d’effort de raisonnement : les réglages plus faibles répondent plus vite avec moins de tokens, tandis que les réglages plus élevés prennent davantage le temps de réfléchir aux problèmes difficiles.

De quelle quantité de mémoire Beam a-t-il besoin ?

Reflection n’a pas encore publié la configuration matérielle requise. Voici nos estimations approximatives pour les poids seuls (paramètres × octets par paramètre). Les déploiements réels nécessitent de la mémoire supplémentaire pour le cache KV et les activations.

PrécisionPoids seulsMatériel type
BF16 / FP16≈ 1 002 GB8× GPU de 192 GB (environ 1,5 TB) ou un cluster multinœud
FP8≈ 501 GB8× GPU de 80 GB, c’est juste ; 8× 141 GB ou plus, c’est confortable
INT4 / 4-bit≈ 251 GB4× 80 GB GPU au minimum, davantage pour les longs contextes

Estimations, pas des exigences officielles. Nous les remplacerons par les chiffres de Reflection dès la publication de la fiche du modèle.