Passer au contenu
reflectionbeam

Dans les coulisses de l’entraînement de Beam : 100 millions de trajectoires RL sur 10,500 GPU

Reflection a fait de l’apprentissage par renforcement un axe majeur de mise à l’échelle et affirme que les gains n’avaient pas encore atteint de plateau.

Pour la phase d’apprentissage par renforcement de Beam, Reflection a utilisé 10,500 GPU NVIDIA GB300 pendant quatre semaines, générant plus de 100 millions de trajectoires avec des contextes allant jusqu’à 256K tokens. L’entraînement et l’évaluation ont mobilisé environ 1,3 milliard d’environnements sandbox répartis sur près d’un million d’environnements de programmation, d’agents et de STEM.

L’entreprise affirme avoir conçu de nouveaux algorithmes pour stabiliser l’apprentissage par renforcement entièrement asynchrone, même lorsqu’il s’appuie sur des données générées plus d’un jour auparavant, soit environ 107 versions de poids en retard sur la politique actuelle.

Une pénalité liée à la longueur a appris à Beam à éviter les tokens inutiles. Reflection indique également que les compétences acquises se sont transférées : l’entraînement sur des tâches de codage et de terminal a amélioré la navigation web, et le modèle a appris de lui-même à interroger d’autres modèles et des services OCR lorsqu’il disposait d’un accès au Web.

À titre de comparaison, Reflection indique qu’Inkling a été entraîné sur 30 millions de trajectoires. Les scores continuaient de progresser à la fin de l’entraînement.

À retenir

L’efficacité de Beam tient autant à l’ampleur du RL qu’à la taille du modèle.

Toutes les actualités