Zum Inhalt springen
reflectionbeam

Ein Blick ins Training von Beam: 100 Millionen RL-Rollouts auf 10,500 GPUs

Reflection machte Reinforcement Learning zu einem wichtigen Skalierungsfaktor und sagt, dass die Leistungsgewinne noch nicht abgeflacht waren.

Für Beams Reinforcement-Learning-Phase betrieb Reflection 10,500 NVIDIA GB300 GPUs vier Wochen lang und erzeugte dabei mehr als 100 Millionen Rollouts mit Kontexten von bis zu 256K Tokens. Für Training und Bewertung wurden etwa 1.3 Milliarden Sandboxes in fast einer Million Umgebungen für Coding, agentenbasierte Aufgaben und MINT eingesetzt.

Das Unternehmen sagt, es habe neue Algorithmen entwickelt, um vollständig asynchrones RL stabil zu halten – selbst beim Lernen aus Daten, die mehr als einen Tag zuvor und etwa 107 Gewichtsversionen hinter der aktuellen Richtlinie erzeugt wurden.

Eine Längenstrafe brachte Beam bei, unnötige Tokens zu vermeiden. Reflection berichtet außerdem von einem Transfer der Fähigkeiten: Training mit Programmier- und Terminalaufgaben verbesserte das Surfen im Web, und das Modell lernte selbstständig, andere Modelle und OCR-Dienste abzufragen, wenn es Webzugriff erhielt.

Zum Vergleich: Reflection sagt, dass Inkling mit 30 Millionen Rollouts trainiert wurde. Die Werte stiegen noch, als der Lauf endete.

Fazit

Bei Beams Effizienz geht es ebenso sehr um den Umfang des RL-Trainings wie um die Modellgröße.

Alle Neuigkeiten