Ga naar de inhoud
reflectionbeam

Binnen de training van Beam: 100 miljoen RL-rollouts op 10,500 GPU's

Reflection maakte reinforcement learning tot een belangrijke schaalfactor en zegt dat de prestaties nog niet waren afgevlakt.

Voor de reinforcement-learningfase van Beam gebruikte Reflection 10,500 NVIDIA GB300 GPU's gedurende vier weken. Daarbij werden meer dan 100 miljoen rollouts gegenereerd met contexten tot 256K tokens. Bij de training en beoordeling werden ongeveer 1,3 miljard sandboxes gebruikt in bijna een miljoen programmeer-, agent- en STEM-omgevingen.

Het bedrijf zegt nieuwe algoritmen te hebben ontwikkeld om volledig asynchrone RL stabiel te houden, zelfs wanneer er wordt geleerd van gegevens die meer dan een dag eerder zijn gegenereerd, ongeveer 107 versies van de gewichten achter het huidige beleid.

Een lengtepenalty leerde Beam onnodige tokens te vermijden. Reflection meldt ook dat vaardigheden werden overgedragen: training op programmeer- en terminaltaken verbeterde het browsen, en het model leerde zelfstandig andere modellen en OCR-diensten te raadplegen wanneer het webtoegang kreeg.

Ter vergelijking: Reflection zegt dat Inkling is getraind op 30 miljoen rollouts. De scores liepen nog op toen de run eindigde.

Conclusie

Het efficiëntieverhaal van Beam draait net zo goed om de schaal van RL als om de modelgrootte.

Al het nieuws