Trening Beam od kuchni: 100 milionów rolloutów RL na 10,500 GPU
Reflection uczyniło uczenie przez wzmacnianie jednym z głównych wymiarów skalowania i twierdzi, że wzrosty nie uległy jeszcze wypłaszczeniu.
Na potrzeby fazy uczenia przez wzmacnianie Beam Reflection użyło 10,500 procesorów graficznych NVIDIA GB300 przez cztery tygodnie, generując ponad 100 milionów rolloutów z kontekstem do 256K tokenów. Do treningu i oceny wykorzystano około 1.3 miliarda piaskownic obejmujących niemal milion środowisk związanych z programowaniem, zadaniami agentowymi i STEM.
Firma twierdzi, że opracowała nowe algorytmy, które zapewniają stabilność w pełni asynchronicznego uczenia przez wzmacnianie, nawet gdy model uczy się na danych wygenerowanych ponad dobę wcześniej, przez wersję wag oddaloną o około 107 aktualizacji od bieżącej polityki.
Kara za długość nauczyła Beam unikać niepotrzebnych tokenów. Reflection informuje też o przenoszeniu umiejętności: trening na zadaniach programistycznych i terminalowych poprawił przeglądanie sieci, a model sam nauczył się korzystać z innych modeli i usług OCR, gdy uzyskał dostęp do internetu.
Dla porównania Reflection twierdzi, że Inkling został wytrenowany na 30 milionach rolloutów. Wyniki nadal rosły, gdy zakończył się trening.
Najważniejsze informacje
Historia wydajności Beam dotyczy w równym stopniu skali RL, co rozmiaru modelu.