Vai al contenuto
reflectionbeam

Dentro l'addestramento di Beam: 100 milioni di rollouts RL su 10,500 GPU

Reflection ha fatto del reinforcement learning uno dei principali assi di scalabilità e afferma che i miglioramenti non hanno ancora raggiunto un plateau.

Per la fase di reinforcement learning di Beam, Reflection ha usato 10,500 GPU NVIDIA GB300 per quattro settimane, generando oltre 100 milioni di rollouts con contesti fino a 256K token. L'addestramento e la valutazione hanno utilizzato circa 1.3 miliardi di ambienti sandbox, distribuiti su quasi un milione di ambienti di programmazione, agentici e STEM.

L'azienda afferma di aver sviluppato nuovi algoritmi per mantenere stabile il reinforcement learning completamente asincrono, anche quando apprende da dati generati più di un giorno prima, con circa 107 versioni dei pesi di ritardo rispetto alla policy corrente.

Una penalità sulla lunghezza ha insegnato a Beam a evitare token superflui. Reflection riferisce inoltre che le competenze si sono trasferite: l'addestramento su attività di programmazione e terminale ha migliorato la navigazione sul web e, con l'accesso al web, il modello ha imparato autonomamente a interrogare altri modelli e servizi OCR.

Per fare un confronto, Reflection afferma che Inkling è stato addestrato su 30 milioni di rollout. I punteggi continuavano a salire quando l'esecuzione è terminata.

In sintesi

La storia dell'efficienza di Beam riguarda tanto la scala dell'apprendimento per rinforzo (RL) quanto le dimensioni del modello.

Tutte le notizie