Por dentro do treinamento de Beam: 100 milhões de execuções de RL em 10,500 GPUs
A Reflection fez do aprendizado por reforço um dos principais eixos de escalabilidade e afirma que os ganhos ainda não haviam atingido um platô.
Na etapa de aprendizado por reforço de Beam, a Reflection usou 10,500 GPUs NVIDIA GB300 durante quatro semanas, gerando mais de 100 milhões de execuções com contextos de até 256K tokens. O treinamento e a avaliação usaram cerca de 1,3 bilhão de sandboxes em quase um milhão de ambientes de programação, de agentes e STEM.
A empresa afirma ter desenvolvido novos algoritmos para manter estável o aprendizado por reforço totalmente assíncrono, mesmo quando aprende com dados gerados mais de um dia antes, a cerca de 107 versões de pesos da política atual.
Uma penalidade por comprimento ensinou Beam a evitar tokens desnecessários. A Reflection também relata que as habilidades foram transferidas: o treinamento em tarefas de programação e terminal melhorou a navegação na web, e o modelo aprendeu por conta própria a consultar outros modelos e serviços de OCR quando recebeu acesso à web.
Para comparação, Reflection diz que Inkling foi treinado com 30 milhões de rollouts. As pontuações ainda estavam subindo quando a execução terminou.
Destaque
A história de eficiência do Beam tem tanto a ver com a escala do RL quanto com o tamanho do modelo.