Dentro del entrenamiento de Beam: 100 millones de ejecuciones de RL en 10,500 GPU
Reflection convirtió el aprendizaje por refuerzo en un eje principal de escalado y afirma que las mejoras no se habían estancado.
Durante la fase de aprendizaje por refuerzo de Beam, Reflection utilizó 10,500 GPU NVIDIA GB300 durante cuatro semanas y generó más de 100 millones de ejecuciones, con contextos de hasta 256K tokens. El entrenamiento y la evaluación utilizaron alrededor de 1.3 mil millones de entornos aislados en casi un millón de entornos de programación, agentes y STEM.
La empresa afirma que desarrolló nuevos algoritmos para mantener estable el aprendizaje por refuerzo totalmente asíncrono, incluso cuando aprende de datos generados más de un día antes, con unas 107 versiones de pesos de diferencia respecto de la política actual.
Una penalización por longitud enseñó a Beam a evitar tokens innecesarios. Reflection también informa de que las habilidades se transfirieron: el entrenamiento en programación y tareas de terminal mejoró la navegación web, y el modelo aprendió por sí solo a consultar otros modelos y servicios de OCR cuando se le dio acceso a la web.
A modo de comparación, Reflection afirma que Inkling se entrenó con 30 millones de ejecuciones. Las puntuaciones seguían subiendo cuando terminó la ejecución.
Conclusión
La eficiencia de Beam depende tanto de la escala del RL como del tamaño del modelo.