Beam 的训练内幕:使用 10,500 块 GPU 完成 1 亿次 RL 轨迹采样
Reflection 将强化学习作为主要的扩展方向,并表示模型性能的提升尚未趋于平台期。
在 Beam 的强化学习阶段,Reflection 使用 10,500 块 NVIDIA GB300 GPU 训练了四周,生成了超过 1 亿次轨迹采样,上下文长度最高达 256K token。训练和评分使用了约 13 亿个沙盒,涵盖近 100 万个编程、智能体和 STEM 环境。
该公司表示,他们开发了新算法,让完全异步的强化学习即使使用一天多以前生成的数据进行学习(这些数据对应的权重版本约比当前策略落后 107 个版本),也能保持稳定。
长度惩罚帮助 Beam 学会避免生成不必要的 token。Reflection 还报告称,模型学到的技能可以迁移:在编程和终端任务上的训练提升了浏览能力;获得网页访问权限后,模型还自行学会了查询其他模型和 OCR 服务。
作为对比,Reflection 表示,Inkling 使用了 3000 万次 rollout 进行训练。训练结束时,得分仍在上升。
要点
Beam 的效率优势,既来自 RL 的规模,也来自模型规模。