Bên trong quá trình huấn luyện Beam: 100 triệu lượt rollout RL trên 10,500 GPU
Reflection xem học tăng cường là một trục mở rộng quy mô chính và cho biết mức cải thiện vẫn chưa chững lại.
Trong giai đoạn học tăng cường của Beam, Reflection đã chạy 10,500 GPU NVIDIA GB300 trong bốn tuần, tạo ra hơn 100 triệu lượt rollout với ngữ cảnh dài đến 256K token. Quá trình huấn luyện và chấm điểm sử dụng khoảng 1.3 tỷ môi trường sandbox trên gần một triệu môi trường lập trình, agent và STEM.
Công ty cho biết họ đã xây dựng các thuật toán mới để duy trì tính ổn định của học tăng cường hoàn toàn bất đồng bộ, ngay cả khi học từ dữ liệu được tạo ra hơn một ngày trước, tức chậm hơn chính sách hiện tại khoảng 107 phiên bản trọng số.
Một hình phạt độ dài giúp Beam tránh tạo ra các token không cần thiết. Reflection cũng cho biết các kỹ năng có thể chuyển giao: huấn luyện bằng tác vụ lập trình và terminal giúp cải thiện khả năng duyệt web, còn khi được cấp quyền truy cập web, mô hình tự học cách truy vấn các mô hình khác và dịch vụ OCR.
Để so sánh, Reflection cho biết Inkling được huấn luyện trên 30 triệu lượt chạy. Điểm số vẫn tăng khi lượt chạy kết thúc.
Điểm chính
Câu chuyện về hiệu quả của Beam cũng nói về quy mô RL nhiều như nói về kích thước mô hình.