Lewati ke konten
reflectionbeam

Di balik pelatihan Beam: 100 juta rollout RL pada 10.500 GPU

Reflection menjadikan reinforcement learning sebagai sumbu utama penskalaan dan menyatakan bahwa peningkatan belum mencapai titik jenuh.

Untuk fase reinforcement learning Beam, Reflection menjalankan 10.500 GPU NVIDIA GB300 selama empat minggu, menghasilkan lebih dari 100 juta rollout dengan konteks hingga 256K token. Pelatihan dan penilaian menggunakan sekitar 1.3 miliar sandbox di hampir satu juta lingkungan pemrograman, agen, dan STEM.

Perusahaan menyatakan telah membangun algoritme baru agar RL asinkron penuh tetap stabil, bahkan saat belajar dari data yang dihasilkan lebih dari sehari sebelumnya, sekitar 107 versi bobot di belakang kebijakan saat ini.

Penalti panjang mengajari Beam untuk menghindari token yang tidak perlu. Reflection juga melaporkan bahwa keterampilan dapat dialihkan: pelatihan pada tugas coding dan terminal meningkatkan kemampuan penelusuran web, dan model belajar sendiri untuk meminta bantuan model lain serta layanan OCR saat diberi akses web.

Sebagai perbandingan, Reflection mengatakan bahwa Inkling dilatih dengan 30 juta rollout. Skornya masih terus meningkat saat proses pelatihan berakhir.

Inti

Efisiensi Beam sama besarnya bergantung pada skala RL seperti pada ukuran model.

Semua berita