เบื้องหลังการฝึก Beam: การทำ RL 100 ล้านรอบบน GPU 10,500 ตัว
Reflection กำหนดให้การเรียนรู้เสริมแรงเป็นปัจจัยหลักในการขยายขนาด และระบุว่าผลลัพธ์ยังไม่ถึงจุดอิ่มตัว
ในขั้นตอนการเรียนรู้เสริมแรงของ Beam Reflection ใช้ GPU NVIDIA GB300 จำนวน 10,500 ตัวเป็นเวลาสี่สัปดาห์ สร้าง rollout มากกว่า 100 ล้านครั้ง โดยมีบริบทยาวสูงสุด 256K โทเค็น การฝึกและการให้คะแนนใช้ sandbox ราว 1.3 พันล้านชุด ครอบคลุมสภาพแวดล้อมด้านการเขียนโค้ด เอเจนต์ และ STEM เกือบหนึ่งล้านรายการ
บริษัทระบุว่าได้พัฒนาอัลกอริทึมใหม่เพื่อให้ RL แบบอะซิงโครนัสเต็มรูปแบบยังคงเสถียร แม้เรียนรู้จากข้อมูลที่สร้างขึ้นเมื่อกว่าหนึ่งวันก่อน ซึ่งอยู่หลังนโยบายปัจจุบันประมาณ 107 เวอร์ชันของน้ำหนัก
การลงโทษตามความยาวช่วยให้ Beam เรียนรู้ที่จะหลีกเลี่ยงการใช้โทเค็นเกินจำเป็น Reflection ยังรายงานว่าทักษะถ่ายโอนไปยังงานอื่นได้ด้วย: การฝึกด้านการเขียนโค้ดและงานเทอร์มินัลช่วยพัฒนาความสามารถในการค้นดูเว็บ และเมื่อได้รับสิทธิ์เข้าถึงเว็บ โมเดลก็เรียนรู้ได้เองว่าจะเรียกใช้โมเดลอื่นและบริการ OCR เมื่อใด
เพื่อเปรียบเทียบ Reflection ระบุว่า Inkling ฝึกด้วยโรลเอาต์ 30 ล้านครั้ง คะแนนยังคงเพิ่มขึ้นเมื่อการรันทดสอบสิ้นสุดลง
ประเด็นสำคัญ
เรื่องประสิทธิภาพของ Beam เกี่ยวข้องกับการขยายขนาด RL มากพอๆ กับขนาดของโมเดล