داخل تدريب Beam: 100 مليون عملية RL على 10,500 وحدة GPU
جعلت Reflection التعلم المعزز محورًا أساسيًا للتوسع، وتقول إن المكاسب لم تصل إلى مرحلة الثبات بعد.
في مرحلة التعلم المعزز لـ Beam، شغّلت Reflection عدد 10,500 وحدة NVIDIA GB300 GPU لمدة أربعة أسابيع، وأنشأت أكثر من 100 مليون عملية rollout بسياقات تصل إلى 256K رمز. واستخدم التدريب والتقييم نحو 1.3 مليار بيئة معزولة عبر ما يقارب مليون بيئة للبرمجة والمهام الوكيلة وSTEM.
تقول الشركة إنها ابتكرت خوارزميات جديدة للحفاظ على استقرار التعلم المعزز غير المتزامن بالكامل، حتى عند التعلم من بيانات أُنشئت قبل أكثر من يوم، أي من إصدارات أوزان تسبق السياسة الحالية بنحو 107 إصدارات.
علّمت عقوبة الطول Beam تجنب الرموز غير الضرورية. وتفيد Reflection أيضًا بانتقال المهارات: إذ حسّن التدريب على مهام البرمجة والطرفية أداء التصفح، وتعلّم النموذج من تلقاء نفسه الاستعلام من نماذج أخرى وخدمات OCR عند إتاحة الوصول إلى الويب.
للمقارنة، تقول Reflection إن Inkling تدرّب على 30 مليون مسار تشغيل. وكانت النتائج لا تزال تتحسن عند انتهاء التشغيل.
الخلاصة
ترتبط كفاءة Beam بحجم التعلم المعزز بقدر ارتباطها بحجم النموذج.