İçeriğe geç
reflectionbeam

Beam'in eğitiminin perde arkası: 10.500 GPU'da 100 milyon RL rollout'u

Reflection, takviyeli öğrenmeyi ölçeklendirmenin temel yollarından biri hâline getirdi ve kazanımların henüz plato yapmadığını söylüyor.

Beam'in takviyeli öğrenme aşamasında Reflection, dört hafta boyunca 10.500 NVIDIA GB300 GPU kullandı ve 256K tokene kadar bağlamlarla 100 milyondan fazla rollout üretti. Eğitim ve puanlama için, yaklaşık bir milyon kodlama, ajan tabanlı ve STEM ortamında yaklaşık 1,3 milyar sandbox kullanıldı.

Şirket, mevcut politikadan 107 ağırlık sürümü geride olan ve bir günden daha eski verilerden öğrenirken bile tamamen eşzamansız takviyeli öğrenmeyi kararlı tutmak için yeni algoritmalar geliştirdiğini söylüyor.

Uzunluk cezası, Beam'e gereksiz tokenlardan kaçınmayı öğretti. Reflection ayrıca becerilerin aktarıldığını bildiriyor: kodlama ve terminal görevleri üzerinde eğitim, web'de gezinme performansını artırdı; model, web erişimi verildiğinde diğer modelleri ve OCR hizmetlerini sorgulamayı kendi kendine öğrendi.

Karşılaştırma için Reflection, Inkling'in 30 milyon rollout üzerinde eğitildiğini söylüyor. Çalışma sona erdiğinde skorlar hâlâ yükseliyordu.

Özet

Beam'in verimlilik öyküsü, model boyutu kadar RL ölçeğiyle de ilgili.

Tüm haberler