Lumaktaw sa nilalaman
reflectionbeam

Sa loob ng pagsasanay sa Beam: 100 milyong RL rollout sa 10,500 GPU

Ginawang pangunahing direksiyon ng pagpapalawak ng Reflection ang reinforcement learning, at ayon dito, hindi pa humihinto ang pagbuti ng mga resulta.

Para sa yugto ng reinforcement learning ng Beam, gumamit ang Reflection ng 10,500 NVIDIA GB300 GPU sa loob ng apat na linggo at nakabuo ng mahigit 100 milyong rollout na may mga context na hanggang 256K token. Gumamit sa pagsasanay at pagmamarka ng humigit-kumulang 1.3 bilyong sandbox sa halos isang milyong coding, agentic at STEM na kapaligiran.

Ayon sa kumpanya, gumawa ito ng mga bagong algorithm para mapanatiling matatag ang ganap na asynchronous na RL, kahit natututo ito mula sa datos na nabuo mahigit isang araw na ang nakalipas at humigit-kumulang 107 bersiyon ng weights ang layo sa kasalukuyang policy.

Itinuro ng length penalty sa Beam na iwasan ang mga hindi kailangang token. Iniulat din ng Reflection na naililipat ang mga kasanayan: napahusay ng pagsasanay sa coding at mga terminal na gawain ang pag-browse, at natutuhan ng modelo nang kusa na mag-query ng ibang mga modelo at OCR service kapag binigyan ito ng access sa web.

Para sa paghahambing, sinabi ng Reflection na sinanay ang Inkling gamit ang 30 milyon na rollout. Patuloy pang tumataas ang mga score nang matapos ang run.

Pangunahing punto

Kasinglaki ng modelo ang saklaw ng RL na bahagi ng kuwento ng kahusayan ng Beam.

Lahat ng balita