コンテンツへスキップ
reflectionbeam

Beamの学習の内側:10,500基のGPUで1億回のRLロールアウト

Reflectionは強化学習を主要なスケーリング軸と位置づけ、性能向上は頭打ちになっていないと述べています。

Beamの強化学習フェーズでは、ReflectionはNVIDIA GB300 GPUを10,500基、4週間稼働させ、コンテキスト長最大256Kトークンで1億回を超えるロールアウトを生成しました。学習と評価には、コーディング、エージェント、STEMの約100万の環境にまたがる約13億のサンドボックスを使用しました。

同社によると、1日以上前に生成されたデータ、つまり現在のポリシーから約107世代前の重みで生成されたデータから学習する場合でも、完全非同期の強化学習を安定して続けられる新しいアルゴリズムを開発しました。

長さへのペナルティを設けることで、Beamは不要なトークンを避けるようになりました。またReflectionは、スキルが転移したとも報告しています。コーディングやターミナルタスクでの学習はブラウジングの性能も向上させ、ウェブアクセスを与えると、他のモデルやOCRサービスに自ら問い合わせる方法も学習しました。

比較のために言うと、Reflectionによれば、Inklingは3,000万回のロールアウトで訓練されました。実行が終了した時点でもスコアは上昇し続けていました。

要点

Beamの効率性を語るうえでは、モデルの規模と同じくらいRLのスケールが重要です。

すべてのニュース