본문으로 건너뛰기
reflectionbeam

Beam 학습의 이면: 10,500개 GPU에서 RL 롤아웃 1억 회

Reflection은 강화 학습을 핵심 확장 축으로 삼았으며, 성능 향상이 아직 정체되지 않았다고 밝혔습니다.

Beam의 강화 학습 단계에서 Reflection은 NVIDIA GB300 GPU 10,500개를 4주간 가동해 1억 회가 넘는 롤아웃을 생성했습니다. 컨텍스트 길이는 최대 256K 토큰이었습니다. 학습과 채점에는 코딩, 에이전트, STEM 환경 약 100만 개에서 약 13억 개의 샌드박스가 사용되었습니다.

회사는 현재 정책보다 약 107개 가중치 버전 뒤처진, 하루 이상 전에 생성된 데이터로 학습할 때도 완전 비동기 RL을 안정적으로 유지하기 위해 새로운 알고리즘을 개발했다고 밝혔습니다.

길이 페널티를 적용해 Beam이 불필요한 토큰을 피하도록 학습했습니다. Reflection은 기술 전이도 확인했다고 보고했습니다. 코딩 및 터미널 작업 학습은 웹 탐색 능력을 향상했으며, 웹 접근 권한을 주자 모델은 다른 모델과 OCR 서비스에 스스로 질의하는 방법을 익혔습니다.

비교하자면, Reflection은 Inkling을 3천만 회의 롤아웃으로 학습했다고 밝혔습니다. 실행이 끝날 때까지 점수는 계속 상승하고 있었습니다.

핵심 내용

Beam의 효율성은 모델 크기만큼이나 RL 규모와도 관련이 있습니다.

전체 소식