사전 학습
웹, 공개 자료, 라이선스가 있는 데이터 세트에서 가져온 23.8조 개의 토큰으로 학습했으며, 코드, 기술 문서, STEM에 중점을 뒀습니다. 원본 웹 토큰의 약 95%를 필터링했습니다. NVIDIA GB300 NVL72 GPU 6,144개에서 4주가 채 안 되는 기간 동안 학습을 진행했고, 막바지에는 굿풋이 92.3%에 달했습니다.
모델 카드
Beam의 구축 및 학습 방식에 관해 Reflection AI가 공개한 모든 내용입니다. 수치는 공식 발표와 개발자 문서를 바탕으로 했으며, 추정치는 별도로 표시했습니다.
| 개발사 | Reflection AI (New York) |
|---|---|
| 발표 | 2026-10-05 |
| 모델 유형 | 희소 혼합 전문가 언어 모델 |
| 전체 파라미터 수 | 501B |
| 토큰당 활성 파라미터 수 | 23B |
| 레이어 수 | 52 |
| 어텐션 | 로컬 어텐션과 글로벌 어텐션을 교차 적용 |
| 컨텍스트 창(API 베타) | 256K tokens |
| 중간 학습에서 도달한 컨텍스트 길이 | 1M tokens |
| 최대 출력(API) | 128K tokens |
| 학습 데이터 기준일 | 2026-06-30 |
| 모달리티 | 텍스트 입력, 텍스트 출력 |
| 추론 | 항상 사용 가능, 추론 수준 설정 제공 |
| API 기능 | 도구 호출, 구조화된 출력, 스트리밍 |
| 가중치 라이선스 | Apache 2.0 (가중치는 2026년 10월 후반 공개 예정) |
| API 모델 ID | Beam-501B-A23B |
전문가 혼합(Mixture-of-Experts) 모델에서는 각 레이어에 여러 개의 작은 ‘전문가’ 네트워크가 있고, 라우터가 토큰마다 그중 몇 개를 선택합니다. Beam에는 5010억 개의 파라미터가 있지만, 각 토큰은 그중 약 230억 개만 거칩니다.
그 결과 토큰당 연산량은 밀집형 23B 모델에 가까워 Beam의 서빙 비용은 낮아지고, 전체 용량은 크게 유지됩니다. 단점은 메모리입니다. 모델을 서빙하려면 501B 파라미터 전체를 GPU 메모리에 올려야 합니다.
Reflection에 따르면 Beam의 라우팅은 이례적으로 균형이 잘 잡혀 있습니다. 사전 학습이 끝날 무렵 가장 많이 사용된 전문가의 부하는 평균의 1.04배에 불과해 모든 전문가가 활용됩니다.
웹, 공개 자료, 라이선스가 있는 데이터 세트에서 가져온 23.8조 개의 토큰으로 학습했으며, 코드, 기술 문서, STEM에 중점을 뒀습니다. 원본 웹 토큰의 약 95%를 필터링했습니다. NVIDIA GB300 NVL72 GPU 6,144개에서 4주가 채 안 되는 기간 동안 학습을 진행했고, 막바지에는 굿풋이 92.3%에 달했습니다.
강화 학습을 위해 모델을 준비하는 단계로, 추론 과정이 풍부한 긴 문서와 코드 저장소, 장기 계획이 필요한 작업을 학습합니다. 이 단계에서 Beam의 실질적인 컨텍스트 길이는 100만 토큰으로 확장되었습니다.
GB300 GPU 10,500개에서 4주 동안 1억 회가 넘는 롤아웃을 수행했습니다. 거의 100만 개의 코딩, 에이전트, STEM 환경과 약 13억 개의 샌드박스를 활용했습니다. Reflection은 이를 오픈 연구소가 수행한 최대 규모의 RL 학습 중 하나라고 부르며, 학습이 끝날 때도 점수가 계속 오르고 있었다고 밝혔습니다.
동일한 기반 모델로 별도의 안전성 및 정렬 모델을 학습한 뒤, 다중 교사 온폴리시 증류를 통해 RL 모델과 병합했습니다. Reflection은 기술 보고서에서 안전성 평가 결과를 공개하고 내부 안전성 평가를 오픈소스로 공개할 예정이라고 밝혔습니다.
Beam은 정답을 보상하고 불필요한 토큰 사용을 억제하는 길이 페널티를 적용해 학습했습니다. API에서 추론 수준을 선택할 수 있습니다. 낮은 설정은 더 적은 토큰으로 빠르게 답하고, 높은 설정은 어려운 문제를 더 오래 생각합니다.
Reflection은 아직 하드웨어 요구 사항을 공개하지 않았습니다. 아래는 가중치만을 기준으로 한 대략적인 추정치입니다(파라미터 수 × 파라미터당 바이트 수). 실제 배포에는 KV 캐시와 활성값을 위한 메모리도 추가로 필요합니다.
| 정밀도 | 가중치만 | 하드웨어 예시 |
|---|---|---|
| BF16 / FP16 | ≈ 1,002 GB | 192 GB GPU 8개(약 1.5 TB) 또는 여러 노드로 구성된 클러스터 |
| FP8 | ≈ 501 GB | 80 GB GPU 8개는 빠듯하고, 141 GB 이상 GPU 8개면 여유롭습니다. |
| INT4 / 4-bit | ≈ 251 GB | 최소 4× 80 GB GPU, 긴 컨텍스트에는 더 많이 |
공식 요구 사항이 아닌 추정치입니다. 모델 카드가 공개되면 Reflection의 수치로 대체하겠습니다.