맞대결
Beam vs DeepSeek V4.1 Flash
2:7
Beam은 공통 벤치마크 9개 중 2개에서 승리
결론
DeepSeek V4.1 Flash는 공통 벤치마크 9개 중 7개에서 앞섭니다. DeepSWE와 AutomationBench에서 크게 앞서고, Terminal-Bench에서는 10점 차이를 보입니다. Beam은 CritPt에서 앞서며, 오답을 확신에 차서 내놓을 경우 감점하는 AA Omniscience index에서도 더 높은 점수를 받습니다. 여기서는 효율성도 Beam에 유리하지 않습니다. DeepSeek V4.1 Flash는 생성 토큰당 매개변수를 160억 개만 활성화해 Beam의 230억 개보다 적고, 가중치도 이미 MIT 라이선스로 공개되어 있습니다.
벤치마크별 비교
| 벤치마크 | Beam | DeepSeek V4.1 Flash | 차이 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 74.2 | -29.8 | |
| Terminal-Bench v2.1 | 80.1 | 90.6 | -10.5 | |
| Humanity's Last Exam (no tools) | 36.2 | 39.1 | -2.9 | |
| SciCode | 49.7 | 52.0 | -2.3 | |
| CritPt (AA) | 16.3 | 14.3 | +2.0 | |
| GPQA Diamond | 90.5 | 90.9 | -0.4 | |
| AutomationBench (public) | 37.0 | 54.8 | -17.8 | |
| AA-LCR (long context) | 79.3 | 84.0 | -4.7 | |
| AA Omniscience index (public split) | 13.0 | 6.6 | +6.4 |
모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. DeepSeek V4.1 Flash의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.
두 모델
| Beam | DeepSeek V4.1 Flash | |
|---|---|---|
| 개발사 | Reflection AI | DeepSeek |
| 기반 국가 | 미국 | 중국 |
| 매개변수(전체 / 활성) | 501B / 23B | 552B / 16B |
| 가중치 | Apache 2.0, 2026년 10월 후반 공개 예정 | MIT |
| 출시일 | 2026년 10월 5일 | 2026년 9월 10일 |
| 이용 방법 | 대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개 | Hugging Face, DeepSeek API, OpenRouter |
기타 비교
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–513개의 공통 벤치마크
Moonshot AI
Beam vs Kimi K3
Beam 1–1314개의 공통 벤치마크
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–1313개의 공통 벤치마크
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–1212개의 공통 벤치마크
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–115개의 공통 벤치마크
Thinking Machines Lab
Beam vs Inkling
Beam 13–215개의 공통 벤치마크