본문으로 건너뛰기
reflectionbeam

맞대결

Beam vs DeepSeek V4.1 Flash

2:7

Beam은 공통 벤치마크 9개 중 2개에서 승리

결론

DeepSeek V4.1 Flash는 공통 벤치마크 9개 중 7개에서 앞섭니다. DeepSWE와 AutomationBench에서 크게 앞서고, Terminal-Bench에서는 10점 차이를 보입니다. Beam은 CritPt에서 앞서며, 오답을 확신에 차서 내놓을 경우 감점하는 AA Omniscience index에서도 더 높은 점수를 받습니다. 여기서는 효율성도 Beam에 유리하지 않습니다. DeepSeek V4.1 Flash는 생성 토큰당 매개변수를 160억 개만 활성화해 Beam의 230억 개보다 적고, 가중치도 이미 MIT 라이선스로 공개되어 있습니다.

벤치마크별 비교

벤치마크BeamDeepSeek V4.1 Flash차이
DeepSWE v1.144.474.2-29.8
Terminal-Bench v2.180.190.6-10.5
Humanity's Last Exam (no tools)36.239.1-2.9
SciCode49.752.0-2.3
CritPt (AA)16.314.3+2.0
GPQA Diamond90.590.9-0.4
AutomationBench (public)37.054.8-17.8
AA-LCR (long context)79.384.0-4.7
AA Omniscience index (public split)13.06.6+6.4

모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. DeepSeek V4.1 Flash의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.

두 모델

BeamDeepSeek V4.1 Flash
개발사Reflection AIDeepSeek
기반 국가미국중국
매개변수(전체 / 활성)501B / 23B552B / 16B
가중치Apache 2.0, 2026년 10월 후반 공개 예정MIT
출시일2026년 10월 5일2026년 9월 10일
이용 방법대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개Hugging Face, DeepSeek API, OpenRouter

기타 비교