맞대결
Beam vs Qwen 3.8 Max
0:13
Beam은 공통 벤치마크 13개 중 0개에서 승리
결론
Qwen 3.8 Max는 공통 벤치마크 13개 모두에서 앞서지만, 몇몇 차이는 작습니다(GPQA 92.6 대 90.5, AA-LCR 80.3 대 79.3, LongBench 66.3 대 65.5). Qwen 3.8 Max는 2조 4000억 매개변수 모델로, 토큰당 활성 매개변수는 950억입니다. 이는 Beam의 활성 매개변수보다 약 4배 많은 규모이며, Reflection이 지적하는 연산량 격차입니다.
벤치마크별 비교
| 벤치마크 | Beam | Qwen 3.8 Max | 차이 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 51.0 | -6.6 | |
| SWE-Bench Pro v1 | 65.5 | 67.7 | -2.2 | |
| Terminal-Bench v2.1 | 80.1 | 86.6 | -6.5 | |
| Humanity's Last Exam (no tools) | 36.2 | 43.6 | -7.4 | |
| SciCode | 49.7 | 52.1 | -2.4 | |
| CritPt (AA) | 16.3 | 20.0 | -3.7 | |
| GPQA Diamond | 90.5 | 92.6 | -2.1 | |
| AutomationBench (public) | 37.0 | 39.8 | -2.8 | |
| MCP Atlas | 78.7 | 84.5 | -5.8 | |
| τ³ banking | 38.0 | 55.2 | -17.2 | |
| AA-LCR (long context) | 79.3 | 80.3 | -1.0 | |
| LongBench v2 | 65.5 | 66.3 | -0.8 | |
| IFBench | 79.7 | 82.8 | -3.1 |
모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. Qwen 3.8 Max의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.
두 모델
| Beam | Qwen 3.8 Max | |
|---|---|---|
| 개발사 | Reflection AI | Alibaba (Qwen) |
| 기반 국가 | 미국 | 중국 |
| 매개변수(전체 / 활성) | 501B / 23B | 2.4T / 95B |
| 가중치 | Apache 2.0, 2026년 10월 후반 공개 예정 | Qwen3.8-Max License (custom) |
| 출시일 | 2026년 10월 5일 | 2026년 8월 3일 |
| 이용 방법 | 대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개 | Hugging Face, Alibaba Cloud Model Studio, OpenRouter |
기타 비교
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–513개의 공통 벤치마크
Moonshot AI
Beam vs Kimi K3
Beam 1–1314개의 공통 벤치마크
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–79개의 공통 벤치마크
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–1212개의 공통 벤치마크
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–115개의 공통 벤치마크
Thinking Machines Lab
Beam vs Inkling
Beam 13–215개의 공통 벤치마크