본문으로 건너뛰기
reflectionbeam

맞대결

Beam vs Qwen 3.8 Max

0:13

Beam은 공통 벤치마크 13개 중 0개에서 승리

결론

Qwen 3.8 Max는 공통 벤치마크 13개 모두에서 앞서지만, 몇몇 차이는 작습니다(GPQA 92.6 대 90.5, AA-LCR 80.3 대 79.3, LongBench 66.3 대 65.5). Qwen 3.8 Max는 2조 4000억 매개변수 모델로, 토큰당 활성 매개변수는 950억입니다. 이는 Beam의 활성 매개변수보다 약 4배 많은 규모이며, Reflection이 지적하는 연산량 격차입니다.

벤치마크별 비교

벤치마크BeamQwen 3.8 Max차이
DeepSWE v1.144.451.0-6.6
SWE-Bench Pro v165.567.7-2.2
Terminal-Bench v2.180.186.6-6.5
Humanity's Last Exam (no tools)36.243.6-7.4
SciCode49.752.1-2.4
CritPt (AA)16.320.0-3.7
GPQA Diamond90.592.6-2.1
AutomationBench (public)37.039.8-2.8
MCP Atlas78.784.5-5.8
τ³ banking38.055.2-17.2
AA-LCR (long context)79.380.3-1.0
LongBench v265.566.3-0.8
IFBench79.782.8-3.1

모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. Qwen 3.8 Max의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.

두 모델

BeamQwen 3.8 Max
개발사Reflection AIAlibaba (Qwen)
기반 국가미국중국
매개변수(전체 / 활성)501B / 23B2.4T / 95B
가중치Apache 2.0, 2026년 10월 후반 공개 예정Qwen3.8-Max License (custom)
출시일2026년 10월 5일2026년 8월 3일
이용 방법대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개Hugging Face, Alibaba Cloud Model Studio, OpenRouter

기타 비교