본문으로 건너뛰기
reflectionbeam

맞대결

Beam vs GLM 5.2

8:5

Beam은 공통 벤치마크 13개 중 8개에서 승리

결론

Reflection이 대표 주장에 내세운 비교 대상이며, Beam은 충분히 경쟁력을 보여 줍니다. 공통 벤치마크 13개 중 8개에서 앞서며, 여기에는 SWE-Bench Pro v1, MCP Atlas, AutomationBench, IFBench가 포함됩니다. 반면 GLM 5.2는 어려운 추론 과제(AIME, HLE, GPQA, CritPt)와 Terminal-Bench에서 근소하게 앞섭니다. Reflection에 따르면 Beam은 추론 연산량을 3~4배 적게 사용하면서 비슷한 추론 점수를 냅니다.

벤치마크별 비교

벤치마크BeamGLM 5.2차이
DeepSWE v1.144.444.0+0.4
SWE-Bench Pro v165.562.1+3.4
Terminal-Bench v2.180.181.0-0.9
AIME 202697.899.2-1.4
Humanity's Last Exam (no tools)36.240.5-4.3
CritPt (AA)16.320.9-4.6
GPQA Diamond90.591.2-0.7
AutomationBench (public)37.026.2+10.8
MCP Atlas78.777.8+0.9
τ³ banking38.037.1+0.9
AA-LCR (long context)79.378.3+1.0
LongBench v265.564.0+1.5
IFBench79.773.3+6.4

모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. GLM 5.2의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.

두 모델

BeamGLM 5.2
개발사Reflection AIZ.ai (Zhipu AI)
기반 국가미국중국
매개변수(전체 / 활성)501B / 23B753B / 40B
가중치Apache 2.0, 2026년 10월 후반 공개 예정MIT
출시일2026년 10월 5일2026년 6월 16일
이용 방법대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개Hugging Face, Z.ai API, OpenRouter

기타 비교