Ga naar de inhoud
reflectionbeam

Directe vergelijking

Beam vs GLM 5.2

8:5

Beam wint 8 van de 13 gedeelde benchmarks

Conclusie

Dit is de vergelijking die Reflection koos voor zijn hoofdclaim, en Beam houdt goed stand: het wint 8 van de 13 gedeelde benchmarks, waaronder SWE-Bench Pro v1, MCP Atlas, AutomationBench en IFBench. GLM 5.2 scoort hoger op moeilijk redeneerwerk (AIME, HLE, GPQA, CritPt) en nipt op Terminal-Bench. Reflection zegt dat Beam vergelijkbare scores voor redeneerwerk haalt met drie tot vier keer minder rekenkracht voor inferentie.

Benchmark voor benchmark

BenchmarkBeamGLM 5.2Verschil
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Alle scores komen uit de aankondiging van Reflection (herzien op 8 oktober 2026). De scores voor GLM 5.2 zijn zoals Reflection ze citeert van Artificial Analysis en DataCurve.

De twee modellen

BeamGLM 5.2
OntwikkelaarReflection AIZ.ai (Zhipu AI)
Gevestigd inVerenigde StatenChina
Parameters (totaal / actief)501B / 23B753B / 40B
GewichtenApache 2.0, beloofd voor later in oktober 2026MIT
Uitgebracht5 oktober 202616 juni 2026
ToegangAPI in bèta met wachtlijst; gewichten volgenHugging Face, Z.ai API, OpenRouter

Andere vergelijkingen