Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs GLM 5.2

8:5

Beam gewinnt 8 von 13 gemeinsamen Benchmarks

Fazit

Das ist der Vergleich, den Reflection für seine zentrale Aussage gewählt hat, und Beam kann sich behaupten: Das Modell gewinnt 8 der 13 gemeinsamen Benchmarks, darunter SWE-Bench Pro v1, MCP Atlas, AutomationBench und IFBench, während GLM 5.2 bei anspruchsvollem Reasoning (AIME, HLE, GPQA, CritPt) und knapp auch bei Terminal-Bench vorne liegt. Laut Reflection erreicht Beam vergleichbare Reasoning-Werte mit drei- bis viermal weniger Inferenz-Rechenleistung.

Benchmark für Benchmark

BenchmarkBeamGLM 5.2Differenz
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für GLM 5.2 sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamGLM 5.2
EntwicklerReflection AIZ.ai (Zhipu AI)
SitzVereinigte StaatenChina
Parameter (gesamt / aktiv)501B / 23B753B / 40B
GewichteApache 2.0, für später im Oktober 2026 angekündigtMIT
Veröffentlicht5. Oktober 202616. Juni 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, Z.ai API, OpenRouter

Weitere Vergleiche