Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs GLM 5.3

0:12

Beam gewinnt 0 von 12 gemeinsamen Benchmarks

Fazit

GLM 5.3 ist auf dem Papier eindeutig stärker. Das Modell liegt bei allen 12 gemeinsamen Benchmarks vorne, mit deutlichem Vorsprung bei DeepSWE, SWE Atlas und AutomationBench und mit weniger als einem Punkt Vorsprung bei AA-LCR. Beide GLM-Modelle sind MoE-Modelle mit 753 Milliarden Parametern und etwa 40 Milliarden aktiven Parametern pro Token. Beams Argument gegenüber GLM 5.3 beruht also auf der geringeren Zahl aktiver Parameter und den Kosten pro Token, nicht auf den Ergebnissen.

Benchmark für Benchmark

BenchmarkBeamGLM 5.3Differenz
DeepSWE v1.144,461,0-16,6
SWE-Bench Pro v2-Hard77,284,3-7,1
Terminal-Bench v2.180,188,2-8,1
SWE Atlas Codebase QnA34,661,0-26,4
Humanity's Last Exam (no tools)36,242,3-6,1
SciCode49,759,0-9,3
CritPt (AA)16,319,1-2,8
GPQA Diamond90,591,7-1,2
AutomationBench (public)37,048,2-11,2
MCP Atlas78,784,2-5,5
AA-LCR (long context)79,379,7-0,4
AA Omniscience index (public split)13,022,6-9,6

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für GLM 5.3 sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamGLM 5.3
EntwicklerReflection AIZ.ai (Zhipu AI)
SitzVereinigte StaatenChina
Parameter (gesamt / aktiv)501B / 23B753B / 40B
GewichteApache 2.0, für später im Oktober 2026 angekündigtGLM-5.3 License (MIT-like, review above $10B revenue)
Veröffentlicht5. Oktober 202627. August 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, Z.ai API, OpenRouter

Weitere Vergleiche