Przejdź do treści
reflectionbeam

Bezpośrednie porównanie

Beam vs GLM 5.2

8:5

Beam wygrywa w 8 z 13 wspólnych benchmarków

Werdykt

To zestawienie Reflection wybrało do głównego twierdzenia i Beam wypada w nim dobrze: wygrywa 8 z 13 wspólnych benchmarków, w tym SWE-Bench Pro v1, MCP Atlas, AutomationBench i IFBench, podczas gdy GLM 5.2 osiąga lepsze wyniki w trudnym rozumowaniu (AIME, HLE, GPQA, CritPt) i nieznacznie wyprzedza Beam w Terminal-Bench. Reflection twierdzi, że Beam osiąga porównywalne wyniki w rozumowaniu przy wykorzystaniu od trzech do czterech razy mniejszych zasobów obliczeniowych podczas inferencji.

Porównanie benchmark po benchmarku

BenchmarkBeamGLM 5.2Różnica
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Wszystkie wyniki pochodzą z ogłoszenia Reflection (aktualizacja z 8 października 2026). Wyniki dla GLM 5.2 podano za Reflection, na podstawie danych Artificial Analysis i DataCurve.

Oba modele

BeamGLM 5.2
DeweloperReflection AIZ.ai (Zhipu AI)
SiedzibaStany ZjednoczoneChiny
Parametry (łącznie / aktywne)501B / 23B753B / 40B
WagiApache 2.0, obiecana na późniejszą część października 2026MIT
Data premiery5 października 202616 czerwca 2026
Jak uzyskać dostępAPI beta — lista oczekujących; wagi pojawią się późniejHugging Face, Z.ai API, OpenRouter

Pozostałe porównania