Vai al contenuto
reflectionbeam

Confronto diretto

Beam vs GLM 5.2

8:5

Beam vince 8 dei 13 benchmark in comune

Verdetto

Questo è il confronto scelto da Reflection per la sua affermazione principale, e Beam regge il confronto: vince 8 dei 13 benchmark condivisi, tra cui SWE-Bench Pro v1, MCP Atlas, AutomationBench e IFBench, mentre GLM 5.2 è in vantaggio nel ragionamento complesso (AIME, HLE, GPQA, CritPt) e di poco su Terminal-Bench. Reflection afferma che Beam raggiunge punteggi di ragionamento comparabili usando da tre a quattro volte meno risorse di calcolo per l'inferenza.

Confronto benchmark per benchmark

BenchmarkBeamGLM 5.2Differenza
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Tutti i punteggi provengono dall'annuncio di Reflection (revisione dell'8 ottobre 2026). I punteggi di GLM 5.2 sono quelli citati da Reflection, tratti da Artificial Analysis e DataCurve.

I due modelli

BeamGLM 5.2
SviluppatoreReflection AIZ.ai (Zhipu AI)
Con sede inStati UnitiCina
Parametri (totali / attivi)501B / 23B753B / 40B
PesiApache 2.0, promesso per la fine di ottobre 2026MIT
Data di rilascio5 ottobre 202616 giugno 2026
Come accedereAPI beta con lista d'attesa; i pesi arriverannoHugging Face, Z.ai API, OpenRouter

Altri confronti