Vai al contenuto
reflectionbeam

Confronto diretto

Beam vs GLM 5.3

0:12

Beam vince 0 dei 12 benchmark in comune

Verdetto

GLM 5.3 è chiaramente più forte sulla carta. È in testa in tutti i 12 benchmark condivisi, con ampi margini su DeepSWE, SWE Atlas e AutomationBench e con meno di un punto di vantaggio su AA-LCR. Entrambi i modelli GLM sono MoE da 753 miliardi di parametri, con circa 40 miliardi attivi per token, quindi il vantaggio di Beam rispetto a GLM 5.3 sta nelle dimensioni attive più ridotte e nel costo per token, non nei punteggi.

Confronto benchmark per benchmark

BenchmarkBeamGLM 5.3Differenza
DeepSWE v1.144,461,0-16,6
SWE-Bench Pro v2-Hard77,284,3-7,1
Terminal-Bench v2.180,188,2-8,1
SWE Atlas Codebase QnA34,661,0-26,4
Humanity's Last Exam (no tools)36,242,3-6,1
SciCode49,759,0-9,3
CritPt (AA)16,319,1-2,8
GPQA Diamond90,591,7-1,2
AutomationBench (public)37,048,2-11,2
MCP Atlas78,784,2-5,5
AA-LCR (long context)79,379,7-0,4
AA Omniscience index (public split)13,022,6-9,6

Tutti i punteggi provengono dall'annuncio di Reflection (revisione dell'8 ottobre 2026). I punteggi di GLM 5.3 sono quelli citati da Reflection, tratti da Artificial Analysis e DataCurve.

I due modelli

BeamGLM 5.3
SviluppatoreReflection AIZ.ai (Zhipu AI)
Con sede inStati UnitiCina
Parametri (totali / attivi)501B / 23B753B / 40B
PesiApache 2.0, promesso per la fine di ottobre 2026GLM-5.3 License (MIT-like, review above $10B revenue)
Data di rilascio5 ottobre 202627 agosto 2026
Come accedereAPI beta con lista d'attesa; i pesi arriverannoHugging Face, Z.ai API, OpenRouter

Altri confronti