Passer au contenu
reflectionbeam

Face à face

Beam vs GLM 5.3

0:12

Beam remporte 0 des 12 benchmarks communs

Verdict

GLM 5.3 est clairement plus performant sur le papier. Il est en tête sur les 12 benchmarks communs, avec de larges écarts sur DeepSWE, SWE Atlas et AutomationBench, et moins d’un point d’avance sur AA-LCR. Les deux modèles GLM sont des MoE de 753 milliards de paramètres, dont environ 40 milliards actifs par token. L’argument de Beam face à GLM 5.3 repose donc sur sa taille active inférieure et son coût par token, pas sur ses scores.

Benchmark par benchmark

BenchmarkBeamGLM 5.3Écart
DeepSWE v1.144,461,0-16,6
SWE-Bench Pro v2-Hard77,284,3-7,1
Terminal-Bench v2.180,188,2-8,1
SWE Atlas Codebase QnA34,661,0-26,4
Humanity's Last Exam (no tools)36,242,3-6,1
SciCode49,759,0-9,3
CritPt (AA)16,319,1-2,8
GPQA Diamond90,591,7-1,2
AutomationBench (public)37,048,2-11,2
MCP Atlas78,784,2-5,5
AA-LCR (long context)79,379,7-0,4
AA Omniscience index (public split)13,022,6-9,6

Tous les scores proviennent de l’annonce de Reflection (révision du 8 octobre 2026). Les scores de GLM 5.3 sont ceux cités par Reflection, d’après Artificial Analysis et DataCurve.

Les deux modèles

BeamGLM 5.3
DéveloppeurReflection AIZ.ai (Zhipu AI)
Basé àÉtats-UnisChine
Paramètres (total / actifs)501B / 23B753B / 40B
PoidsApache 2.0, promis pour plus tard en octobre 2026GLM-5.3 License (MIT-like, review above $10B revenue)
Date de sortie5 octobre 202627 août 2026
Moyens d’accèsAPI bêta sur liste d’attente ; poids à venirHugging Face, Z.ai API, OpenRouter

Autres comparaisons