Pular para o conteúdo
reflectionbeam

Confronto direto

Beam vs GLM 5.3

0:12

Beam vence em 0 dos 12 benchmarks em comum

Veredito

GLM 5.3 é claramente mais forte no papel. Lidera nos 12 benchmarks em comum, com ampla vantagem em DeepSWE, SWE Atlas e AutomationBench, e por menos de um ponto em AA-LCR. Os dois modelos GLM são MoEs de 753 bilhões de parâmetros, com cerca de 40 bilhões ativos por token, então o argumento de Beam contra GLM 5.3 se baseia no menor tamanho ativo e no custo por token, não nas pontuações.

Benchmark por benchmark

BenchmarkBeamGLM 5.3Diferença
DeepSWE v1.144,461,0-16,6
SWE-Bench Pro v2-Hard77,284,3-7,1
Terminal-Bench v2.180,188,2-8,1
SWE Atlas Codebase QnA34,661,0-26,4
Humanity's Last Exam (no tools)36,242,3-6,1
SciCode49,759,0-9,3
CritPt (AA)16,319,1-2,8
GPQA Diamond90,591,7-1,2
AutomationBench (public)37,048,2-11,2
MCP Atlas78,784,2-5,5
AA-LCR (long context)79,379,7-0,4
AA Omniscience index (public split)13,022,6-9,6

Todas as pontuações vêm do anúncio da Reflection (revisão de 8 de outubro de 2026). As pontuações de GLM 5.3 são as citadas pela Reflection, com base em Artificial Analysis e DataCurve.

Os dois modelos

BeamGLM 5.3
DesenvolvedorReflection AIZ.ai (Zhipu AI)
Sediado emEstados UnidosChina
Parâmetros (total / ativos)501B / 23B753B / 40B
PesosApache 2.0, prometida para mais tarde em outubro de 2026GLM-5.3 License (MIT-like, review above $10B revenue)
Lançado5 de outubro de 202627 de agosto de 2026
Como acessarAPI beta com lista de espera; pesos a caminhoHugging Face, Z.ai API, OpenRouter

Outras comparações