Pular para o conteúdo
reflectionbeam

Confronto direto

Beam vs GLM 5.2

8:5

Beam vence em 8 dos 13 benchmarks em comum

Veredito

Este é o confronto escolhido pela Reflection para sua principal afirmação, e Beam se sai bem: vence 8 dos 13 benchmarks em comum, incluindo SWE-Bench Pro v1, MCP Atlas, AutomationBench e IFBench, enquanto GLM 5.2 está à frente em raciocínio difícil (AIME, HLE, GPQA, CritPt) e por uma pequena margem em Terminal-Bench. A Reflection afirma que Beam alcança pontuações de raciocínio comparáveis usando de três a quatro vezes menos computação de inferência.

Benchmark por benchmark

BenchmarkBeamGLM 5.2Diferença
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Todas as pontuações vêm do anúncio da Reflection (revisão de 8 de outubro de 2026). As pontuações de GLM 5.2 são as citadas pela Reflection, com base em Artificial Analysis e DataCurve.

Os dois modelos

BeamGLM 5.2
DesenvolvedorReflection AIZ.ai (Zhipu AI)
Sediado emEstados UnidosChina
Parâmetros (total / ativos)501B / 23B753B / 40B
PesosApache 2.0, prometida para mais tarde em outubro de 2026MIT
Lançado5 de outubro de 202616 de junho de 2026
Como acessarAPI beta com lista de espera; pesos a caminhoHugging Face, Z.ai API, OpenRouter

Outras comparações