Saltar al contenido
reflectionbeam

Cara a cara

Beam vs GLM 5.2

8:5

Beam gana 8 de las 13 pruebas comparativas compartidas

Veredicto

Este es el enfrentamiento que Reflection eligió para su afirmación principal, y Beam está a la altura: gana 8 de los 13 benchmarks compartidos, incluidos SWE-Bench Pro v1, MCP Atlas, AutomationBench e IFBench, mientras que GLM 5.2 va por delante en razonamiento complejo (AIME, HLE, GPQA, CritPt) y por un estrecho margen en Terminal-Bench. Reflection afirma que Beam alcanza puntuaciones de razonamiento comparables con entre tres y cuatro veces menos cómputo de inferencia.

Prueba comparativa por prueba comparativa

BenchmarkBeamGLM 5.2Diferencia
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Todas las puntuaciones proceden del anuncio de Reflection (revisión del 8 de octubre de 2026). Las puntuaciones de GLM 5.2 son las citadas por Reflection a partir de Artificial Analysis y DataCurve.

Los dos modelos

BeamGLM 5.2
DesarrolladorReflection AIZ.ai (Zhipu AI)
SedeEstados UnidosChina
Parámetros (totales / activos)501B / 23B753B / 40B
PesosApache 2.0, prometida para más adelante en octubre de 2026MIT
Lanzamiento5 de octubre de 202616 de junio de 2026
Cómo accederAPI beta con lista de espera; pesos próximamenteHugging Face, Z.ai API, OpenRouter

Otras comparaciones