跳至内容
reflectionbeam

正面对比

Beam vs GLM 5.3

0:12

Beam 在 12 项共同基准中赢得 0 项

结论

从纸面数据来看,GLM 5.3 明显更强。在双方都参与的 12 项基准测试中,它全部领先:在 DeepSWE、SWE Atlas 和 AutomationBench 上优势明显,在 AA-LCR 上则领先不到 1 分。两款 GLM 模型都是拥有 7530 亿参数的 MoE,每个 token 激活约 400 亿参数,因此 Beam 对比 GLM 5.3 的优势在于较小的激活参数规模和较低的单 token 成本,而非分数。

逐项基准对比

基准BeamGLM 5.3差异
DeepSWE v1.144.461.0-16.6
SWE-Bench Pro v2-Hard77.284.3-7.1
Terminal-Bench v2.180.188.2-8.1
SWE Atlas Codebase QnA34.661.0-26.4
Humanity's Last Exam (no tools)36.242.3-6.1
SciCode49.759.0-9.3
CritPt (AA)16.319.1-2.8
GPQA Diamond90.591.7-1.2
AutomationBench (public)37.048.2-11.2
MCP Atlas78.784.2-5.5
AA-LCR (long context)79.379.7-0.4
AA Omniscience index (public split)13.022.6-9.6

所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。GLM 5.3 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。

两款模型

BeamGLM 5.3
开发者Reflection AIZ.ai (Zhipu AI)
总部所在地美国中国
参数量(总计 / 激活)501B / 23B753B / 40B
权重Apache 2.0,承诺于 2026 年 10 月晚些时候推出GLM-5.3 License (MIT-like, review above $10B revenue)
发布日期2026年10月5日2026年8月27日
获取方式API beta 版需排队申请;模型权重即将推出Hugging Face, Z.ai API, OpenRouter

其他对比