跳至内容
reflectionbeam

正面对比

Beam vs GLM 5.2

8:5

Beam 在 13 项共同基准中赢得 8 项

结论

这是 Reflection 为其核心主张选择的对决,而 Beam 经受住了考验:在 13 项双方都参与的基准测试中,Beam 赢下 8 项,包括 SWE-Bench Pro v1、MCP Atlas、AutomationBench 和 IFBench;GLM 5.2 则在高难度推理测试(AIME、HLE、GPQA、CritPt)中领先,在 Terminal-Bench 上也略胜一筹。Reflection 表示,Beam 只需三分之一到四分之一的推理计算量,就能达到相当的推理分数。

逐项基准对比

基准BeamGLM 5.2差异
DeepSWE v1.144.444.0+0.4
SWE-Bench Pro v165.562.1+3.4
Terminal-Bench v2.180.181.0-0.9
AIME 202697.899.2-1.4
Humanity's Last Exam (no tools)36.240.5-4.3
CritPt (AA)16.320.9-4.6
GPQA Diamond90.591.2-0.7
AutomationBench (public)37.026.2+10.8
MCP Atlas78.777.8+0.9
τ³ banking38.037.1+0.9
AA-LCR (long context)79.378.3+1.0
LongBench v265.564.0+1.5
IFBench79.773.3+6.4

所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。GLM 5.2 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。

两款模型

BeamGLM 5.2
开发者Reflection AIZ.ai (Zhipu AI)
总部所在地美国中国
参数量(总计 / 激活)501B / 23B753B / 40B
权重Apache 2.0,承诺于 2026 年 10 月晚些时候推出MIT
发布日期2026年10月5日2026年6月16日
获取方式API beta 版需排队申请;模型权重即将推出Hugging Face, Z.ai API, OpenRouter

其他对比