正面对比
Beam vs GLM 5.2
8:5
Beam 在 13 项共同基准中赢得 8 项
结论
这是 Reflection 为其核心主张选择的对决,而 Beam 经受住了考验:在 13 项双方都参与的基准测试中,Beam 赢下 8 项,包括 SWE-Bench Pro v1、MCP Atlas、AutomationBench 和 IFBench;GLM 5.2 则在高难度推理测试(AIME、HLE、GPQA、CritPt)中领先,在 Terminal-Bench 上也略胜一筹。Reflection 表示,Beam 只需三分之一到四分之一的推理计算量,就能达到相当的推理分数。
逐项基准对比
| 基准 | Beam | GLM 5.2 | 差异 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 44.0 | +0.4 | |
| SWE-Bench Pro v1 | 65.5 | 62.1 | +3.4 | |
| Terminal-Bench v2.1 | 80.1 | 81.0 | -0.9 | |
| AIME 2026 | 97.8 | 99.2 | -1.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 40.5 | -4.3 | |
| CritPt (AA) | 16.3 | 20.9 | -4.6 | |
| GPQA Diamond | 90.5 | 91.2 | -0.7 | |
| AutomationBench (public) | 37.0 | 26.2 | +10.8 | |
| MCP Atlas | 78.7 | 77.8 | +0.9 | |
| τ³ banking | 38.0 | 37.1 | +0.9 | |
| AA-LCR (long context) | 79.3 | 78.3 | +1.0 | |
| LongBench v2 | 65.5 | 64.0 | +1.5 | |
| IFBench | 79.7 | 73.3 | +6.4 |
所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。GLM 5.2 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。
两款模型
| Beam | GLM 5.2 | |
|---|---|---|
| 开发者 | Reflection AI | Z.ai (Zhipu AI) |
| 总部所在地 | 美国 | 中国 |
| 参数量(总计 / 激活) | 501B / 23B | 753B / 40B |
| 权重 | Apache 2.0,承诺于 2026 年 10 月晚些时候推出 | MIT |
| 发布日期 | 2026年10月5日 | 2026年6月16日 |
| 获取方式 | API beta 版需排队申请;模型权重即将推出 | Hugging Face, Z.ai API, OpenRouter |