正面对比
Beam vs GLM 5.3
0:12
Beam 在 12 项共同基准中赢得 0 项
结论
从纸面数据来看,GLM 5.3 明显更强。在双方都参与的 12 项基准测试中,它全部领先:在 DeepSWE、SWE Atlas 和 AutomationBench 上优势明显,在 AA-LCR 上则领先不到 1 分。两款 GLM 模型都是拥有 7530 亿参数的 MoE,每个 token 激活约 400 亿参数,因此 Beam 对比 GLM 5.3 的优势在于较小的激活参数规模和较低的单 token 成本,而非分数。
逐项基准对比
| 基准 | Beam | GLM 5.3 | 差异 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 61.0 | -16.6 | |
| SWE-Bench Pro v2-Hard | 77.2 | 84.3 | -7.1 | |
| Terminal-Bench v2.1 | 80.1 | 88.2 | -8.1 | |
| SWE Atlas Codebase QnA | 34.6 | 61.0 | -26.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 42.3 | -6.1 | |
| SciCode | 49.7 | 59.0 | -9.3 | |
| CritPt (AA) | 16.3 | 19.1 | -2.8 | |
| GPQA Diamond | 90.5 | 91.7 | -1.2 | |
| AutomationBench (public) | 37.0 | 48.2 | -11.2 | |
| MCP Atlas | 78.7 | 84.2 | -5.5 | |
| AA-LCR (long context) | 79.3 | 79.7 | -0.4 | |
| AA Omniscience index (public split) | 13.0 | 22.6 | -9.6 |
所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。GLM 5.3 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。
两款模型
| Beam | GLM 5.3 | |
|---|---|---|
| 开发者 | Reflection AI | Z.ai (Zhipu AI) |
| 总部所在地 | 美国 | 中国 |
| 参数量(总计 / 激活) | 501B / 23B | 753B / 40B |
| 权重 | Apache 2.0,承诺于 2026 年 10 月晚些时候推出 | GLM-5.3 License (MIT-like, review above $10B revenue) |
| 发布日期 | 2026年10月5日 | 2026年8月27日 |
| 获取方式 | API beta 版需排队申请;模型权重即将推出 | Hugging Face, Z.ai API, OpenRouter |