正面对比
Beam vs Qwen 3.8 Max
0:13
Beam 在 13 项共同基准中赢得 0 项
结论
Qwen 3.8 Max 在双方都参与的 13 项基准测试中全部领先,不过几项差距不大(GPQA 为 92.6 对 90.5,AA-LCR 为 80.3 对 79.3,LongBench 为 66.3 对 65.5)。Qwen 3.8 Max 拥有 2.4 万亿参数,每个 token 激活 950 亿参数,约为 Beam 激活参数规模的 4 倍;这正是 Reflection 所指出的计算量差距。
逐项基准对比
| 基准 | Beam | Qwen 3.8 Max | 差异 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 51.0 | -6.6 | |
| SWE-Bench Pro v1 | 65.5 | 67.7 | -2.2 | |
| Terminal-Bench v2.1 | 80.1 | 86.6 | -6.5 | |
| Humanity's Last Exam (no tools) | 36.2 | 43.6 | -7.4 | |
| SciCode | 49.7 | 52.1 | -2.4 | |
| CritPt (AA) | 16.3 | 20.0 | -3.7 | |
| GPQA Diamond | 90.5 | 92.6 | -2.1 | |
| AutomationBench (public) | 37.0 | 39.8 | -2.8 | |
| MCP Atlas | 78.7 | 84.5 | -5.8 | |
| τ³ banking | 38.0 | 55.2 | -17.2 | |
| AA-LCR (long context) | 79.3 | 80.3 | -1.0 | |
| LongBench v2 | 65.5 | 66.3 | -0.8 | |
| IFBench | 79.7 | 82.8 | -3.1 |
所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。Qwen 3.8 Max 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。
两款模型
| Beam | Qwen 3.8 Max | |
|---|---|---|
| 开发者 | Reflection AI | Alibaba (Qwen) |
| 总部所在地 | 美国 | 中国 |
| 参数量(总计 / 激活) | 501B / 23B | 2.4T / 95B |
| 权重 | Apache 2.0,承诺于 2026 年 10 月晚些时候推出 | Qwen3.8-Max License (custom) |
| 发布日期 | 2026年10月5日 | 2026年8月3日 |
| 获取方式 | API beta 版需排队申请;模型权重即将推出 | Hugging Face, Alibaba Cloud Model Studio, OpenRouter |