跳至内容
reflectionbeam

正面对比

Beam vs Qwen 3.8 Max

0:13

Beam 在 13 项共同基准中赢得 0 项

结论

Qwen 3.8 Max 在双方都参与的 13 项基准测试中全部领先,不过几项差距不大(GPQA 为 92.6 对 90.5,AA-LCR 为 80.3 对 79.3,LongBench 为 66.3 对 65.5)。Qwen 3.8 Max 拥有 2.4 万亿参数,每个 token 激活 950 亿参数,约为 Beam 激活参数规模的 4 倍;这正是 Reflection 所指出的计算量差距。

逐项基准对比

基准BeamQwen 3.8 Max差异
DeepSWE v1.144.451.0-6.6
SWE-Bench Pro v165.567.7-2.2
Terminal-Bench v2.180.186.6-6.5
Humanity's Last Exam (no tools)36.243.6-7.4
SciCode49.752.1-2.4
CritPt (AA)16.320.0-3.7
GPQA Diamond90.592.6-2.1
AutomationBench (public)37.039.8-2.8
MCP Atlas78.784.5-5.8
τ³ banking38.055.2-17.2
AA-LCR (long context)79.380.3-1.0
LongBench v265.566.3-0.8
IFBench79.782.8-3.1

所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。Qwen 3.8 Max 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。

两款模型

BeamQwen 3.8 Max
开发者Reflection AIAlibaba (Qwen)
总部所在地美国中国
参数量(总计 / 激活)501B / 23B2.4T / 95B
权重Apache 2.0,承诺于 2026 年 10 月晚些时候推出Qwen3.8-Max License (custom)
发布日期2026年10月5日2026年8月3日
获取方式API beta 版需排队申请;模型权重即将推出Hugging Face, Alibaba Cloud Model Studio, OpenRouter

其他对比