正面对比
Beam vs Kimi K3
1:13
Beam 在 14 项共同基准中赢得 1 项
结论
Reflection 自己也指出,Kimi K3 在原始能力上仍然领先。Kimi K3 在双方都参与的 14 项基准测试中赢下 13 项,在智能体编程和搜索方面往往领先 10 分或更多。Beam 唯一的胜项是 τ³ banking。取舍在于规模:Kimi K3 拥有 2.8 万亿参数,每个 token 激活 1040 亿参数,约为 Beam 的 230 亿参数的 4.5 倍;即使采用 4-bit 格式,其权重也约占 1.4 TB。
逐项基准对比
| 基准 | Beam | Kimi K3 | 差异 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 68.0 | -23.6 | |
| SWE-Bench Pro v2-Hard | 77.2 | 88.2 | -11.0 | |
| Terminal-Bench v2.1 | 80.1 | 88.3 | -8.2 | |
| SWE Atlas Codebase QnA | 34.6 | 68.0 | -33.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 46.9 | -10.7 | |
| SciCode | 49.7 | 58.7 | -9.0 | |
| CritPt (AA) | 16.3 | 23.4 | -7.1 | |
| GPQA Diamond | 90.5 | 93.5 | -3.0 | |
| AutomationBench (public) | 37.0 | 46.7 | -9.7 | |
| MCP Atlas | 78.7 | 82.3 | -3.6 | |
| τ³ banking | 38.0 | 37.1 | +0.9 | |
| BrowseComp (context mgmt) | 77.4 | 91.2 | -13.8 | |
| DeepSearchQA (context mgmt) | 80.1 | 95.0 | -14.9 | |
| AA-LCR (long context) | 79.3 | 88.7 | -9.4 |
所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。Kimi K3 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。
两款模型
| Beam | Kimi K3 | |
|---|---|---|
| 开发者 | Reflection AI | Moonshot AI |
| 总部所在地 | 美国 | 中国 |
| 参数量(总计 / 激活) | 501B / 23B | 2.8T / 104B |
| 权重 | Apache 2.0,承诺于 2026 年 10 月晚些时候推出 | Kimi K3 License (custom) |
| 发布日期 | 2026年10月5日 | 2026年7月16日 |
| 获取方式 | API beta 版需排队申请;模型权重即将推出 | Hugging Face, Moonshot API, OpenRouter |