正面对比
Beam vs Inkling
13:2
Beam 在 15 项共同基准中赢得 13 项
结论
Thinking Machines Lab 的 Inkling 是 2026 年另一款备受瞩目的美国开放权重模型,现已采用 Apache 2.0 许可证发布。Beam 在双方都参与的 15 项基准测试中赢下 13 项,在 SWE-Bench Pro、Terminal-Bench 和 CritPt 上优势明显。Inkling 在 IFBench 和 AA Omniscience 指数上略微领先。Reflection 指出,Inkling 的 RL 使用了 3000 万次 rollout,而 Beam 使用了超过 1 亿次。
逐项基准对比
| 基准 | Beam | Inkling | 差异 | |
|---|---|---|---|---|
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | +20.3 | |
| SWE-Bench Pro v1 | 65.5 | 54.3 | +11.2 | |
| Terminal-Bench v2.1 | 80.1 | 63.8 | +16.3 | |
| SWE-Bench Verified | 80.9 | 77.6 | +3.3 | |
| AIME 2026 | 97.8 | 97.1 | +0.7 | |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | +6.5 | |
| SciCode | 49.7 | 46.1 | +3.6 | |
| CritPt (AA) | 16.3 | 5.4 | +10.9 | |
| GPQA Diamond | 90.5 | 87.2 | +3.3 | |
| MCP Atlas | 78.7 | 76.0 | +2.7 | |
| τ³ banking | 38.0 | 25.0 | +13.0 | |
| BrowseComp (context mgmt) | 77.4 | 77.1 | +0.3 | |
| AA-LCR (long context) | 79.3 | 77.3 | +2.0 | |
| IFBench | 79.7 | 79.8 | -0.1 | |
| AA Omniscience index (public split) | 13.0 | 14.2 | -1.2 |
所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。Inkling 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。
两款模型
| Beam | Inkling | |
|---|---|---|
| 开发者 | Reflection AI | Thinking Machines Lab |
| 总部所在地 | 美国 | 美国 |
| 参数量(总计 / 激活) | 501B / 23B | 975B / 41B |
| 权重 | Apache 2.0,承诺于 2026 年 10 月晚些时候推出 | Apache 2.0 |
| 发布日期 | 2026年10月5日 | 2026年7月15日 |
| 获取方式 | API beta 版需排队申请;模型权重即将推出 | Hugging Face, Tinker API |