基准测试
Beam 基准测试结果
涵盖智能体编程、推理、工具使用和通用能力的 21 项基准测试,数据完全按照 Reflection 发布的内容整理,并与另外七款开放模型并列对比。
这些是 Reflection 在公告中报告的数据(表格更新于 2026 年 10 月 8 日)。其他模型的分数来自 Artificial Analysis 和 DataCurve,来源由 Reflection 引用。权重公开后,我们将跟进独立复现结果。
| 基准 | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | — | — | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | — | — | 84.3 | 88.2 | — | — |
| SWE-Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | — | — | 67.7 | — |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | — | — | — | 61.0 | 68.0 | — | — |
| SWE-Bench Multilingual | 78.0 | — | 67.7 | — | — | — | — | — |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | — | — | — | — | — |
| AIME 2026 | 97.8 | 97.1 | — | 99.2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | — | 59.0 | 58.7 | 52.1 | 52.0 |
| CritPt (AA) | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87.0 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| AutomationBench (public) | 37.0 | — | — | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| MCP Atlas | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | — |
| τ³ banking | 38.0 | 25.0 | 22.6 | 37.1 | — | 37.1 | 55.2 | — |
| BrowseComp (context mgmt) | 77.4 | 77.1 | 44.4 | — | — | 91.2 | — | — |
| DeepSearchQA (context mgmt) | 80.1 | — | — | — | — | 95.0 | — | — |
| AA-LCR (long context) | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| LongBench v2 | 65.5 | — | 61.9 | 64.0 | — | — | 66.3 | — |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | — | — | 82.8 | — |
| AA Omniscience index (public split) | 13.0 | 14.2 | 8.6 | — | 22.6 | — | — | 6.6 |
00.0 该项报告的最高分— 未报告
数据说明
Beam 在软件工程方面表现最强。它在 SWE-Bench Verified 上得分 80.9(高于 Inkling 的 77.6),在 SWE-Bench Multilingual 上得分 78.0(高于 Nemotron 3 Ultra 的 67.7)。较大型的中国模型未报告这两项基准测试的成绩;此外,Beam 在 SWE-Bench Pro v1 上略胜 GLM 5.2(65.5 对 62.1),在 MCP Atlas 上也略胜一筹(78.7 对 77.8)。
在纯推理方面,Beam 略落后于领先者:在 GPQA Diamond 上得分 90.5,而 Kimi K3 为 93.5;在不使用工具的 Humanity's Last Exam 上得分 36.2,而另一模型得分 46.9。
Reflection 的观点并非 Beam 样样领先,而是它在每个回答所耗算力少得多的情况下,仍能取得接近领先者的成绩。在报告了结果的多数项目中,Kimi K3、GLM 5.3 和 Qwen 3.8 Max 仍然领先。
各项基准测试的衡量内容
智能体编程与终端
- DeepSWE v1.1
- 由智能体端到端完成的长周期软件工程任务。
- SWE-Bench Pro v2-Hard
- SWE-Bench Pro 中难度较高的测试集:处理真实世界代码库中的复杂问题。
- SWE-Bench Pro v1
- 来自专业代码库的真实 GitHub 问题;相比经典 SWE-Bench,难度更高且数据污染更少。
- Terminal-Bench v2.1
- 在真实 Linux 终端中完成任务:包括 shell、工具、构建和调试。
- SWE Atlas Codebase QnA
- 回答有关大型陌生代码库的问题。
- SWE-Bench Multilingual
- 在多种编程语言中修复 SWE-Bench 风格的问题。
- SWE-Bench Verified
- SWE-Bench 的人工验证子集:修复问题,使隐藏测试通过。
推理
- AIME 2026
- 来自 2026 年美国数学邀请赛的题目。
- Humanity's Last Exam (no tools)
- Humanity's Last Exam:涵盖多个领域的专家级问题,不使用工具作答。
- SciCode
- 编写代码解决研究级科学问题。
- CritPt (AA)
- Artificial Analysis 评测中的研究级物理推理题。
- GPQA Diamond
- 研究生级别的生物、化学和物理问题,难以通过查找获得答案。
工具调用与搜索
- AutomationBench (public)
- 跨应用自动化多步骤业务工作流。
- MCP Atlas
- 正确使用通过 Model Context Protocol (MCP) 提供的工具。
- τ³ banking
- 在银行领域使用工具和政策进行客服式对话。
- BrowseComp (context mgmt)
- 通过浏览网页并管理上下文,查找难以找到的事实。
- DeepSearchQA (context mgmt)
- 需要搜索并整合多个来源的多步骤研究问题。
通用能力
- AA-LCR (long context)
- 对超长文档进行推理(Artificial Analysis 长上下文推理)。
- LongBench v2
- 理解长输入并回答相关问题。
- IFBench
- 遵循精确、可验证的格式和内容要求。
- AA Omniscience index (public split)
- 事实知识评测,对自信地给出错误答案(幻觉)进行惩罚。