跳至内容
reflectionbeam

基准测试

Beam 基准测试结果

涵盖智能体编程、推理、工具使用和通用能力的 21 项基准测试,数据完全按照 Reflection 发布的内容整理,并与另外七款开放模型并列对比。

这些是 Reflection 在公告中报告的数据(表格更新于 2026 年 10 月 8 日)。其他模型的分数来自 Artificial Analysis 和 DataCurve,来源由 Reflection 引用。权重公开后,我们将跟进独立复现结果。

基准BeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4——44.061.068.051.074.2
SWE-Bench Pro v2-Hard77.256.9——84.388.2——
SWE-Bench Pro v165.554.346.462.1——67.7—
Terminal-Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6———61.068.0——
SWE-Bench Multilingual78.0—67.7—————
SWE-Bench Verified80.977.670.7—————
AIME 202697.897.1—99.2————
Humanity's Last Exam (no tools)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6—59.058.752.152.0
CritPt (AA)16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.287.091.291.793.592.690.9
AutomationBench (public)37.0——26.248.246.739.854.8
MCP Atlas78.776.063.177.884.282.384.5—
τ³ banking38.025.022.637.1—37.155.2—
BrowseComp (context mgmt)77.477.144.4——91.2——
DeepSearchQA (context mgmt)80.1————95.0——
AA-LCR (long context)79.377.379.378.379.788.780.384.0
LongBench v265.5—61.964.0——66.3—
IFBench79.779.881.773.3——82.8—
AA Omniscience index (public split)13.014.28.6—22.6——6.6

00.0 该项报告的最高分— 未报告

数据说明

Beam 在软件工程方面表现最强。它在 SWE-Bench Verified 上得分 80.9(高于 Inkling 的 77.6),在 SWE-Bench Multilingual 上得分 78.0(高于 Nemotron 3 Ultra 的 67.7)。较大型的中国模型未报告这两项基准测试的成绩;此外,Beam 在 SWE-Bench Pro v1 上略胜 GLM 5.2(65.5 对 62.1),在 MCP Atlas 上也略胜一筹(78.7 对 77.8)。

在纯推理方面,Beam 略落后于领先者:在 GPQA Diamond 上得分 90.5,而 Kimi K3 为 93.5;在不使用工具的 Humanity's Last Exam 上得分 36.2,而另一模型得分 46.9。

Reflection 的观点并非 Beam 样样领先,而是它在每个回答所耗算力少得多的情况下,仍能取得接近领先者的成绩。在报告了结果的多数项目中,Kimi K3、GLM 5.3 和 Qwen 3.8 Max 仍然领先。

各项基准测试的衡量内容

智能体编程与终端

DeepSWE v1.1
由智能体端到端完成的长周期软件工程任务。
SWE-Bench Pro v2-Hard
SWE-Bench Pro 中难度较高的测试集:处理真实世界代码库中的复杂问题。
SWE-Bench Pro v1
来自专业代码库的真实 GitHub 问题;相比经典 SWE-Bench,难度更高且数据污染更少。
Terminal-Bench v2.1
在真实 Linux 终端中完成任务:包括 shell、工具、构建和调试。
SWE Atlas Codebase QnA
回答有关大型陌生代码库的问题。
SWE-Bench Multilingual
在多种编程语言中修复 SWE-Bench 风格的问题。
SWE-Bench Verified
SWE-Bench 的人工验证子集:修复问题,使隐藏测试通过。

推理

AIME 2026
来自 2026 年美国数学邀请赛的题目。
Humanity's Last Exam (no tools)
Humanity's Last Exam:涵盖多个领域的专家级问题,不使用工具作答。
SciCode
编写代码解决研究级科学问题。
CritPt (AA)
Artificial Analysis 评测中的研究级物理推理题。
GPQA Diamond
研究生级别的生物、化学和物理问题,难以通过查找获得答案。

工具调用与搜索

AutomationBench (public)
跨应用自动化多步骤业务工作流。
MCP Atlas
正确使用通过 Model Context Protocol (MCP) 提供的工具。
τ³ banking
在银行领域使用工具和政策进行客服式对话。
BrowseComp (context mgmt)
通过浏览网页并管理上下文,查找难以找到的事实。
DeepSearchQA (context mgmt)
需要搜索并整合多个来源的多步骤研究问题。

通用能力

AA-LCR (long context)
对超长文档进行推理(Artificial Analysis 长上下文推理)。
LongBench v2
理解长输入并回答相关问题。
IFBench
遵循精确、可验证的格式和内容要求。
AA Omniscience index (public split)
事实知识评测,对自信地给出错误答案(幻觉)进行惩罚。