跳至内容
reflectionbeam

正面对比

Beam vs Kimi K3

1:13

Beam 在 14 项共同基准中赢得 1 项

结论

Reflection 自己也指出,Kimi K3 在原始能力上仍然领先。Kimi K3 在双方都参与的 14 项基准测试中赢下 13 项,在智能体编程和搜索方面往往领先 10 分或更多。Beam 唯一的胜项是 τ³ banking。取舍在于规模:Kimi K3 拥有 2.8 万亿参数,每个 token 激活 1040 亿参数,约为 Beam 的 230 亿参数的 4.5 倍;即使采用 4-bit 格式,其权重也约占 1.4 TB。

逐项基准对比

基准BeamKimi K3差异
DeepSWE v1.144.468.0-23.6
SWE-Bench Pro v2-Hard77.288.2-11.0
Terminal-Bench v2.180.188.3-8.2
SWE Atlas Codebase QnA34.668.0-33.4
Humanity's Last Exam (no tools)36.246.9-10.7
SciCode49.758.7-9.0
CritPt (AA)16.323.4-7.1
GPQA Diamond90.593.5-3.0
AutomationBench (public)37.046.7-9.7
MCP Atlas78.782.3-3.6
τ³ banking38.037.1+0.9
BrowseComp (context mgmt)77.491.2-13.8
DeepSearchQA (context mgmt)80.195.0-14.9
AA-LCR (long context)79.388.7-9.4

所有分数均来自 Reflection 的公告(2026 年 10 月 8 日修订版)。Kimi K3 的分数是 Reflection 引用 Artificial Analysis 和 DataCurve 的数据。

两款模型

BeamKimi K3
开发者Reflection AIMoonshot AI
总部所在地美国中国
参数量(总计 / 激活)501B / 23B2.8T / 104B
权重Apache 2.0,承诺于 2026 年 10 月晚些时候推出Kimi K3 License (custom)
发布日期2026年10月5日2026年7月16日
获取方式API beta 版需排队申请;模型权重即将推出Hugging Face, Moonshot API, OpenRouter

其他对比