直接比較
Beam vs Kimi K3
1:13
共通するベンチマーク14件中、Beamが1件で勝利
判定
Reflection自身が、生の性能ではKimi K3が依然として上回るモデルとして挙げています。Kimi K3は共通する14のベンチマークのうち13で勝利し、エージェント型コーディングと検索では10ポイント以上の差をつけることも少なくありません。Beamが勝つのはτ³ bankingだけです。その代わり、サイズには大きな違いがあります。Kimi K3は総パラメータ数2.8兆、トークンあたりのアクティブパラメータ数1040億で、Beamの230億の約4.5倍です。また、ウェイトは4-bit形式でも約1.4 TBになります。
ベンチマークごとの比較
| ベンチマーク | Beam | Kimi K3 | 差 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 68.0 | -23.6 | |
| SWE-Bench Pro v2-Hard | 77.2 | 88.2 | -11.0 | |
| Terminal-Bench v2.1 | 80.1 | 88.3 | -8.2 | |
| SWE Atlas Codebase QnA | 34.6 | 68.0 | -33.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 46.9 | -10.7 | |
| SciCode | 49.7 | 58.7 | -9.0 | |
| CritPt (AA) | 16.3 | 23.4 | -7.1 | |
| GPQA Diamond | 90.5 | 93.5 | -3.0 | |
| AutomationBench (public) | 37.0 | 46.7 | -9.7 | |
| MCP Atlas | 78.7 | 82.3 | -3.6 | |
| τ³ banking | 38.0 | 37.1 | +0.9 | |
| BrowseComp (context mgmt) | 77.4 | 91.2 | -13.8 | |
| DeepSearchQA (context mgmt) | 80.1 | 95.0 | -14.9 | |
| AA-LCR (long context) | 79.3 | 88.7 | -9.4 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。Kimi K3のスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | Kimi K3 | |
|---|---|---|
| 開発元 | Reflection AI | Moonshot AI |
| 拠点 | 米国 | 中国 |
| パラメータ(合計/有効) | 501B / 23B | 2.8T / 104B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | Kimi K3 License (custom) |
| リリース日 | 2026年10月5日 | 2026年7月16日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, Moonshot API, OpenRouter |
その他の比較
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–5共通するベンチマーク13件
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–13共通するベンチマーク13件
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–7共通するベンチマーク9件
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–12共通するベンチマーク12件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件
Thinking Machines Lab
Beam vs Inkling
Beam 13–2共通するベンチマーク15件