コンテンツへスキップ
reflectionbeam

直接比較

Beam vs Kimi K3

1:13

共通するベンチマーク14件中、Beamが1件で勝利

判定

Reflection自身が、生の性能ではKimi K3が依然として上回るモデルとして挙げています。Kimi K3は共通する14のベンチマークのうち13で勝利し、エージェント型コーディングと検索では10ポイント以上の差をつけることも少なくありません。Beamが勝つのはτ³ bankingだけです。その代わり、サイズには大きな違いがあります。Kimi K3は総パラメータ数2.8兆、トークンあたりのアクティブパラメータ数1040億で、Beamの230億の約4.5倍です。また、ウェイトは4-bit形式でも約1.4 TBになります。

ベンチマークごとの比較

ベンチマークBeamKimi K3差
DeepSWE v1.144.468.0-23.6
SWE-Bench Pro v2-Hard77.288.2-11.0
Terminal-Bench v2.180.188.3-8.2
SWE Atlas Codebase QnA34.668.0-33.4
Humanity's Last Exam (no tools)36.246.9-10.7
SciCode49.758.7-9.0
CritPt (AA)16.323.4-7.1
GPQA Diamond90.593.5-3.0
AutomationBench (public)37.046.7-9.7
MCP Atlas78.782.3-3.6
τ³ banking38.037.1+0.9
BrowseComp (context mgmt)77.491.2-13.8
DeepSearchQA (context mgmt)80.195.0-14.9
AA-LCR (long context)79.388.7-9.4

すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。Kimi K3のスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。

2つのモデル

BeamKimi K3
開発元Reflection AIMoonshot AI
拠点米国中国
パラメータ(合計/有効)501B / 23B2.8T / 104B
重みApache 2.0、2026年10月後半に提供予定Kimi K3 License (custom)
リリース日2026年10月5日2026年7月16日
利用方法ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定Hugging Face, Moonshot API, OpenRouter

その他の比較