直接比較
Beam vs DeepSeek V4.1 Flash
2:7
共通するベンチマーク9件中、Beamが2件で勝利
判定
DeepSeek V4.1 Flashは、共通する9つのベンチマークのうち7つで優位に立ち、DeepSWEとAutomationBenchでは大差、Terminal-Benchでは10ポイント差をつけています。BeamはCritPtで勝利し、誤答に自信を持って回答すると減点されるAA Omniscience indexでもより良い結果です。ただし、ここでは効率面でもBeamに優位性はありません。DeepSeek V4.1 Flashが生成トークンあたりに有効化するパラメータは160億にすぎず、Beamの230億を下回ります。また、そのウェイトはMITライセンスで既に公開されています。
ベンチマークごとの比較
| ベンチマーク | Beam | DeepSeek V4.1 Flash | 差 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 74.2 | -29.8 | |
| Terminal-Bench v2.1 | 80.1 | 90.6 | -10.5 | |
| Humanity's Last Exam (no tools) | 36.2 | 39.1 | -2.9 | |
| SciCode | 49.7 | 52.0 | -2.3 | |
| CritPt (AA) | 16.3 | 14.3 | +2.0 | |
| GPQA Diamond | 90.5 | 90.9 | -0.4 | |
| AutomationBench (public) | 37.0 | 54.8 | -17.8 | |
| AA-LCR (long context) | 79.3 | 84.0 | -4.7 | |
| AA Omniscience index (public split) | 13.0 | 6.6 | +6.4 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。DeepSeek V4.1 Flashのスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | DeepSeek V4.1 Flash | |
|---|---|---|
| 開発元 | Reflection AI | DeepSeek |
| 拠点 | 米国 | 中国 |
| パラメータ(合計/有効) | 501B / 23B | 552B / 16B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | MIT |
| リリース日 | 2026年10月5日 | 2026年9月10日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, DeepSeek API, OpenRouter |
その他の比較
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–5共通するベンチマーク13件
Moonshot AI
Beam vs Kimi K3
Beam 1–13共通するベンチマーク14件
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–13共通するベンチマーク13件
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–12共通するベンチマーク12件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件
Thinking Machines Lab
Beam vs Inkling
Beam 13–2共通するベンチマーク15件