コンテンツへスキップ
reflectionbeam

直接比較

Beam vs DeepSeek V4.1 Flash

2:7

共通するベンチマーク9件中、Beamが2件で勝利

判定

DeepSeek V4.1 Flashは、共通する9つのベンチマークのうち7つで優位に立ち、DeepSWEとAutomationBenchでは大差、Terminal-Benchでは10ポイント差をつけています。BeamはCritPtで勝利し、誤答に自信を持って回答すると減点されるAA Omniscience indexでもより良い結果です。ただし、ここでは効率面でもBeamに優位性はありません。DeepSeek V4.1 Flashが生成トークンあたりに有効化するパラメータは160億にすぎず、Beamの230億を下回ります。また、そのウェイトはMITライセンスで既に公開されています。

ベンチマークごとの比較

ベンチマークBeamDeepSeek V4.1 Flash差
DeepSWE v1.144.474.2-29.8
Terminal-Bench v2.180.190.6-10.5
Humanity's Last Exam (no tools)36.239.1-2.9
SciCode49.752.0-2.3
CritPt (AA)16.314.3+2.0
GPQA Diamond90.590.9-0.4
AutomationBench (public)37.054.8-17.8
AA-LCR (long context)79.384.0-4.7
AA Omniscience index (public split)13.06.6+6.4

すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。DeepSeek V4.1 Flashのスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。

2つのモデル

BeamDeepSeek V4.1 Flash
開発元Reflection AIDeepSeek
拠点米国中国
パラメータ(合計/有効)501B / 23B552B / 16B
重みApache 2.0、2026年10月後半に提供予定MIT
リリース日2026年10月5日2026年9月10日
利用方法ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定Hugging Face, DeepSeek API, OpenRouter

その他の比較