コンテンツへスキップ
reflectionbeam

直接比較

Beam vs Qwen 3.8 Max

0:13

共通するベンチマーク13件中、Beamが0件で勝利

判定

Qwen 3.8 Maxは、共通する13のベンチマークすべてでリードしていますが、差が小さい項目もいくつかあります(GPQAは92.6対90.5、AA-LCRは80.3対79.3、LongBenchは66.3対65.5)。Qwen 3.8 Maxは総パラメータ数2.4兆、トークンあたりのアクティブパラメータ数950億のモデルで、アクティブサイズはBeamの約4倍です。これがReflectionの指摘する計算量の差です。

ベンチマークごとの比較

ベンチマークBeamQwen 3.8 Max差
DeepSWE v1.144.451.0-6.6
SWE-Bench Pro v165.567.7-2.2
Terminal-Bench v2.180.186.6-6.5
Humanity's Last Exam (no tools)36.243.6-7.4
SciCode49.752.1-2.4
CritPt (AA)16.320.0-3.7
GPQA Diamond90.592.6-2.1
AutomationBench (public)37.039.8-2.8
MCP Atlas78.784.5-5.8
τ³ banking38.055.2-17.2
AA-LCR (long context)79.380.3-1.0
LongBench v265.566.3-0.8
IFBench79.782.8-3.1

すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。Qwen 3.8 Maxのスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。

2つのモデル

BeamQwen 3.8 Max
開発元Reflection AIAlibaba (Qwen)
拠点米国中国
パラメータ(合計/有効)501B / 23B2.4T / 95B
重みApache 2.0、2026年10月後半に提供予定Qwen3.8-Max License (custom)
リリース日2026年10月5日2026年8月3日
利用方法ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定Hugging Face, Alibaba Cloud Model Studio, OpenRouter

その他の比較