直接比較
Beam vs Qwen 3.8 Max
0:13
共通するベンチマーク13件中、Beamが0件で勝利
判定
Qwen 3.8 Maxは、共通する13のベンチマークすべてでリードしていますが、差が小さい項目もいくつかあります(GPQAは92.6対90.5、AA-LCRは80.3対79.3、LongBenchは66.3対65.5)。Qwen 3.8 Maxは総パラメータ数2.4兆、トークンあたりのアクティブパラメータ数950億のモデルで、アクティブサイズはBeamの約4倍です。これがReflectionの指摘する計算量の差です。
ベンチマークごとの比較
| ベンチマーク | Beam | Qwen 3.8 Max | 差 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 51.0 | -6.6 | |
| SWE-Bench Pro v1 | 65.5 | 67.7 | -2.2 | |
| Terminal-Bench v2.1 | 80.1 | 86.6 | -6.5 | |
| Humanity's Last Exam (no tools) | 36.2 | 43.6 | -7.4 | |
| SciCode | 49.7 | 52.1 | -2.4 | |
| CritPt (AA) | 16.3 | 20.0 | -3.7 | |
| GPQA Diamond | 90.5 | 92.6 | -2.1 | |
| AutomationBench (public) | 37.0 | 39.8 | -2.8 | |
| MCP Atlas | 78.7 | 84.5 | -5.8 | |
| τ³ banking | 38.0 | 55.2 | -17.2 | |
| AA-LCR (long context) | 79.3 | 80.3 | -1.0 | |
| LongBench v2 | 65.5 | 66.3 | -0.8 | |
| IFBench | 79.7 | 82.8 | -3.1 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。Qwen 3.8 Maxのスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | Qwen 3.8 Max | |
|---|---|---|
| 開発元 | Reflection AI | Alibaba (Qwen) |
| 拠点 | 米国 | 中国 |
| パラメータ(合計/有効) | 501B / 23B | 2.4T / 95B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | Qwen3.8-Max License (custom) |
| リリース日 | 2026年10月5日 | 2026年8月3日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, Alibaba Cloud Model Studio, OpenRouter |
その他の比較
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–5共通するベンチマーク13件
Moonshot AI
Beam vs Kimi K3
Beam 1–13共通するベンチマーク14件
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–7共通するベンチマーク9件
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–12共通するベンチマーク12件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件
Thinking Machines Lab
Beam vs Inkling
Beam 13–2共通するベンチマーク15件