直接比較
Beam vs GLM 5.2
8:5
共通するベンチマーク13件中、Beamが8件で勝利
判定
これはReflectionが見出しでの主張に選んだ比較で、Beamはその期待に応えています。共通する13のベンチマークのうち8つで勝利し、SWE-Bench Pro v1、MCP Atlas、AutomationBench、IFBenchなどで優位に立っています。一方、難度の高い推論(AIME、HLE、GPQA、CritPt)とTerminal-BenchではGLM 5.2が僅差で上回ります。Reflectionによると、Beamは推論時の計算量を3〜4分の1に抑えながら、同等の推論スコアを達成しています。
ベンチマークごとの比較
| ベンチマーク | Beam | GLM 5.2 | 差 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 44.0 | +0.4 | |
| SWE-Bench Pro v1 | 65.5 | 62.1 | +3.4 | |
| Terminal-Bench v2.1 | 80.1 | 81.0 | -0.9 | |
| AIME 2026 | 97.8 | 99.2 | -1.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 40.5 | -4.3 | |
| CritPt (AA) | 16.3 | 20.9 | -4.6 | |
| GPQA Diamond | 90.5 | 91.2 | -0.7 | |
| AutomationBench (public) | 37.0 | 26.2 | +10.8 | |
| MCP Atlas | 78.7 | 77.8 | +0.9 | |
| τ³ banking | 38.0 | 37.1 | +0.9 | |
| AA-LCR (long context) | 79.3 | 78.3 | +1.0 | |
| LongBench v2 | 65.5 | 64.0 | +1.5 | |
| IFBench | 79.7 | 73.3 | +6.4 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。GLM 5.2のスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | GLM 5.2 | |
|---|---|---|
| 開発元 | Reflection AI | Z.ai (Zhipu AI) |
| 拠点 | 米国 | 中国 |
| パラメータ(合計/有効) | 501B / 23B | 753B / 40B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | MIT |
| リリース日 | 2026年10月5日 | 2026年6月16日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, Z.ai API, OpenRouter |
その他の比較
Moonshot AI
Beam vs Kimi K3
Beam 1–13共通するベンチマーク14件
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–13共通するベンチマーク13件
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–7共通するベンチマーク9件
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–12共通するベンチマーク12件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件
Thinking Machines Lab
Beam vs Inkling
Beam 13–2共通するベンチマーク15件