直接比較
Beam vs GLM 5.3
0:12
共通するベンチマーク12件中、Beamが0件で勝利
判定
GLM 5.3は、数値上では明らかに優れています。共通する12のベンチマークすべてでリードし、DeepSWE、SWE Atlas、AutomationBenchでは大差をつけ、AA-LCRでも1ポイント未満の差をつけています。どちらのGLMモデルも、総パラメータ数7530億、トークンあたりのアクティブパラメータ数約400億のMoEです。そのため、BeamがGLM 5.3に対して優位を主張できるのは、アクティブサイズの小ささとトークンあたりのコストであり、スコアではありません。
ベンチマークごとの比較
| ベンチマーク | Beam | GLM 5.3 | 差 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 61.0 | -16.6 | |
| SWE-Bench Pro v2-Hard | 77.2 | 84.3 | -7.1 | |
| Terminal-Bench v2.1 | 80.1 | 88.2 | -8.1 | |
| SWE Atlas Codebase QnA | 34.6 | 61.0 | -26.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 42.3 | -6.1 | |
| SciCode | 49.7 | 59.0 | -9.3 | |
| CritPt (AA) | 16.3 | 19.1 | -2.8 | |
| GPQA Diamond | 90.5 | 91.7 | -1.2 | |
| AutomationBench (public) | 37.0 | 48.2 | -11.2 | |
| MCP Atlas | 78.7 | 84.2 | -5.5 | |
| AA-LCR (long context) | 79.3 | 79.7 | -0.4 | |
| AA Omniscience index (public split) | 13.0 | 22.6 | -9.6 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。GLM 5.3のスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | GLM 5.3 | |
|---|---|---|
| 開発元 | Reflection AI | Z.ai (Zhipu AI) |
| 拠点 | 米国 | 中国 |
| パラメータ(合計/有効) | 501B / 23B | 753B / 40B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | GLM-5.3 License (MIT-like, review above $10B revenue) |
| リリース日 | 2026年10月5日 | 2026年8月27日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, Z.ai API, OpenRouter |
その他の比較
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–5共通するベンチマーク13件
Moonshot AI
Beam vs Kimi K3
Beam 1–13共通するベンチマーク14件
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–13共通するベンチマーク13件
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–7共通するベンチマーク9件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件
Thinking Machines Lab
Beam vs Inkling
Beam 13–2共通するベンチマーク15件