コンテンツへスキップ
reflectionbeam

直接比較

Beam vs GLM 5.2

8:5

共通するベンチマーク13件中、Beamが8件で勝利

判定

これはReflectionが見出しでの主張に選んだ比較で、Beamはその期待に応えています。共通する13のベンチマークのうち8つで勝利し、SWE-Bench Pro v1、MCP Atlas、AutomationBench、IFBenchなどで優位に立っています。一方、難度の高い推論(AIME、HLE、GPQA、CritPt)とTerminal-BenchではGLM 5.2が僅差で上回ります。Reflectionによると、Beamは推論時の計算量を3〜4分の1に抑えながら、同等の推論スコアを達成しています。

ベンチマークごとの比較

ベンチマークBeamGLM 5.2差
DeepSWE v1.144.444.0+0.4
SWE-Bench Pro v165.562.1+3.4
Terminal-Bench v2.180.181.0-0.9
AIME 202697.899.2-1.4
Humanity's Last Exam (no tools)36.240.5-4.3
CritPt (AA)16.320.9-4.6
GPQA Diamond90.591.2-0.7
AutomationBench (public)37.026.2+10.8
MCP Atlas78.777.8+0.9
τ³ banking38.037.1+0.9
AA-LCR (long context)79.378.3+1.0
LongBench v265.564.0+1.5
IFBench79.773.3+6.4

すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。GLM 5.2のスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。

2つのモデル

BeamGLM 5.2
開発元Reflection AIZ.ai (Zhipu AI)
拠点米国中国
パラメータ(合計/有効)501B / 23B753B / 40B
重みApache 2.0、2026年10月後半に提供予定MIT
リリース日2026年10月5日2026年6月16日
利用方法ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定Hugging Face, Z.ai API, OpenRouter

その他の比較