İçeriğe geç
reflectionbeam

Bire bir karşılaştırma

Beam vs GLM 5.2

8:5

Beam, ortak kıyaslamaların 13 tanesinden 8 tanesini kazanıyor

Sonuç

Reflection, başlık iddiası için özellikle bu karşılaştırmayı seçti ve Beam bu karşılaştırmada güçlü bir performans sergiliyor: ortak 13 benchmark'ın 8'inde, SWE-Bench Pro v1, MCP Atlas, AutomationBench ve IFBench dahil, önde. GLM 5.2 ise zorlu akıl yürütme benchmark'larında (AIME, HLE, GPQA, CritPt) ve az farkla Terminal-Bench'te önde. Reflection, Beam'in benzer akıl yürütme puanlarına üç ila dört kat daha az çıkarım hesaplamasıyla ulaştığını söylüyor.

Kıyaslama bazında

KıyaslamaBeamGLM 5.2Fark
DeepSWE v1.144,444,0+0,4
SWE-Bench Pro v165,562,1+3,4
Terminal-Bench v2.180,181,0-0,9
AIME 202697,899,2-1,4
Humanity's Last Exam (no tools)36,240,5-4,3
CritPt (AA)16,320,9-4,6
GPQA Diamond90,591,2-0,7
AutomationBench (public)37,026,2+10,8
MCP Atlas78,777,8+0,9
τ³ banking38,037,1+0,9
AA-LCR (long context)79,378,3+1,0
LongBench v265,564,0+1,5
IFBench79,773,3+6,4

Tüm puanlar Reflection'ın duyurusundan (8 Ekim 2026 tarihli revizyon) alınmıştır. GLM 5.2 puanları, Reflection'ın Artificial Analysis ve DataCurve'den aktardığı puanlardır.

İki model

BeamGLM 5.2
GeliştiriciReflection AIZ.ai (Zhipu AI)
MerkezAmerika Birleşik DevletleriÇin
Parametreler (toplam / etkin)501B / 23B753B / 40B
AğırlıklarApache 2.0, Ekim 2026'nın ilerleyen günlerinde sunulacağı vaat edildiMIT
Yayınlandı5 Ekim 202616 Haziran 2026
Nasıl erişilirBekleme listeli beta API; ağırlıklar yakındaHugging Face, Z.ai API, OpenRouter

Diğer karşılaştırmalar