Adu langsung
Beam vs GLM 5.2
Beam unggul pada 8 dari 13 benchmark yang sama
Kesimpulan
Ini adalah perbandingan yang dipilih Reflection untuk klaim utamanya, dan Beam mampu bersaing: Beam unggul pada 8 dari 13 benchmark yang sama, termasuk SWE-Bench Pro v1, MCP Atlas, AutomationBench, dan IFBench, sedangkan GLM 5.2 unggul dalam penalaran sulit (AIME, HLE, GPQA, CritPt) dan sedikit lebih unggul pada Terminal-Bench. Reflection menyatakan Beam mencapai skor penalaran yang sebanding dengan komputasi inferensi tiga hingga empat kali lebih sedikit.
Perbandingan per benchmark
| Benchmark | Beam | GLM 5.2 | Selisih | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 44,0 | +0,4 | |
| SWE-Bench Pro v1 | 65,5 | 62,1 | +3,4 | |
| Terminal-Bench v2.1 | 80,1 | 81,0 | -0,9 | |
| AIME 2026 | 97,8 | 99,2 | -1,4 | |
| Humanity's Last Exam (no tools) | 36,2 | 40,5 | -4,3 | |
| CritPt (AA) | 16,3 | 20,9 | -4,6 | |
| GPQA Diamond | 90,5 | 91,2 | -0,7 | |
| AutomationBench (public) | 37,0 | 26,2 | +10,8 | |
| MCP Atlas | 78,7 | 77,8 | +0,9 | |
| τ³ banking | 38,0 | 37,1 | +0,9 | |
| AA-LCR (long context) | 79,3 | 78,3 | +1,0 | |
| LongBench v2 | 65,5 | 64,0 | +1,5 | |
| IFBench | 79,7 | 73,3 | +6,4 |
Semua skor berasal dari pengumuman Reflection (revisi 8 Oktober 2026). Skor untuk GLM 5.2 adalah sebagaimana dikutip Reflection dari Artificial Analysis dan DataCurve.
Kedua model
| Beam | GLM 5.2 | |
|---|---|---|
| Developer | Reflection AI | Z.ai (Zhipu AI) |
| Berbasis di | Amerika Serikat | China |
| Parameter (total / aktif) | 501B / 23B | 753B / 40B |
| Bobot | Apache 2.0, dijanjikan hadir nanti pada Oktober 2026 | MIT |
| Dirilis | 5 Oktober 2026 | 16 Juni 2026 |
| Cara mengakses | API beta masuk daftar tunggu; bobot segera hadir | Hugging Face, Z.ai API, OpenRouter |
Perbandingan lainnya
Moonshot AI
Beam vs Kimi K3
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
DeepSeek
Beam vs DeepSeek V4.1 Flash
Z.ai (Zhipu AI)
Beam vs GLM 5.3
NVIDIA
Beam vs Nemotron 3 Ultra
Thinking Machines Lab