ข้ามไปยังเนื้อหา
reflectionbeam

เปรียบเทียบแบบตัวต่อตัว

Beam vs GLM 5.2

8:5

Beam ชนะ 8 จาก 13 เบนช์มาร์กที่ใช้ร่วมกัน

บทสรุป

นี่คือคู่เปรียบเทียบที่ Reflection เลือกมาใช้เป็นข้อกล่าวอ้างหลัก และ Beam ก็ทำผลงานได้ดี: ชนะ 8 จาก 13 เบนช์มาร์กร่วม รวมถึง SWE-Bench Pro v1, MCP Atlas, AutomationBench และ IFBench ส่วน GLM 5.2 ทำได้ดีกว่าในด้านการให้เหตุผลระดับยาก (AIME, HLE, GPQA, CritPt) และนำ Terminal-Bench อยู่เล็กน้อย Reflection ระบุว่า Beam ทำคะแนนด้านการให้เหตุผลได้ใกล้เคียงกันโดยใช้คอมพิวต์สำหรับ inference น้อยกว่าถึงสามถึงสี่เท่า

แยกตามเบนช์มาร์ก

BenchmarkBeamGLM 5.2ส่วนต่าง
DeepSWE v1.144.444.0+0.4
SWE-Bench Pro v165.562.1+3.4
Terminal-Bench v2.180.181.0-0.9
AIME 202697.899.2-1.4
Humanity's Last Exam (no tools)36.240.5-4.3
CritPt (AA)16.320.9-4.6
GPQA Diamond90.591.2-0.7
AutomationBench (public)37.026.2+10.8
MCP Atlas78.777.8+0.9
τ³ banking38.037.1+0.9
AA-LCR (long context)79.378.3+1.0
LongBench v265.564.0+1.5
IFBench79.773.3+6.4

คะแนนทั้งหมดมาจากประกาศของ Reflection (ฉบับปรับปรุงวันที่ 8 ตุลาคม 2026) คะแนนของ GLM 5.2 อ้างอิงตามที่ Reflection ระบุจาก Artificial Analysis และ DataCurve

โมเดลทั้งสอง

BeamGLM 5.2
ผู้พัฒนาReflection AIZ.ai (Zhipu AI)
ตั้งอยู่ที่สหรัฐอเมริกาจีน
พารามิเตอร์ (ทั้งหมด / ที่ใช้งาน)501B / 23B753B / 40B
น้ำหนักโมเดลApache 2.0 โดยสัญญาว่าจะเปิดให้ใช้ภายหลังในเดือนตุลาคม 2026MIT
เปิดตัว5 ตุลาคม 256916 มิถุนายน 2569
วิธีเข้าถึงAPI เบตาที่ต้องเข้าคิวรอ; จะเปิดให้ใช้น้ำหนักโมเดลเร็ว ๆ นี้Hugging Face, Z.ai API, OpenRouter

การเปรียบเทียบอื่น ๆ

แหล่งที่มา