ผลการทดสอบ
ผล benchmark ของ Beam
21 benchmark ครอบคลุมการเขียนโค้ดแบบเอเจนต์ การใช้เหตุผล การใช้เครื่องมือ และทักษะทั่วไป ตามที่ Reflection เผยแพร่ทุกประการ พร้อมเปรียบเทียบกับโมเดลแบบเปิดอีกเจ็ดรุ่น
ตัวเลขเหล่านี้เป็นผลที่ผู้พัฒนารายงานจากประกาศของ Reflection (อัปเดตตารางเมื่อ October 8, 2026) คะแนนของโมเดลอื่นมาจาก Artificial Analysis และ DataCurve ตามที่ Reflection อ้างอิงไว้ จะมีผลการทดสอบซ้ำโดยอิสระตามมาเมื่อเปิดเผย weights สู่สาธารณะ
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | — | — | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | — | — | 84.3 | 88.2 | — | — |
| SWE-Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | — | — | 67.7 | — |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | — | — | — | 61.0 | 68.0 | — | — |
| SWE-Bench Multilingual | 78.0 | — | 67.7 | — | — | — | — | — |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | — | — | — | — | — |
| AIME 2026 | 97.8 | 97.1 | — | 99.2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | — | 59.0 | 58.7 | 52.1 | 52.0 |
| CritPt (AA) | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87.0 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| AutomationBench (public) | 37.0 | — | — | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| MCP Atlas | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | — |
| τ³ banking | 38.0 | 25.0 | 22.6 | 37.1 | — | 37.1 | 55.2 | — |
| BrowseComp (context mgmt) | 77.4 | 77.1 | 44.4 | — | — | 91.2 | — | — |
| DeepSearchQA (context mgmt) | 80.1 | — | — | — | — | 95.0 | — | — |
| AA-LCR (long context) | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| LongBench v2 | 65.5 | — | 61.9 | 64.0 | — | — | 66.3 | — |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | — | — | 82.8 | — |
| AA Omniscience index (public split) | 13.0 | 14.2 | 8.6 | — | 22.6 | — | — | 6.6 |
00.0 คะแนนที่รายงานสูงสุดในแถว— ไม่มีการรายงาน
ตัวเลขบอกอะไร
Beam ทำผลงานได้ดีที่สุดด้านวิศวกรรมซอฟต์แวร์ โดยได้ 80.9 ใน SWE-Bench Verified (เหนือกว่า Inkling ที่ได้ 77.6) และ 78.0 ใน SWE-Bench Multilingual (เหนือกว่า Nemotron 3 Ultra ที่ได้ 67.7) ซึ่งเป็น benchmark ที่โมเดลจีนขนาดใหญ่กว่าไม่ได้รายงานผล อีกทั้งยังทำคะแนนนำ GLM 5.2 เล็กน้อยใน SWE-Bench Pro v1 (65.5 เทียบกับ 62.1) และ MCP Atlas (78.7 เทียบกับ 77.8)
ด้านการใช้เหตุผลล้วน ๆ Beam ตามหลังผู้นำอยู่เล็กน้อย โดยได้ 90.5 ใน GPQA Diamond เทียบกับ 93.5 ของ Kimi K3 และ 36.2 ใน Humanity's Last Exam เมื่อไม่มีเครื่องมือ เทียบกับ 46.9
Reflection ไม่ได้อ้างว่า Beam ชนะทุกด้าน แต่ชี้ว่า Beam ทำคะแนนได้ใกล้เคียง ขณะที่ใช้กำลังประมวลผลต่อคำตอบน้อยกว่ามาก Kimi K3, GLM 5.3 และ Qwen 3.8 Max ยังคงนำในแถวส่วนใหญ่ที่มีการรายงานผล
แต่ละ benchmark วัดอะไร
การเขียนโค้ดแบบเอเจนต์และเทอร์มินัล
- DeepSWE v1.1
- งานวิศวกรรมซอฟต์แวร์ที่มีหลายขั้นตอน ซึ่งเอเจนต์ต้องทำให้เสร็จตั้งแต่ต้นจนจบ
- SWE-Bench Pro v2-Hard
- ชุดทดสอบส่วนที่ยากของ SWE-Bench Pro: ปัญหาใน repository จริงที่ยากและท้าทาย
- SWE-Bench Pro v1
- ปัญหาจริงจาก GitHub ใน codebase ระดับมืออาชีพ ซึ่งยากกว่าและมีข้อมูลรั่วไหลน้อยกว่า SWE-Bench รุ่นดั้งเดิม
- Terminal-Bench v2.1
- การทำงานให้เสร็จภายในเทอร์มินัล Linux จริง ทั้งการใช้ shell เครื่องมือ การ build และการดีบัก
- SWE Atlas Codebase QnA
- การตอบคำถามเกี่ยวกับ codebase ขนาดใหญ่ที่ไม่คุ้นเคย
- SWE-Bench Multilingual
- การแก้ issue แบบ SWE-Bench ในหลายภาษาโปรแกรม
- SWE-Bench Verified
- ชุดย่อยของ SWE-Bench ที่มนุษย์ตรวจสอบแล้ว: แก้ issue ให้การทดสอบที่ซ่อนไว้ผ่าน
การให้เหตุผล
- AIME 2026
- โจทย์จาก AIME ปี 2026
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: คำถามระดับผู้เชี่ยวชาญจากหลากหลายสาขา โดยไม่มีการใช้เครื่องมือ
- SciCode
- การเขียนโค้ดเพื่อแก้โจทย์วิทยาศาสตร์ระดับงานวิจัย
- CritPt (AA)
- โจทย์การใช้เหตุผลทางฟิสิกส์ระดับงานวิจัย ตามการทดสอบของ Artificial Analysis
- GPQA Diamond
- คำถามระดับบัณฑิตศึกษาในชีววิทยา เคมี และฟิสิกส์ ซึ่งออกแบบมาให้ค้นหาคำตอบได้ยาก
การเรียกใช้เครื่องมือและการค้นหา
- AutomationBench (public)
- การทำเวิร์กโฟลว์ทางธุรกิจหลายขั้นตอนในแอปต่าง ๆ ให้เป็นอัตโนมัติ
- MCP Atlas
- การใช้เครื่องมือที่เปิดให้ใช้งานผ่าน Model Context Protocol (MCP) ได้อย่างถูกต้อง
- τ³ banking
- บทสนทนาแนวบริการลูกค้าในโดเมนธนาคาร โดยใช้เครื่องมือและนโยบาย
- BrowseComp (context mgmt)
- การค้นหาข้อเท็จจริงที่หาได้ยากด้วยการท่องเว็บ พร้อมจัดการบริบท
- DeepSearchQA (context mgmt)
- คำถามวิจัยหลายขั้นตอนที่ต้องค้นหาและรวบรวมข้อมูลจากหลายแหล่ง
ความสามารถทั่วไป
- AA-LCR (long context)
- การใช้เหตุผลกับเอกสารที่ยาวมาก (การใช้เหตุผลกับบริบทยาวของ Artificial Analysis)
- LongBench v2
- การทำความเข้าใจและตอบคำถามจากอินพุตที่มีความยาว
- IFBench
- การทำตามคำสั่งด้านรูปแบบและเนื้อหาที่แม่นยำและตรวจสอบได้
- AA Omniscience index (public split)
- ความรู้ตามข้อเท็จจริง โดยมีบทลงโทษเมื่อให้คำตอบผิดอย่างมั่นใจ (หลอน)