Benchmark
Kết quả benchmark của Beam
21 benchmark về lập trình tác tử, suy luận, sử dụng công cụ và năng lực tổng quát, đúng như Reflection công bố, đặt cạnh bảy mô hình mở khác.
Đây là các số liệu do nhà cung cấp công bố trong thông báo của Reflection (bảng được cập nhật ngày 8 tháng 10, 2026). Điểm của các mô hình khác lấy từ Artificial Analysis và DataCurve, theo trích dẫn của Reflection. Các kết quả tái lập độc lập sẽ được cập nhật sau khi trọng số được công khai.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Điểm cao nhất được báo cáo trong hàng— Chưa có số liệu
Các con số cho thấy điều gì
Beam mạnh nhất ở kỹ thuật phần mềm. Mô hình đạt 80.9 trên SWE-Bench Verified (cao hơn Inkling với 77.6) và 78.0 trên SWE-Bench Multilingual (cao hơn Nemotron 3 Ultra với 67.7), hai benchmark mà các mô hình Trung Quốc lớn hơn không báo cáo kết quả; đồng thời Beam nhỉnh hơn GLM 5.2 trên SWE-Bench Pro v1 (65.5 so với 62.1) và MCP Atlas (78.7 so với 77.8).
Về suy luận thuần túy, Beam hơi kém các mô hình dẫn đầu: đạt 90.5 trên GPQA Diamond so với 93.5 của Kimi K3, và 36.2 trên Humanity's Last Exam khi không dùng công cụ so với 46.9.
Lập luận của Reflection không phải là Beam chiến thắng ở mọi mặt, mà là mô hình đạt kết quả gần ngang bằng trong khi tiêu tốn ít năng lực tính toán hơn nhiều cho mỗi câu trả lời. Kimi K3, GLM 5.3 và Qwen 3.8 Max vẫn dẫn đầu ở hầu hết các hàng có báo cáo kết quả.
Mỗi benchmark đo lường điều gì
Lập trình tác tử & thiết bị đầu cuối
- DeepSWE v1.1
- Các tác vụ kỹ thuật phần mềm kéo dài, được một tác tử giải quyết từ đầu đến cuối.
- SWE-Bench Pro v2-Hard
- Phần dữ liệu khó của SWE-Bench Pro: các vấn đề thực tế phức tạp trong kho mã nguồn.
- SWE-Bench Pro v1
- Các vấn đề thực tế trên GitHub từ những cơ sở mã chuyên nghiệp, khó hơn và ít bị nhiễm dữ liệu hơn SWE-Bench cổ điển.
- Terminal-Bench v2.1
- Hoàn thành tác vụ trong môi trường thiết bị đầu cuối Linux thực tế: shell, công cụ, biên dịch và gỡ lỗi.
- SWE Atlas Codebase QnA
- Trả lời câu hỏi về các cơ sở mã lớn và ít quen thuộc.
- SWE-Bench Multilingual
- Sửa lỗi theo phong cách SWE-Bench trên nhiều ngôn ngữ lập trình.
- SWE-Bench Verified
- Tập con SWE-Bench được con người xác minh: sửa lỗi để các bài kiểm thử ẩn đạt yêu cầu.
Suy luận
- AIME 2026
- Các bài toán trong kỳ thi American Invitational Mathematics Examination năm 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: câu hỏi cấp chuyên gia trên nhiều lĩnh vực, trả lời không dùng công cụ.
- SciCode
- Viết mã để giải các bài toán khoa học cấp độ nghiên cứu.
- CritPt (AA)
- Các bài toán suy luận vật lý cấp độ nghiên cứu, theo bài đánh giá của Artificial Analysis.
- GPQA Diamond
- Câu hỏi cấp độ sau đại học về sinh học, hóa học và vật lý, được thiết kế để khó tra cứu.
Gọi công cụ & tìm kiếm
- AutomationBench (public)
- Tự động hóa quy trình kinh doanh nhiều bước trên các ứng dụng.
- MCP Atlas
- Sử dụng chính xác các công cụ được cung cấp qua Model Context Protocol (MCP).
- τ³ banking
- Các cuộc hội thoại theo phong cách dịch vụ khách hàng trong lĩnh vực ngân hàng, có sử dụng công cụ và chính sách.
- BrowseComp (context mgmt)
- Tìm thông tin khó tra cứu bằng cách duyệt web và quản lý ngữ cảnh.
- DeepSearchQA (context mgmt)
- Các câu hỏi nghiên cứu nhiều bước đòi hỏi tìm kiếm và kết hợp nhiều nguồn.
Năng lực tổng quát
- AA-LCR (long context)
- Suy luận trên các tài liệu rất dài (khả năng suy luận ngữ cảnh dài của Artificial Analysis).
- LongBench v2
- Hiểu và trả lời câu hỏi dựa trên đầu vào dài.
- IFBench
- Tuân thủ các hướng dẫn chính xác, có thể xác minh về định dạng và nội dung.
- AA Omniscience index (public split)
- Kiến thức thực tế với hình phạt cho câu trả lời sai nhưng được khẳng định chắc chắn (ảo giác).