Chuyển đến nội dung
reflectionbeam

Benchmark

Kết quả benchmark của Beam

21 benchmark về lập trình tác tử, suy luận, sử dụng công cụ và năng lực tổng quát, đúng như Reflection công bố, đặt cạnh bảy mô hình mở khác.

Đây là các số liệu do nhà cung cấp công bố trong thông báo của Reflection (bảng được cập nhật ngày 8 tháng 10, 2026). Điểm của các mô hình khác lấy từ Artificial Analysis và DataCurve, theo trích dẫn của Reflection. Các kết quả tái lập độc lập sẽ được cập nhật sau khi trọng số được công khai.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Điểm cao nhất được báo cáo trong hàng— Chưa có số liệu

Các con số cho thấy điều gì

Beam mạnh nhất ở kỹ thuật phần mềm. Mô hình đạt 80.9 trên SWE-Bench Verified (cao hơn Inkling với 77.6) và 78.0 trên SWE-Bench Multilingual (cao hơn Nemotron 3 Ultra với 67.7), hai benchmark mà các mô hình Trung Quốc lớn hơn không báo cáo kết quả; đồng thời Beam nhỉnh hơn GLM 5.2 trên SWE-Bench Pro v1 (65.5 so với 62.1) và MCP Atlas (78.7 so với 77.8).

Về suy luận thuần túy, Beam hơi kém các mô hình dẫn đầu: đạt 90.5 trên GPQA Diamond so với 93.5 của Kimi K3, và 36.2 trên Humanity's Last Exam khi không dùng công cụ so với 46.9.

Lập luận của Reflection không phải là Beam chiến thắng ở mọi mặt, mà là mô hình đạt kết quả gần ngang bằng trong khi tiêu tốn ít năng lực tính toán hơn nhiều cho mỗi câu trả lời. Kimi K3, GLM 5.3 và Qwen 3.8 Max vẫn dẫn đầu ở hầu hết các hàng có báo cáo kết quả.

Mỗi benchmark đo lường điều gì

Lập trình tác tử & thiết bị đầu cuối

DeepSWE v1.1
Các tác vụ kỹ thuật phần mềm kéo dài, được một tác tử giải quyết từ đầu đến cuối.
SWE-Bench Pro v2-Hard
Phần dữ liệu khó của SWE-Bench Pro: các vấn đề thực tế phức tạp trong kho mã nguồn.
SWE-Bench Pro v1
Các vấn đề thực tế trên GitHub từ những cơ sở mã chuyên nghiệp, khó hơn và ít bị nhiễm dữ liệu hơn SWE-Bench cổ điển.
Terminal-Bench v2.1
Hoàn thành tác vụ trong môi trường thiết bị đầu cuối Linux thực tế: shell, công cụ, biên dịch và gỡ lỗi.
SWE Atlas Codebase QnA
Trả lời câu hỏi về các cơ sở mã lớn và ít quen thuộc.
SWE-Bench Multilingual
Sửa lỗi theo phong cách SWE-Bench trên nhiều ngôn ngữ lập trình.
SWE-Bench Verified
Tập con SWE-Bench được con người xác minh: sửa lỗi để các bài kiểm thử ẩn đạt yêu cầu.

Suy luận

AIME 2026
Các bài toán trong kỳ thi American Invitational Mathematics Examination năm 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: câu hỏi cấp chuyên gia trên nhiều lĩnh vực, trả lời không dùng công cụ.
SciCode
Viết mã để giải các bài toán khoa học cấp độ nghiên cứu.
CritPt (AA)
Các bài toán suy luận vật lý cấp độ nghiên cứu, theo bài đánh giá của Artificial Analysis.
GPQA Diamond
Câu hỏi cấp độ sau đại học về sinh học, hóa học và vật lý, được thiết kế để khó tra cứu.

Gọi công cụ & tìm kiếm

AutomationBench (public)
Tự động hóa quy trình kinh doanh nhiều bước trên các ứng dụng.
MCP Atlas
Sử dụng chính xác các công cụ được cung cấp qua Model Context Protocol (MCP).
τ³ banking
Các cuộc hội thoại theo phong cách dịch vụ khách hàng trong lĩnh vực ngân hàng, có sử dụng công cụ và chính sách.
BrowseComp (context mgmt)
Tìm thông tin khó tra cứu bằng cách duyệt web và quản lý ngữ cảnh.
DeepSearchQA (context mgmt)
Các câu hỏi nghiên cứu nhiều bước đòi hỏi tìm kiếm và kết hợp nhiều nguồn.

Năng lực tổng quát

AA-LCR (long context)
Suy luận trên các tài liệu rất dài (khả năng suy luận ngữ cảnh dài của Artificial Analysis).
LongBench v2
Hiểu và trả lời câu hỏi dựa trên đầu vào dài.
IFBench
Tuân thủ các hướng dẫn chính xác, có thể xác minh về định dạng và nội dung.
AA Omniscience index (public split)
Kiến thức thực tế với hình phạt cho câu trả lời sai nhưng được khẳng định chắc chắn (ảo giác).