ข้ามไปยังเนื้อหา
reflectionbeam

ผลการทดสอบ

ผล benchmark ของ Beam

21 benchmark ครอบคลุมการเขียนโค้ดแบบเอเจนต์ การใช้เหตุผล การใช้เครื่องมือ และทักษะทั่วไป ตามที่ Reflection เผยแพร่ทุกประการ พร้อมเปรียบเทียบกับโมเดลแบบเปิดอีกเจ็ดรุ่น

ตัวเลขเหล่านี้เป็นผลที่ผู้พัฒนารายงานจากประกาศของ Reflection (อัปเดตตารางเมื่อ October 8, 2026) คะแนนของโมเดลอื่นมาจาก Artificial Analysis และ DataCurve ตามที่ Reflection อ้างอิงไว้ จะมีผลการทดสอบซ้ำโดยอิสระตามมาเมื่อเปิดเผย weights สู่สาธารณะ

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4——44.061.068.051.074.2
SWE-Bench Pro v2-Hard77.256.9——84.388.2——
SWE-Bench Pro v165.554.346.462.1——67.7—
Terminal-Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6———61.068.0——
SWE-Bench Multilingual78.0—67.7—————
SWE-Bench Verified80.977.670.7—————
AIME 202697.897.1—99.2————
Humanity's Last Exam (no tools)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6—59.058.752.152.0
CritPt (AA)16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.287.091.291.793.592.690.9
AutomationBench (public)37.0——26.248.246.739.854.8
MCP Atlas78.776.063.177.884.282.384.5—
τ³ banking38.025.022.637.1—37.155.2—
BrowseComp (context mgmt)77.477.144.4——91.2——
DeepSearchQA (context mgmt)80.1————95.0——
AA-LCR (long context)79.377.379.378.379.788.780.384.0
LongBench v265.5—61.964.0——66.3—
IFBench79.779.881.773.3——82.8—
AA Omniscience index (public split)13.014.28.6—22.6——6.6

00.0 คะแนนที่รายงานสูงสุดในแถว— ไม่มีการรายงาน

ตัวเลขบอกอะไร

Beam ทำผลงานได้ดีที่สุดด้านวิศวกรรมซอฟต์แวร์ โดยได้ 80.9 ใน SWE-Bench Verified (เหนือกว่า Inkling ที่ได้ 77.6) และ 78.0 ใน SWE-Bench Multilingual (เหนือกว่า Nemotron 3 Ultra ที่ได้ 67.7) ซึ่งเป็น benchmark ที่โมเดลจีนขนาดใหญ่กว่าไม่ได้รายงานผล อีกทั้งยังทำคะแนนนำ GLM 5.2 เล็กน้อยใน SWE-Bench Pro v1 (65.5 เทียบกับ 62.1) และ MCP Atlas (78.7 เทียบกับ 77.8)

ด้านการใช้เหตุผลล้วน ๆ Beam ตามหลังผู้นำอยู่เล็กน้อย โดยได้ 90.5 ใน GPQA Diamond เทียบกับ 93.5 ของ Kimi K3 และ 36.2 ใน Humanity's Last Exam เมื่อไม่มีเครื่องมือ เทียบกับ 46.9

Reflection ไม่ได้อ้างว่า Beam ชนะทุกด้าน แต่ชี้ว่า Beam ทำคะแนนได้ใกล้เคียง ขณะที่ใช้กำลังประมวลผลต่อคำตอบน้อยกว่ามาก Kimi K3, GLM 5.3 และ Qwen 3.8 Max ยังคงนำในแถวส่วนใหญ่ที่มีการรายงานผล

แต่ละ benchmark วัดอะไร

การเขียนโค้ดแบบเอเจนต์และเทอร์มินัล

DeepSWE v1.1
งานวิศวกรรมซอฟต์แวร์ที่มีหลายขั้นตอน ซึ่งเอเจนต์ต้องทำให้เสร็จตั้งแต่ต้นจนจบ
SWE-Bench Pro v2-Hard
ชุดทดสอบส่วนที่ยากของ SWE-Bench Pro: ปัญหาใน repository จริงที่ยากและท้าทาย
SWE-Bench Pro v1
ปัญหาจริงจาก GitHub ใน codebase ระดับมืออาชีพ ซึ่งยากกว่าและมีข้อมูลรั่วไหลน้อยกว่า SWE-Bench รุ่นดั้งเดิม
Terminal-Bench v2.1
การทำงานให้เสร็จภายในเทอร์มินัล Linux จริง ทั้งการใช้ shell เครื่องมือ การ build และการดีบัก
SWE Atlas Codebase QnA
การตอบคำถามเกี่ยวกับ codebase ขนาดใหญ่ที่ไม่คุ้นเคย
SWE-Bench Multilingual
การแก้ issue แบบ SWE-Bench ในหลายภาษาโปรแกรม
SWE-Bench Verified
ชุดย่อยของ SWE-Bench ที่มนุษย์ตรวจสอบแล้ว: แก้ issue ให้การทดสอบที่ซ่อนไว้ผ่าน

การให้เหตุผล

AIME 2026
โจทย์จาก AIME ปี 2026
Humanity's Last Exam (no tools)
Humanity's Last Exam: คำถามระดับผู้เชี่ยวชาญจากหลากหลายสาขา โดยไม่มีการใช้เครื่องมือ
SciCode
การเขียนโค้ดเพื่อแก้โจทย์วิทยาศาสตร์ระดับงานวิจัย
CritPt (AA)
โจทย์การใช้เหตุผลทางฟิสิกส์ระดับงานวิจัย ตามการทดสอบของ Artificial Analysis
GPQA Diamond
คำถามระดับบัณฑิตศึกษาในชีววิทยา เคมี และฟิสิกส์ ซึ่งออกแบบมาให้ค้นหาคำตอบได้ยาก

การเรียกใช้เครื่องมือและการค้นหา

AutomationBench (public)
การทำเวิร์กโฟลว์ทางธุรกิจหลายขั้นตอนในแอปต่าง ๆ ให้เป็นอัตโนมัติ
MCP Atlas
การใช้เครื่องมือที่เปิดให้ใช้งานผ่าน Model Context Protocol (MCP) ได้อย่างถูกต้อง
τ³ banking
บทสนทนาแนวบริการลูกค้าในโดเมนธนาคาร โดยใช้เครื่องมือและนโยบาย
BrowseComp (context mgmt)
การค้นหาข้อเท็จจริงที่หาได้ยากด้วยการท่องเว็บ พร้อมจัดการบริบท
DeepSearchQA (context mgmt)
คำถามวิจัยหลายขั้นตอนที่ต้องค้นหาและรวบรวมข้อมูลจากหลายแหล่ง

ความสามารถทั่วไป

AA-LCR (long context)
การใช้เหตุผลกับเอกสารที่ยาวมาก (การใช้เหตุผลกับบริบทยาวของ Artificial Analysis)
LongBench v2
การทำความเข้าใจและตอบคำถามจากอินพุตที่มีความยาว
IFBench
การทำตามคำสั่งด้านรูปแบบและเนื้อหาที่แม่นยำและตรวจสอบได้
AA Omniscience index (public split)
ความรู้ตามข้อเท็จจริง โดยมีบทลงโทษเมื่อให้คำตอบผิดอย่างมั่นใจ (หลอน)