Lumaktaw sa nilalaman
reflectionbeam

Mga benchmark

Mga resulta ng benchmark ng Beam

21 benchmark sa agentic coding, pangangatwiran, paggamit ng tool at pangkalahatang kakayahan, eksaktong gaya ng pagkakalathala ng Reflection, katabi ng mga resulta ng pitong iba pang open model.

Mga numerong iniulat ng vendor ang mga ito mula sa anunsyo ng Reflection (na-update ang talahanayan noong October 8, 2026). Ang mga score ng ibang modelo ay mula sa Artificial Analysis at DataCurve, ayon sa pagsipi ng Reflection. Susunod ang mga independiyenteng pagsubok kapag pampubliko na ang mga weight.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4——44.061.068.051.074.2
SWE-Bench Pro v2-Hard77.256.9——84.388.2——
SWE-Bench Pro v165.554.346.462.1——67.7—
Terminal-Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6———61.068.0——
SWE-Bench Multilingual78.0—67.7—————
SWE-Bench Verified80.977.670.7—————
AIME 202697.897.1—99.2————
Humanity's Last Exam (no tools)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6—59.058.752.152.0
CritPt (AA)16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.287.091.291.793.592.690.9
AutomationBench (public)37.0——26.248.246.739.854.8
MCP Atlas78.776.063.177.884.282.384.5—
τ³ banking38.025.022.637.1—37.155.2—
BrowseComp (context mgmt)77.477.144.4——91.2——
DeepSearchQA (context mgmt)80.1————95.0——
AA-LCR (long context)79.377.379.378.379.788.780.384.0
LongBench v265.5—61.964.0——66.3—
IFBench79.779.881.773.3——82.8—
AA Omniscience index (public split)13.014.28.6—22.6——6.6

00.0 Pinakamataas na iniulat na score sa hanay— Hindi iniulat

Ano ang sinasabi ng mga numero

Pinakamahusay ang Beam sa software engineering. Nakakuha ito ng 80.9 sa SWE-Bench Verified (mas mataas kaysa 77.6 ng Inkling) at 78.0 sa SWE-Bench Multilingual (mas mataas kaysa 67.7 ng Nemotron 3 Ultra). Hindi iniulat ng mas malalaking modelong Tsino ang mga benchmark na ito, at bahagyang mas mataas din ang score nito kaysa GLM 5.2 sa SWE-Bench Pro v1 (65.5 kumpara sa 62.1) at MCP Atlas (78.7 kumpara sa 77.8).

Sa purong pangangatwiran, bahagya itong nahuhuli sa mga nangunguna: 90.5 sa GPQA Diamond kumpara sa 93.5 ng Kimi K3, at 36.2 sa Humanity's Last Exam nang walang mga tool kumpara sa 46.9.

Hindi sinasabi ng Reflection na panalo ang Beam sa lahat, kundi nakakasabay ito habang mas kaunti ang compute na ginagamit sa bawat sagot. Nangunguna pa rin ang Kimi K3, GLM 5.3 at Qwen 3.8 Max sa karamihan ng mga hanay kung saan iniulat nila ang mga resulta.

Ano ang sinusukat ng bawat benchmark

Agentic coding at terminal

DeepSWE v1.1
Mga gawaing software engineering na may mahabang proseso at nilulutas ng isang ahente mula simula hanggang dulo.
SWE-Bench Pro v2-Hard
Ang mahirap na bahagi ng SWE-Bench Pro: mahihirap na isyu sa mga repositoryo mula sa totoong mundo.
SWE-Bench Pro v1
Mga totoong isyu sa GitHub mula sa mga propesyonal na codebase, na mas mahirap at hindi gaanong nalantad sa datos ng pagsasanay kaysa sa klasikong SWE-Bench.
Terminal-Bench v2.1
Pagtapos ng mga gawain sa isang totoong Linux terminal: shell, mga tool, build at pag-debug.
SWE Atlas Codebase QnA
Pagsagot sa mga tanong tungkol sa malalaki at hindi pamilyar na codebase.
SWE-Bench Multilingual
Pag-aayos ng mga isyu sa maraming programming language na kahawig ng SWE-Bench.
SWE-Bench Verified
Bahaging na-verify ng tao ng SWE-Bench: ayusin ang isyu para pumasa ang mga nakatagong test.

Pangangatwiran

AIME 2026
Mga problema mula sa 2026 American Invitational Mathematics Examination.
Humanity's Last Exam (no tools)
Humanity's Last Exam: mga tanong na antas-eksperto sa iba't ibang larangan, sinasagot nang walang mga tool.
SciCode
Pagsulat ng code para lutasin ang mga problemang pang-agham na antas-pananaliksik.
CritPt (AA)
Mga problema sa pangangatwirang pisika na antas-pananaliksik, gaya ng isinagawa ng Artificial Analysis.
GPQA Diamond
Mga tanong sa biyolohiya, kimika at pisika na antas-gradwado, na sadyang mahirap hanapan ng sagot.

Pagtawag sa tool at paghahanap

AutomationBench (public)
Pag-automate ng mga workflow sa negosyo na may maraming hakbang sa iba't ibang app.
MCP Atlas
Tamang paggamit ng mga tool na inilalantad sa pamamagitan ng Model Context Protocol (MCP).
τ³ banking
Mga pag-uusap na kahawig ng serbisyo sa customer sa larangan ng pagbabangko, gamit ang mga tool at patakaran.
BrowseComp (context mgmt)
Paghahanap ng mahirap matagpuang impormasyon sa pamamagitan ng pag-browse sa web at pamamahala ng konteksto.
DeepSearchQA (context mgmt)
Mga tanong sa pananaliksik na may maraming hakbang, na nangangailangan ng paghahanap at pagsasama-sama ng mga source.

Mga pangkalahatang kakayahan

AA-LCR (long context)
Pangangatwiran batay sa napakahahabang dokumento (pangangatwiran sa mahabang konteksto ng Artificial Analysis).
LongBench v2
Pag-unawa at pagsagot sa mga tanong batay sa mahahabang input.
IFBench
Pagsunod sa tumpak at nabe-verify na mga tagubilin sa format at nilalaman.
AA Omniscience index (public split)
Kaalamang makatotohanan na may parusa sa mga maling sagot na ipinahayag nang may kumpiyansa (mga halusinasyon).