Ga naar de inhoud
reflectionbeam

Benchmarks

Benchmarkresultaten van Beam

21 benchmarks voor agentic coding, redeneren, toolgebruik en algemene vaardigheden, precies zoals Reflection ze heeft gepubliceerd, naast zeven andere open modellen.

Dit zijn door de leverancier gerapporteerde cijfers uit de aankondiging van Reflection (tabel bijgewerkt op 8 oktober 2026). Scores voor andere modellen zijn afkomstig van Artificial Analysis en DataCurve, zoals vermeld door Reflection. Onafhankelijke reproducties volgen zodra de gewichten openbaar zijn.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Hoogste gerapporteerde score in de rij— Niet gerapporteerd

Wat de cijfers laten zien

Beam presteert het sterkst op het gebied van software-engineering. Het scoort 80.9 op SWE-Bench Verified (hoger dan de 77.6 van Inkling) en 78.0 op SWE-Bench Multilingual (hoger dan de 67.7 van Nemotron 3 Ultra). De grotere Chinese modellen rapporteerden geen scores voor deze benchmarks. Ook scoort Beam iets hoger dan GLM 5.2 op SWE-Bench Pro v1 (65.5 tegenover 62.1) en op MCP Atlas (78.7 tegenover 77.8).

Bij puur redeneren blijft Beam iets achter bij de koplopers: 90.5 op GPQA Diamond tegenover 93.5 voor Kimi K3, en 36.2 op Humanity's Last Exam zonder tools tegenover 46.9.

Reflection stelt niet dat Beam overal wint, maar dat het dicht bij de koplopers komt en daarbij veel minder rekenkracht per antwoord gebruikt. Kimi K3, GLM 5.3 en Qwen 3.8 Max staan nog steeds bovenaan in de meeste rijen waarvoor ze resultaten hebben gerapporteerd.

Wat elke benchmark meet

Agentic coding en terminalgebruik

DeepSWE v1.1
Langdurige software-engineeringtaken die een agent van begin tot eind oplost.
SWE-Bench Pro v2-Hard
De moeilijke split van SWE-Bench Pro: lastige problemen uit echte softwareopslagplaatsen.
SWE-Bench Pro v1
Echte GitHub-problemen uit professionele codebases, moeilijker en minder gevoelig voor contaminatie dan de klassieke SWE-Bench.
Terminal-Bench v2.1
Taken uitvoeren in een echte Linux-terminal: shell, tools, builds en foutopsporing.
SWE Atlas Codebase QnA
Vragen beantwoorden over grote, onbekende codebases.
SWE-Bench Multilingual
SWE-Bench-stijlproblemen oplossen in veel programmeertalen.
SWE-Bench Verified
Door mensen geverifieerde subset van SWE-Bench: los het probleem op zodat de verborgen tests slagen.

Redeneren

AIME 2026
Opgaven uit het American Invitational Mathematics Examination van 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: vragen op expertniveau uit allerlei vakgebieden beantwoorden zonder hulpmiddelen.
SciCode
Code schrijven om wetenschappelijke problemen op onderzoeksniveau op te lossen.
CritPt (AA)
Natuurkundige redeneerproblemen op onderzoeksniveau, zoals uitgevoerd door Artificial Analysis.
GPQA Diamond
Biologie-, scheikunde- en natuurkundevragen op masterniveau die lastig op te zoeken zijn.

Tools aanroepen en zoeken

AutomationBench (public)
Meerfasige bedrijfsworkflows in verschillende apps automatiseren.
MCP Atlas
Hulpmiddelen die beschikbaar zijn via het Model Context Protocol (MCP) correct gebruiken.
τ³ banking
Klantenservicegesprekken in de banksector voeren met hulpmiddelen en beleidsregels.
BrowseComp (context mgmt)
Moeilijk vindbare feiten opsporen door op het web te zoeken, met beheer van de context.
DeepSearchQA (context mgmt)
Meerfasige onderzoeksvragen beantwoorden waarvoor bronnen moeten worden opgezocht en gecombineerd.

Algemene mogelijkheden

AA-LCR (long context)
Redeneren over zeer lange documenten (redeneren met lange context van Artificial Analysis).
LongBench v2
Vragen over lange invoer begrijpen en beantwoorden.
IFBench
Nauwkeurige, verifieerbare instructies voor opmaak en inhoud volgen.
AA Omniscience index (public split)
Feitelijke kennis met een straf voor zelfverzekerde onjuiste antwoorden (hallucinaties).