Benchmarks
Benchmarkresultaten van Beam
21 benchmarks voor agentic coding, redeneren, toolgebruik en algemene vaardigheden, precies zoals Reflection ze heeft gepubliceerd, naast zeven andere open modellen.
Dit zijn door de leverancier gerapporteerde cijfers uit de aankondiging van Reflection (tabel bijgewerkt op 8 oktober 2026). Scores voor andere modellen zijn afkomstig van Artificial Analysis en DataCurve, zoals vermeld door Reflection. Onafhankelijke reproducties volgen zodra de gewichten openbaar zijn.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Hoogste gerapporteerde score in de rij— Niet gerapporteerd
Wat de cijfers laten zien
Beam presteert het sterkst op het gebied van software-engineering. Het scoort 80.9 op SWE-Bench Verified (hoger dan de 77.6 van Inkling) en 78.0 op SWE-Bench Multilingual (hoger dan de 67.7 van Nemotron 3 Ultra). De grotere Chinese modellen rapporteerden geen scores voor deze benchmarks. Ook scoort Beam iets hoger dan GLM 5.2 op SWE-Bench Pro v1 (65.5 tegenover 62.1) en op MCP Atlas (78.7 tegenover 77.8).
Bij puur redeneren blijft Beam iets achter bij de koplopers: 90.5 op GPQA Diamond tegenover 93.5 voor Kimi K3, en 36.2 op Humanity's Last Exam zonder tools tegenover 46.9.
Reflection stelt niet dat Beam overal wint, maar dat het dicht bij de koplopers komt en daarbij veel minder rekenkracht per antwoord gebruikt. Kimi K3, GLM 5.3 en Qwen 3.8 Max staan nog steeds bovenaan in de meeste rijen waarvoor ze resultaten hebben gerapporteerd.
Wat elke benchmark meet
Agentic coding en terminalgebruik
- DeepSWE v1.1
- Langdurige software-engineeringtaken die een agent van begin tot eind oplost.
- SWE-Bench Pro v2-Hard
- De moeilijke split van SWE-Bench Pro: lastige problemen uit echte softwareopslagplaatsen.
- SWE-Bench Pro v1
- Echte GitHub-problemen uit professionele codebases, moeilijker en minder gevoelig voor contaminatie dan de klassieke SWE-Bench.
- Terminal-Bench v2.1
- Taken uitvoeren in een echte Linux-terminal: shell, tools, builds en foutopsporing.
- SWE Atlas Codebase QnA
- Vragen beantwoorden over grote, onbekende codebases.
- SWE-Bench Multilingual
- SWE-Bench-stijlproblemen oplossen in veel programmeertalen.
- SWE-Bench Verified
- Door mensen geverifieerde subset van SWE-Bench: los het probleem op zodat de verborgen tests slagen.
Redeneren
- AIME 2026
- Opgaven uit het American Invitational Mathematics Examination van 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: vragen op expertniveau uit allerlei vakgebieden beantwoorden zonder hulpmiddelen.
- SciCode
- Code schrijven om wetenschappelijke problemen op onderzoeksniveau op te lossen.
- CritPt (AA)
- Natuurkundige redeneerproblemen op onderzoeksniveau, zoals uitgevoerd door Artificial Analysis.
- GPQA Diamond
- Biologie-, scheikunde- en natuurkundevragen op masterniveau die lastig op te zoeken zijn.
Tools aanroepen en zoeken
- AutomationBench (public)
- Meerfasige bedrijfsworkflows in verschillende apps automatiseren.
- MCP Atlas
- Hulpmiddelen die beschikbaar zijn via het Model Context Protocol (MCP) correct gebruiken.
- τ³ banking
- Klantenservicegesprekken in de banksector voeren met hulpmiddelen en beleidsregels.
- BrowseComp (context mgmt)
- Moeilijk vindbare feiten opsporen door op het web te zoeken, met beheer van de context.
- DeepSearchQA (context mgmt)
- Meerfasige onderzoeksvragen beantwoorden waarvoor bronnen moeten worden opgezocht en gecombineerd.
Algemene mogelijkheden
- AA-LCR (long context)
- Redeneren over zeer lange documenten (redeneren met lange context van Artificial Analysis).
- LongBench v2
- Vragen over lange invoer begrijpen en beantwoorden.
- IFBench
- Nauwkeurige, verifieerbare instructies voor opmaak en inhoud volgen.
- AA Omniscience index (public split)
- Feitelijke kennis met een straf voor zelfverzekerde onjuiste antwoorden (hallucinaties).