Benchmarks
Beam-Benchmark-Ergebnisse
21 Benchmarks zu agentengestützter Programmierung, Reasoning, Tool-Nutzung und allgemeinen Fähigkeiten – genau so, wie Reflection sie veröffentlicht hat, im Vergleich mit sieben weiteren offenen Modellen.
Dies sind vom Anbieter gemeldete Werte aus der Ankündigung von Reflection (Tabelle aktualisiert am 8. Oktober 2026). Die Ergebnisse anderer Modelle stammen von Artificial Analysis und DataCurve, wie von Reflection angegeben. Unabhängige Reproduktionen folgen, sobald die Gewichte öffentlich sind.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Bester gemeldeter Wert in der Zeile— Nicht angegeben
Was die Zahlen aussagen
Beam ist besonders stark bei Softwareentwicklung. Das Modell erreicht 80.9 bei SWE-Bench Verified (vor Inkling mit 77.6) und 78.0 bei SWE-Bench Multilingual (vor Nemotron 3 Ultra mit 67.7) – Benchmarks, für die die größeren chinesischen Modelle keine Ergebnisse gemeldet haben. Außerdem liegt Beam bei SWE-Bench Pro v1 knapp vor GLM 5.2 (65.5 gegenüber 62.1) und bei MCP Atlas (78.7 gegenüber 77.8).
Beim reinen Reasoning liegt Beam etwas hinter den Spitzenreitern: 90.5 bei GPQA Diamond gegenüber 93.5 für Kimi K3 und 36.2 bei Humanity's Last Exam ohne Tools gegenüber 46.9.
Reflection behauptet nicht, dass Beam alles gewinnt, sondern dass das Modell nahe an die Spitzenreiter herankommt und dabei pro Antwort deutlich weniger Rechenleistung benötigt. Kimi K3, GLM 5.3 und Qwen 3.8 Max liegen bei den meisten Zeilen, für die sie Ergebnisse gemeldet haben, weiterhin vorn.
Was die einzelnen Benchmarks messen
Agentengestützte Programmierung und Terminal
- DeepSWE v1.1
- Langwierige Softwareentwicklungsaufgaben, die ein Agent von Anfang bis Ende löst.
- SWE-Bench Pro v2-Hard
- Der schwierige Teil von SWE-Bench Pro: knifflige Probleme aus realen Software-Repositories.
- SWE-Bench Pro v1
- Echte GitHub-Probleme aus professionellen Codebasen – schwieriger und weniger durch Trainingsdaten beeinflusst als der klassische SWE-Bench.
- Terminal-Bench v2.1
- Aufgaben in einem echten Linux-Terminal erledigen: Shell, Tools, Builds und Fehlersuche.
- SWE Atlas Codebase QnA
- Fragen zu großen, unbekannten Codebasen beantworten.
- SWE-Bench Multilingual
- Fehler im Stil von SWE-Bench in vielen Programmiersprachen beheben.
- SWE-Bench Verified
- Von Menschen geprüfte Teilmenge von SWE-Bench: Das Problem so beheben, dass die verborgenen Tests bestehen.
Reasoning
- AIME 2026
- Aufgaben aus der American Invitational Mathematics Examination 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: Expertenfragen aus vielen Fachgebieten ohne Tools beantworten.
- SciCode
- Code schreiben, um wissenschaftliche Probleme auf Forschungsniveau zu lösen.
- CritPt (AA)
- Physikalische Denkaufgaben auf Forschungsniveau, wie von Artificial Analysis durchgeführt.
- GPQA Diamond
- Fragen auf Hochschulniveau aus Biologie, Chemie und Physik, deren Antworten schwer nachzuschlagen sind.
Tool-Aufrufe und Suche
- AutomationBench (public)
- Mehrstufige Geschäftsabläufe über verschiedene Apps hinweg automatisieren.
- MCP Atlas
- Tools, die über das Model Context Protocol (MCP) bereitgestellt werden, korrekt verwenden.
- τ³ banking
- Kundendienstgespräche im Bankwesen mit Tools und Richtlinien führen.
- BrowseComp (context mgmt)
- Schwer auffindbare Fakten durch Websuche finden und dabei den Kontext verwalten.
- DeepSearchQA (context mgmt)
- Mehrstufige Forschungsfragen beantworten, die das Suchen und Zusammenführen von Quellen erfordern.
Allgemeine Fähigkeiten
- AA-LCR (long context)
- Über sehr lange Dokumente schlussfolgern (Langkontext-Schlussfolgern von Artificial Analysis).
- LongBench v2
- Lange Eingaben verstehen und Fragen dazu beantworten.
- IFBench
- Präzise, überprüfbare Formatierungs- und Inhaltsanweisungen befolgen.
- AA Omniscience index (public split)
- Faktenwissen mit Abzug für selbstsicher gegebene falsche Antworten (Halluzinationen).