Zum Inhalt springen
reflectionbeam

Benchmarks

Beam-Benchmark-Ergebnisse

21 Benchmarks zu agentengestützter Programmierung, Reasoning, Tool-Nutzung und allgemeinen Fähigkeiten – genau so, wie Reflection sie veröffentlicht hat, im Vergleich mit sieben weiteren offenen Modellen.

Dies sind vom Anbieter gemeldete Werte aus der Ankündigung von Reflection (Tabelle aktualisiert am 8. Oktober 2026). Die Ergebnisse anderer Modelle stammen von Artificial Analysis und DataCurve, wie von Reflection angegeben. Unabhängige Reproduktionen folgen, sobald die Gewichte öffentlich sind.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Bester gemeldeter Wert in der Zeile— Nicht angegeben

Was die Zahlen aussagen

Beam ist besonders stark bei Softwareentwicklung. Das Modell erreicht 80.9 bei SWE-Bench Verified (vor Inkling mit 77.6) und 78.0 bei SWE-Bench Multilingual (vor Nemotron 3 Ultra mit 67.7) – Benchmarks, für die die größeren chinesischen Modelle keine Ergebnisse gemeldet haben. Außerdem liegt Beam bei SWE-Bench Pro v1 knapp vor GLM 5.2 (65.5 gegenüber 62.1) und bei MCP Atlas (78.7 gegenüber 77.8).

Beim reinen Reasoning liegt Beam etwas hinter den Spitzenreitern: 90.5 bei GPQA Diamond gegenüber 93.5 für Kimi K3 und 36.2 bei Humanity's Last Exam ohne Tools gegenüber 46.9.

Reflection behauptet nicht, dass Beam alles gewinnt, sondern dass das Modell nahe an die Spitzenreiter herankommt und dabei pro Antwort deutlich weniger Rechenleistung benötigt. Kimi K3, GLM 5.3 und Qwen 3.8 Max liegen bei den meisten Zeilen, für die sie Ergebnisse gemeldet haben, weiterhin vorn.

Was die einzelnen Benchmarks messen

Agentengestützte Programmierung und Terminal

DeepSWE v1.1
Langwierige Softwareentwicklungsaufgaben, die ein Agent von Anfang bis Ende löst.
SWE-Bench Pro v2-Hard
Der schwierige Teil von SWE-Bench Pro: knifflige Probleme aus realen Software-Repositories.
SWE-Bench Pro v1
Echte GitHub-Probleme aus professionellen Codebasen – schwieriger und weniger durch Trainingsdaten beeinflusst als der klassische SWE-Bench.
Terminal-Bench v2.1
Aufgaben in einem echten Linux-Terminal erledigen: Shell, Tools, Builds und Fehlersuche.
SWE Atlas Codebase QnA
Fragen zu großen, unbekannten Codebasen beantworten.
SWE-Bench Multilingual
Fehler im Stil von SWE-Bench in vielen Programmiersprachen beheben.
SWE-Bench Verified
Von Menschen geprüfte Teilmenge von SWE-Bench: Das Problem so beheben, dass die verborgenen Tests bestehen.

Reasoning

AIME 2026
Aufgaben aus der American Invitational Mathematics Examination 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: Expertenfragen aus vielen Fachgebieten ohne Tools beantworten.
SciCode
Code schreiben, um wissenschaftliche Probleme auf Forschungsniveau zu lösen.
CritPt (AA)
Physikalische Denkaufgaben auf Forschungsniveau, wie von Artificial Analysis durchgeführt.
GPQA Diamond
Fragen auf Hochschulniveau aus Biologie, Chemie und Physik, deren Antworten schwer nachzuschlagen sind.

Tool-Aufrufe und Suche

AutomationBench (public)
Mehrstufige Geschäftsabläufe über verschiedene Apps hinweg automatisieren.
MCP Atlas
Tools, die über das Model Context Protocol (MCP) bereitgestellt werden, korrekt verwenden.
τ³ banking
Kundendienstgespräche im Bankwesen mit Tools und Richtlinien führen.
BrowseComp (context mgmt)
Schwer auffindbare Fakten durch Websuche finden und dabei den Kontext verwalten.
DeepSearchQA (context mgmt)
Mehrstufige Forschungsfragen beantworten, die das Suchen und Zusammenführen von Quellen erfordern.

Allgemeine Fähigkeiten

AA-LCR (long context)
Über sehr lange Dokumente schlussfolgern (Langkontext-Schlussfolgern von Artificial Analysis).
LongBench v2
Lange Eingaben verstehen und Fragen dazu beantworten.
IFBench
Präzise, überprüfbare Formatierungs- und Inhaltsanweisungen befolgen.
AA Omniscience index (public split)
Faktenwissen mit Abzug für selbstsicher gegebene falsche Antworten (Halluzinationen).