Przejdź do treści
reflectionbeam

Benchmarki

Wyniki testów porównawczych Beam

21 testów obejmujących programowanie agentowe, rozumowanie, użycie narzędzi i ogólne umiejętności. Wyniki dokładnie takie, jak opublikowała je Reflection, zestawione z wynikami siedmiu innych otwartych modeli.

Są to wyniki podane przez producentów w ogłoszeniu Reflection (tabela zaktualizowana 8 października 2026 r.). Wyniki innych modeli pochodzą z Artificial Analysis i DataCurve, zgodnie z cytowaniami Reflection. Niezależne odtworzenia wyników pojawią się, gdy wagi będą publicznie dostępne.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Najlepszy zgłoszony wynik w wierszu— Nie zgłoszono

Co mówią wyniki

Beam najlepiej wypada w inżynierii oprogramowania. Uzyskuje 80.9 w SWE-Bench Verified (więcej niż Inkling z wynikiem 77.6) i 78.0 w SWE-Bench Multilingual (więcej niż Nemotron 3 Ultra z wynikiem 67.7) — w testach, dla których większe chińskie modele nie podały wyników. Wyprzedza też GLM 5.2 w SWE-Bench Pro v1 (65.5 wobec 62.1) i MCP Atlas (78.7 wobec 77.8).

W samym rozumowaniu plasuje się nieco za liderami: uzyskuje 90.5 w GPQA Diamond wobec 93.5 dla Kimi K3 oraz 36.2 w Humanity's Last Exam bez użycia narzędzi wobec 46.9.

Reflection nie twierdzi, że Beam wygrywa we wszystkim, lecz że osiąga zbliżone wyniki, zużywając znacznie mniej mocy obliczeniowej na każdą odpowiedź. Kimi K3, GLM 5.3 i Qwen 3.8 Max nadal prowadzą w większości kategorii, w których podały wyniki.

Co mierzy każdy test porównawczy

Programowanie agentowe i terminal

DeepSWE v1.1
Złożone, wieloetapowe zadania z zakresu inżynierii oprogramowania, rozwiązywane przez agenta od początku do końca.
SWE-Bench Pro v2-Hard
Trudniejszy podział SWE-Bench Pro: wymagające, rzeczywiste problemy w repozytoriach.
SWE-Bench Pro v1
Rzeczywiste problemy z GitHuba w profesjonalnych bazach kodu — trudniejsze i w mniejszym stopniu obciążone kontaminacją niż klasyczny SWE-Bench.
Terminal-Bench v2.1
Wykonywanie zadań w prawdziwym terminalu Linux: powłoka, narzędzia, kompilacje i debugowanie.
SWE Atlas Codebase QnA
Odpowiadanie na pytania dotyczące dużych, nieznanych baz kodu.
SWE-Bench Multilingual
Rozwiązywanie zgłoszeń w stylu SWE-Bench w wielu językach programowania.
SWE-Bench Verified
Zweryfikowany przez ludzi podzbiór SWE-Bench: napraw problem tak, aby przechodziły ukryte testy.

Rozumowanie

AIME 2026
Zadania z American Invitational Mathematics Examination z 2026 roku.
Humanity's Last Exam (no tools)
Humanity's Last Exam: pytania eksperckie z wielu dziedzin, na które należy odpowiedzieć bez użycia narzędzi.
SciCode
Pisanie kodu do rozwiązywania problemów naukowych na poziomie badań.
CritPt (AA)
Zadania wymagające rozumowania z fizyki na poziomie badań, używane przez Artificial Analysis.
GPQA Diamond
Pytania z biologii, chemii i fizyki na poziomie studiów magisterskich, których odpowiedzi trudno znaleźć w źródłach.

Wywoływanie narzędzi i wyszukiwanie

AutomationBench (public)
Automatyzowanie wieloetapowych procesów biznesowych w różnych aplikacjach.
MCP Atlas
Poprawne korzystanie z narzędzi udostępnianych przez Model Context Protocol (MCP).
τ³ banking
Rozmowy w stylu obsługi klienta w obszarze bankowości z wykorzystaniem narzędzi i zasad.
BrowseComp (context mgmt)
Wyszukiwanie trudno dostępnych informacji w sieci z zarządzaniem kontekstem.
DeepSearchQA (context mgmt)
Wieloetapowe pytania badawcze, które wymagają wyszukiwania i łączenia informacji z różnych źródeł.

Ogólne możliwości

AA-LCR (long context)
Rozumowanie na podstawie bardzo długich dokumentów (rozumowanie z długim kontekstem w Artificial Analysis).
LongBench v2
Rozumienie długich danych wejściowych i odpowiadanie na ich podstawie.
IFBench
Przestrzeganie precyzyjnych, weryfikowalnych instrukcji dotyczących formatu i treści.
AA Omniscience index (public split)
Wiedza faktograficzna z karą za pewne siebie, lecz błędne odpowiedzi (halucynacje).