Benchmarki
Wyniki testów porównawczych Beam
21 testów obejmujących programowanie agentowe, rozumowanie, użycie narzędzi i ogólne umiejętności. Wyniki dokładnie takie, jak opublikowała je Reflection, zestawione z wynikami siedmiu innych otwartych modeli.
Są to wyniki podane przez producentów w ogłoszeniu Reflection (tabela zaktualizowana 8 października 2026 r.). Wyniki innych modeli pochodzą z Artificial Analysis i DataCurve, zgodnie z cytowaniami Reflection. Niezależne odtworzenia wyników pojawią się, gdy wagi będą publicznie dostępne.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Najlepszy zgłoszony wynik w wierszu— Nie zgłoszono
Co mówią wyniki
Beam najlepiej wypada w inżynierii oprogramowania. Uzyskuje 80.9 w SWE-Bench Verified (więcej niż Inkling z wynikiem 77.6) i 78.0 w SWE-Bench Multilingual (więcej niż Nemotron 3 Ultra z wynikiem 67.7) — w testach, dla których większe chińskie modele nie podały wyników. Wyprzedza też GLM 5.2 w SWE-Bench Pro v1 (65.5 wobec 62.1) i MCP Atlas (78.7 wobec 77.8).
W samym rozumowaniu plasuje się nieco za liderami: uzyskuje 90.5 w GPQA Diamond wobec 93.5 dla Kimi K3 oraz 36.2 w Humanity's Last Exam bez użycia narzędzi wobec 46.9.
Reflection nie twierdzi, że Beam wygrywa we wszystkim, lecz że osiąga zbliżone wyniki, zużywając znacznie mniej mocy obliczeniowej na każdą odpowiedź. Kimi K3, GLM 5.3 i Qwen 3.8 Max nadal prowadzą w większości kategorii, w których podały wyniki.
Co mierzy każdy test porównawczy
Programowanie agentowe i terminal
- DeepSWE v1.1
- Złożone, wieloetapowe zadania z zakresu inżynierii oprogramowania, rozwiązywane przez agenta od początku do końca.
- SWE-Bench Pro v2-Hard
- Trudniejszy podział SWE-Bench Pro: wymagające, rzeczywiste problemy w repozytoriach.
- SWE-Bench Pro v1
- Rzeczywiste problemy z GitHuba w profesjonalnych bazach kodu — trudniejsze i w mniejszym stopniu obciążone kontaminacją niż klasyczny SWE-Bench.
- Terminal-Bench v2.1
- Wykonywanie zadań w prawdziwym terminalu Linux: powłoka, narzędzia, kompilacje i debugowanie.
- SWE Atlas Codebase QnA
- Odpowiadanie na pytania dotyczące dużych, nieznanych baz kodu.
- SWE-Bench Multilingual
- Rozwiązywanie zgłoszeń w stylu SWE-Bench w wielu językach programowania.
- SWE-Bench Verified
- Zweryfikowany przez ludzi podzbiór SWE-Bench: napraw problem tak, aby przechodziły ukryte testy.
Rozumowanie
- AIME 2026
- Zadania z American Invitational Mathematics Examination z 2026 roku.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: pytania eksperckie z wielu dziedzin, na które należy odpowiedzieć bez użycia narzędzi.
- SciCode
- Pisanie kodu do rozwiązywania problemów naukowych na poziomie badań.
- CritPt (AA)
- Zadania wymagające rozumowania z fizyki na poziomie badań, używane przez Artificial Analysis.
- GPQA Diamond
- Pytania z biologii, chemii i fizyki na poziomie studiów magisterskich, których odpowiedzi trudno znaleźć w źródłach.
Wywoływanie narzędzi i wyszukiwanie
- AutomationBench (public)
- Automatyzowanie wieloetapowych procesów biznesowych w różnych aplikacjach.
- MCP Atlas
- Poprawne korzystanie z narzędzi udostępnianych przez Model Context Protocol (MCP).
- τ³ banking
- Rozmowy w stylu obsługi klienta w obszarze bankowości z wykorzystaniem narzędzi i zasad.
- BrowseComp (context mgmt)
- Wyszukiwanie trudno dostępnych informacji w sieci z zarządzaniem kontekstem.
- DeepSearchQA (context mgmt)
- Wieloetapowe pytania badawcze, które wymagają wyszukiwania i łączenia informacji z różnych źródeł.
Ogólne możliwości
- AA-LCR (long context)
- Rozumowanie na podstawie bardzo długich dokumentów (rozumowanie z długim kontekstem w Artificial Analysis).
- LongBench v2
- Rozumienie długich danych wejściowych i odpowiadanie na ich podstawie.
- IFBench
- Przestrzeganie precyzyjnych, weryfikowalnych instrukcji dotyczących formatu i treści.
- AA Omniscience index (public split)
- Wiedza faktograficzna z karą za pewne siebie, lecz błędne odpowiedzi (halucynacje).