Mga benchmark
Mga resulta ng benchmark ng Beam
21 benchmark sa agentic coding, pangangatwiran, paggamit ng tool at pangkalahatang kakayahan, eksaktong gaya ng pagkakalathala ng Reflection, katabi ng mga resulta ng pitong iba pang open model.
Mga numerong iniulat ng vendor ang mga ito mula sa anunsyo ng Reflection (na-update ang talahanayan noong October 8, 2026). Ang mga score ng ibang modelo ay mula sa Artificial Analysis at DataCurve, ayon sa pagsipi ng Reflection. Susunod ang mga independiyenteng pagsubok kapag pampubliko na ang mga weight.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | — | — | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | — | — | 84.3 | 88.2 | — | — |
| SWE-Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | — | — | 67.7 | — |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | — | — | — | 61.0 | 68.0 | — | — |
| SWE-Bench Multilingual | 78.0 | — | 67.7 | — | — | — | — | — |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | — | — | — | — | — |
| AIME 2026 | 97.8 | 97.1 | — | 99.2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | — | 59.0 | 58.7 | 52.1 | 52.0 |
| CritPt (AA) | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87.0 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| AutomationBench (public) | 37.0 | — | — | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| MCP Atlas | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | — |
| τ³ banking | 38.0 | 25.0 | 22.6 | 37.1 | — | 37.1 | 55.2 | — |
| BrowseComp (context mgmt) | 77.4 | 77.1 | 44.4 | — | — | 91.2 | — | — |
| DeepSearchQA (context mgmt) | 80.1 | — | — | — | — | 95.0 | — | — |
| AA-LCR (long context) | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| LongBench v2 | 65.5 | — | 61.9 | 64.0 | — | — | 66.3 | — |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | — | — | 82.8 | — |
| AA Omniscience index (public split) | 13.0 | 14.2 | 8.6 | — | 22.6 | — | — | 6.6 |
00.0 Pinakamataas na iniulat na score sa hanay— Hindi iniulat
Ano ang sinasabi ng mga numero
Pinakamahusay ang Beam sa software engineering. Nakakuha ito ng 80.9 sa SWE-Bench Verified (mas mataas kaysa 77.6 ng Inkling) at 78.0 sa SWE-Bench Multilingual (mas mataas kaysa 67.7 ng Nemotron 3 Ultra). Hindi iniulat ng mas malalaking modelong Tsino ang mga benchmark na ito, at bahagyang mas mataas din ang score nito kaysa GLM 5.2 sa SWE-Bench Pro v1 (65.5 kumpara sa 62.1) at MCP Atlas (78.7 kumpara sa 77.8).
Sa purong pangangatwiran, bahagya itong nahuhuli sa mga nangunguna: 90.5 sa GPQA Diamond kumpara sa 93.5 ng Kimi K3, at 36.2 sa Humanity's Last Exam nang walang mga tool kumpara sa 46.9.
Hindi sinasabi ng Reflection na panalo ang Beam sa lahat, kundi nakakasabay ito habang mas kaunti ang compute na ginagamit sa bawat sagot. Nangunguna pa rin ang Kimi K3, GLM 5.3 at Qwen 3.8 Max sa karamihan ng mga hanay kung saan iniulat nila ang mga resulta.
Ano ang sinusukat ng bawat benchmark
Agentic coding at terminal
- DeepSWE v1.1
- Mga gawaing software engineering na may mahabang proseso at nilulutas ng isang ahente mula simula hanggang dulo.
- SWE-Bench Pro v2-Hard
- Ang mahirap na bahagi ng SWE-Bench Pro: mahihirap na isyu sa mga repositoryo mula sa totoong mundo.
- SWE-Bench Pro v1
- Mga totoong isyu sa GitHub mula sa mga propesyonal na codebase, na mas mahirap at hindi gaanong nalantad sa datos ng pagsasanay kaysa sa klasikong SWE-Bench.
- Terminal-Bench v2.1
- Pagtapos ng mga gawain sa isang totoong Linux terminal: shell, mga tool, build at pag-debug.
- SWE Atlas Codebase QnA
- Pagsagot sa mga tanong tungkol sa malalaki at hindi pamilyar na codebase.
- SWE-Bench Multilingual
- Pag-aayos ng mga isyu sa maraming programming language na kahawig ng SWE-Bench.
- SWE-Bench Verified
- Bahaging na-verify ng tao ng SWE-Bench: ayusin ang isyu para pumasa ang mga nakatagong test.
Pangangatwiran
- AIME 2026
- Mga problema mula sa 2026 American Invitational Mathematics Examination.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: mga tanong na antas-eksperto sa iba't ibang larangan, sinasagot nang walang mga tool.
- SciCode
- Pagsulat ng code para lutasin ang mga problemang pang-agham na antas-pananaliksik.
- CritPt (AA)
- Mga problema sa pangangatwirang pisika na antas-pananaliksik, gaya ng isinagawa ng Artificial Analysis.
- GPQA Diamond
- Mga tanong sa biyolohiya, kimika at pisika na antas-gradwado, na sadyang mahirap hanapan ng sagot.
Pagtawag sa tool at paghahanap
- AutomationBench (public)
- Pag-automate ng mga workflow sa negosyo na may maraming hakbang sa iba't ibang app.
- MCP Atlas
- Tamang paggamit ng mga tool na inilalantad sa pamamagitan ng Model Context Protocol (MCP).
- τ³ banking
- Mga pag-uusap na kahawig ng serbisyo sa customer sa larangan ng pagbabangko, gamit ang mga tool at patakaran.
- BrowseComp (context mgmt)
- Paghahanap ng mahirap matagpuang impormasyon sa pamamagitan ng pag-browse sa web at pamamahala ng konteksto.
- DeepSearchQA (context mgmt)
- Mga tanong sa pananaliksik na may maraming hakbang, na nangangailangan ng paghahanap at pagsasama-sama ng mga source.
Mga pangkalahatang kakayahan
- AA-LCR (long context)
- Pangangatwiran batay sa napakahahabang dokumento (pangangatwiran sa mahabang konteksto ng Artificial Analysis).
- LongBench v2
- Pag-unawa at pagsagot sa mga tanong batay sa mahahabang input.
- IFBench
- Pagsunod sa tumpak at nabe-verify na mga tagubilin sa format at nilalaman.
- AA Omniscience index (public split)
- Kaalamang makatotohanan na may parusa sa mga maling sagot na ipinahayag nang may kumpiyansa (mga halusinasyon).