Benchmark
Hasil benchmark Beam
21 benchmark yang mencakup pemrograman berbasis agen, penalaran, penggunaan alat, dan kemampuan umum, persis seperti yang diterbitkan Reflection, berdampingan dengan tujuh model terbuka lainnya.
Ini adalah angka yang dilaporkan vendor dari pengumuman Reflection (tabel diperbarui 8 Oktober 2026). Skor model lain berasal dari Artificial Analysis dan DataCurve, sebagaimana dikutip oleh Reflection. Reproduksi independen akan menyusul setelah bobotnya tersedia untuk publik.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Skor tertinggi yang dilaporkan pada baris ini— Tidak dilaporkan
Makna angka-angka ini
Beam paling unggul dalam rekayasa perangkat lunak. Skornya 80.9 pada SWE-Bench Verified (mengungguli Inkling dengan 77.6) dan 78.0 pada SWE-Bench Multilingual (mengungguli Nemotron 3 Ultra dengan 67.7)—dua benchmark yang hasilnya tidak dilaporkan oleh model-model Tiongkok yang lebih besar. Beam juga sedikit mengungguli GLM 5.2 pada SWE-Bench Pro v1 (65.5 vs 62.1) dan MCP Atlas (78.7 vs 77.8).
Dalam penalaran murni, skornya sedikit di bawah para pemimpin: 90.5 pada GPQA Diamond dibandingkan dengan 93.5 untuk Kimi K3, dan 36.2 pada Humanity's Last Exam tanpa alat dibandingkan dengan 46.9.
Argumen Reflection bukanlah bahwa Beam unggul dalam segala hal, melainkan bahwa performanya mendekati para pesaing dengan biaya komputasi per jawaban yang jauh lebih rendah. Kimi K3, GLM 5.3, dan Qwen 3.8 Max masih unggul pada sebagian besar baris yang mencantumkan hasil mereka.
Apa yang diukur setiap benchmark
Pemrograman berbasis agen & terminal
- DeepSWE v1.1
- Tugas rekayasa perangkat lunak berdurasi panjang yang diselesaikan agen dari awal hingga akhir.
- SWE-Bench Pro v2-Hard
- Bagian sulit dari SWE-Bench Pro: masalah repositori dunia nyata yang menantang.
- SWE-Bench Pro v1
- Masalah GitHub nyata dari basis kode profesional, lebih sulit dan lebih sedikit terkontaminasi dibandingkan SWE-Bench klasik.
- Terminal-Bench v2.1
- Menyelesaikan tugas di dalam terminal Linux sungguhan: shell, alat, build, dan debugging.
- SWE Atlas Codebase QnA
- Menjawab pertanyaan tentang basis kode besar yang belum dikenal.
- SWE-Bench Multilingual
- Memperbaiki masalah bergaya SWE-Bench di berbagai bahasa pemrograman.
- SWE-Bench Verified
- Subset SWE-Bench yang diverifikasi manusia: perbaiki masalah hingga pengujian tersembunyi berhasil.
Penalaran
- AIME 2026
- Soal dari American Invitational Mathematics Examination 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: pertanyaan tingkat ahli dari berbagai bidang, dijawab tanpa alat.
- SciCode
- Menulis kode untuk menyelesaikan masalah sains tingkat riset.
- CritPt (AA)
- Soal penalaran fisika tingkat riset, sebagaimana dijalankan oleh Artificial Analysis.
- GPQA Diamond
- Pertanyaan tingkat pascasarjana tentang biologi, kimia, dan fisika yang dirancang agar sulit dicari jawabannya.
Pemanggilan alat & pencarian
- AutomationBench (public)
- Mengotomatiskan alur kerja bisnis multi-langkah di berbagai aplikasi.
- MCP Atlas
- Menggunakan alat yang tersedia melalui Model Context Protocol (MCP) dengan benar.
- τ³ banking
- Percakapan layanan pelanggan bergaya perbankan yang menggunakan alat dan kebijakan.
- BrowseComp (context mgmt)
- Menemukan fakta yang sulit ditemukan dengan menjelajahi web dan mengelola konteks.
- DeepSearchQA (context mgmt)
- Pertanyaan riset multi-langkah yang mengharuskan pencarian dan penggabungan berbagai sumber.
Kemampuan umum
- AA-LCR (long context)
- Penalaran atas dokumen yang sangat panjang (penalaran konteks panjang Artificial Analysis).
- LongBench v2
- Memahami dan menjawab pertanyaan berdasarkan masukan yang panjang.
- IFBench
- Mengikuti instruksi format dan konten yang tepat serta dapat diverifikasi.
- AA Omniscience index (public split)
- Pengetahuan faktual dengan penalti untuk jawaban salah yang disampaikan dengan yakin (halusinasi).