Lewati ke konten
reflectionbeam

Benchmark

Hasil benchmark Beam

21 benchmark yang mencakup pemrograman berbasis agen, penalaran, penggunaan alat, dan kemampuan umum, persis seperti yang diterbitkan Reflection, berdampingan dengan tujuh model terbuka lainnya.

Ini adalah angka yang dilaporkan vendor dari pengumuman Reflection (tabel diperbarui 8 Oktober 2026). Skor model lain berasal dari Artificial Analysis dan DataCurve, sebagaimana dikutip oleh Reflection. Reproduksi independen akan menyusul setelah bobotnya tersedia untuk publik.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Skor tertinggi yang dilaporkan pada baris ini— Tidak dilaporkan

Makna angka-angka ini

Beam paling unggul dalam rekayasa perangkat lunak. Skornya 80.9 pada SWE-Bench Verified (mengungguli Inkling dengan 77.6) dan 78.0 pada SWE-Bench Multilingual (mengungguli Nemotron 3 Ultra dengan 67.7)—dua benchmark yang hasilnya tidak dilaporkan oleh model-model Tiongkok yang lebih besar. Beam juga sedikit mengungguli GLM 5.2 pada SWE-Bench Pro v1 (65.5 vs 62.1) dan MCP Atlas (78.7 vs 77.8).

Dalam penalaran murni, skornya sedikit di bawah para pemimpin: 90.5 pada GPQA Diamond dibandingkan dengan 93.5 untuk Kimi K3, dan 36.2 pada Humanity's Last Exam tanpa alat dibandingkan dengan 46.9.

Argumen Reflection bukanlah bahwa Beam unggul dalam segala hal, melainkan bahwa performanya mendekati para pesaing dengan biaya komputasi per jawaban yang jauh lebih rendah. Kimi K3, GLM 5.3, dan Qwen 3.8 Max masih unggul pada sebagian besar baris yang mencantumkan hasil mereka.

Apa yang diukur setiap benchmark

Pemrograman berbasis agen & terminal

DeepSWE v1.1
Tugas rekayasa perangkat lunak berdurasi panjang yang diselesaikan agen dari awal hingga akhir.
SWE-Bench Pro v2-Hard
Bagian sulit dari SWE-Bench Pro: masalah repositori dunia nyata yang menantang.
SWE-Bench Pro v1
Masalah GitHub nyata dari basis kode profesional, lebih sulit dan lebih sedikit terkontaminasi dibandingkan SWE-Bench klasik.
Terminal-Bench v2.1
Menyelesaikan tugas di dalam terminal Linux sungguhan: shell, alat, build, dan debugging.
SWE Atlas Codebase QnA
Menjawab pertanyaan tentang basis kode besar yang belum dikenal.
SWE-Bench Multilingual
Memperbaiki masalah bergaya SWE-Bench di berbagai bahasa pemrograman.
SWE-Bench Verified
Subset SWE-Bench yang diverifikasi manusia: perbaiki masalah hingga pengujian tersembunyi berhasil.

Penalaran

AIME 2026
Soal dari American Invitational Mathematics Examination 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: pertanyaan tingkat ahli dari berbagai bidang, dijawab tanpa alat.
SciCode
Menulis kode untuk menyelesaikan masalah sains tingkat riset.
CritPt (AA)
Soal penalaran fisika tingkat riset, sebagaimana dijalankan oleh Artificial Analysis.
GPQA Diamond
Pertanyaan tingkat pascasarjana tentang biologi, kimia, dan fisika yang dirancang agar sulit dicari jawabannya.

Pemanggilan alat & pencarian

AutomationBench (public)
Mengotomatiskan alur kerja bisnis multi-langkah di berbagai aplikasi.
MCP Atlas
Menggunakan alat yang tersedia melalui Model Context Protocol (MCP) dengan benar.
τ³ banking
Percakapan layanan pelanggan bergaya perbankan yang menggunakan alat dan kebijakan.
BrowseComp (context mgmt)
Menemukan fakta yang sulit ditemukan dengan menjelajahi web dan mengelola konteks.
DeepSearchQA (context mgmt)
Pertanyaan riset multi-langkah yang mengharuskan pencarian dan penggabungan berbagai sumber.

Kemampuan umum

AA-LCR (long context)
Penalaran atas dokumen yang sangat panjang (penalaran konteks panjang Artificial Analysis).
LongBench v2
Memahami dan menjawab pertanyaan berdasarkan masukan yang panjang.
IFBench
Mengikuti instruksi format dan konten yang tepat serta dapat diverifikasi.
AA Omniscience index (public split)
Pengetahuan faktual dengan penalti untuk jawaban salah yang disampaikan dengan yakin (halusinasi).