İçeriğe geç
reflectionbeam

Benchmark'ler

Beam benchmark sonuçları

Ajan tabanlı kodlama, akıl yürütme, araç kullanımı ve genel becerileri kapsayan 21 benchmark; Reflection'ın yayımladığı şekliyle, diğer yedi açık modelin sonuçlarıyla yan yana.

Bunlar Reflection'ın duyurusunda bildirdiği değerlerdir (tablo 8 Ekim 2026'da güncellendi). Diğer modellere ait puanlar, Reflection'ın kaynak gösterdiği üzere, Artificial Analysis ve DataCurve'den alınmıştır. Ağırlıklar yayımlandıktan sonra bağımsız yeniden üretim sonuçları paylaşılacaktır.

KıyaslamaBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Satırdaki bildirilen en yüksek puan— Bildirilmeyen

Rakamlar ne gösteriyor?

Beam, yazılım mühendisliğinde en güçlü performansını gösteriyor. SWE-Bench Verified'da 80.9 puan alıyor (77.6 puan alan Inkling'in önünde) ve SWE-Bench Multilingual'da 78.0 puan alıyor (67.7 puan alan Nemotron 3 Ultra'nın önünde). Daha büyük Çin modellerinin sonuç bildirmediği bu benchmarklarda, SWE-Bench Pro v1'de (65.5'e karşı 62.1) ve MCP Atlas'ta (78.7'ye karşı 77.8) GLM 5.2'yi de az farkla geçiyor.

Salt akıl yürütmede liderlerin biraz gerisinde kalıyor: GPQA Diamond'da Kimi K3'ün 93.5 puanına karşı 90.5, araç kullanmadan Humanity's Last Exam'de ise 46.9'a karşı 36.2 puan alıyor.

Reflection'ın iddiası, Beam'in her alanda kazandığı değil; yanıt başına çok daha az hesaplama gücü harcarken rakiplerine yaklaştığı. Kimi K3, GLM 5.3 ve Qwen 3.8 Max, sonuç bildirdikleri satırların çoğunda hâlâ önde.

Her benchmark neyi ölçüyor?

Ajan tabanlı kodlama ve terminal

DeepSWE v1.1
Bir ajanın baştan sona çözdüğü, uzun soluklu yazılım mühendisliği görevleri.
SWE-Bench Pro v2-Hard
SWE-Bench Pro'nun zor bölümü: gerçek dünyadaki depolarda karşılaşılan güç sorunlar.
SWE-Bench Pro v1
Profesyonel kod tabanlarındaki gerçek GitHub sorunları; klasik SWE-Bench'e göre daha zor ve veri sızıntısından daha az etkilenmiş.
Terminal-Bench v2.1
Gerçek bir Linux terminalinde görevleri tamamlama: kabuk, araçlar, derlemeler ve hata ayıklama.
SWE Atlas Codebase QnA
Büyük ve az bilinen kod tabanlarıyla ilgili soruları yanıtlama.
SWE-Bench Multilingual
Birçok programlama dilinde SWE-Bench tarzı hata düzeltme.
SWE-Bench Verified
SWE-Bench'in insanlar tarafından doğrulanmış alt kümesi: Gizli testleri geçecek şekilde sorunu düzeltme.

Akıl yürütme

AIME 2026
2026 American Invitational Mathematics Examination soruları.
Humanity's Last Exam (no tools)
Humanity's Last Exam: Araç kullanmadan yanıtlanan, birçok alanda uzmanlık düzeyinde sorular.
SciCode
Araştırma düzeyindeki bilim problemlerini çözmek için kod yazma.
CritPt (AA)
Artificial Analysis tarafından uygulanan, araştırma düzeyinde fizik muhakemesi problemleri.
GPQA Diamond
Aranarak bulunması zor olacak şekilde tasarlanmış, biyoloji, kimya ve fizikte lisansüstü düzeyde sorular.

Araç çağrısı ve arama

AutomationBench (public)
Uygulamalar arasında çok adımlı iş akışlarını otomatikleştirme.
MCP Atlas
Model Context Protocol (MCP) üzerinden sunulan araçları doğru kullanma.
τ³ banking
Bankacılık alanında, araçlar ve politikalarla yürütülen müşteri hizmetleri tarzında konuşmalar.
BrowseComp (context mgmt)
Web'de gezinerek ve bağlamı yöneterek bulunması zor bilgileri bulma.
DeepSearchQA (context mgmt)
Kaynakları arayıp birleştirmeyi gerektiren çok adımlı araştırma soruları.

Genel yetenekler

AA-LCR (long context)
Çok uzun belgeler üzerinde muhakeme yürütme (Artificial Analysis uzun bağlam muhakemesi).
LongBench v2
Uzun girdileri anlama ve bunlarla ilgili soruları yanıtlama.
IFBench
Kesin, doğrulanabilir biçimlendirme ve içerik talimatlarını izleme.
AA Omniscience index (public split)
Kendinden emin ama yanlış yanıtlar (halüsinasyonlar) için ceza uygulanan olgusal bilgi.