Benchmark'ler
Beam benchmark sonuçları
Ajan tabanlı kodlama, akıl yürütme, araç kullanımı ve genel becerileri kapsayan 21 benchmark; Reflection'ın yayımladığı şekliyle, diğer yedi açık modelin sonuçlarıyla yan yana.
Bunlar Reflection'ın duyurusunda bildirdiği değerlerdir (tablo 8 Ekim 2026'da güncellendi). Diğer modellere ait puanlar, Reflection'ın kaynak gösterdiği üzere, Artificial Analysis ve DataCurve'den alınmıştır. Ağırlıklar yayımlandıktan sonra bağımsız yeniden üretim sonuçları paylaşılacaktır.
| Kıyaslama | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Satırdaki bildirilen en yüksek puan— Bildirilmeyen
Rakamlar ne gösteriyor?
Beam, yazılım mühendisliğinde en güçlü performansını gösteriyor. SWE-Bench Verified'da 80.9 puan alıyor (77.6 puan alan Inkling'in önünde) ve SWE-Bench Multilingual'da 78.0 puan alıyor (67.7 puan alan Nemotron 3 Ultra'nın önünde). Daha büyük Çin modellerinin sonuç bildirmediği bu benchmarklarda, SWE-Bench Pro v1'de (65.5'e karşı 62.1) ve MCP Atlas'ta (78.7'ye karşı 77.8) GLM 5.2'yi de az farkla geçiyor.
Salt akıl yürütmede liderlerin biraz gerisinde kalıyor: GPQA Diamond'da Kimi K3'ün 93.5 puanına karşı 90.5, araç kullanmadan Humanity's Last Exam'de ise 46.9'a karşı 36.2 puan alıyor.
Reflection'ın iddiası, Beam'in her alanda kazandığı değil; yanıt başına çok daha az hesaplama gücü harcarken rakiplerine yaklaştığı. Kimi K3, GLM 5.3 ve Qwen 3.8 Max, sonuç bildirdikleri satırların çoğunda hâlâ önde.
Her benchmark neyi ölçüyor?
Ajan tabanlı kodlama ve terminal
- DeepSWE v1.1
- Bir ajanın baştan sona çözdüğü, uzun soluklu yazılım mühendisliği görevleri.
- SWE-Bench Pro v2-Hard
- SWE-Bench Pro'nun zor bölümü: gerçek dünyadaki depolarda karşılaşılan güç sorunlar.
- SWE-Bench Pro v1
- Profesyonel kod tabanlarındaki gerçek GitHub sorunları; klasik SWE-Bench'e göre daha zor ve veri sızıntısından daha az etkilenmiş.
- Terminal-Bench v2.1
- Gerçek bir Linux terminalinde görevleri tamamlama: kabuk, araçlar, derlemeler ve hata ayıklama.
- SWE Atlas Codebase QnA
- Büyük ve az bilinen kod tabanlarıyla ilgili soruları yanıtlama.
- SWE-Bench Multilingual
- Birçok programlama dilinde SWE-Bench tarzı hata düzeltme.
- SWE-Bench Verified
- SWE-Bench'in insanlar tarafından doğrulanmış alt kümesi: Gizli testleri geçecek şekilde sorunu düzeltme.
Akıl yürütme
- AIME 2026
- 2026 American Invitational Mathematics Examination soruları.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: Araç kullanmadan yanıtlanan, birçok alanda uzmanlık düzeyinde sorular.
- SciCode
- Araştırma düzeyindeki bilim problemlerini çözmek için kod yazma.
- CritPt (AA)
- Artificial Analysis tarafından uygulanan, araştırma düzeyinde fizik muhakemesi problemleri.
- GPQA Diamond
- Aranarak bulunması zor olacak şekilde tasarlanmış, biyoloji, kimya ve fizikte lisansüstü düzeyde sorular.
Araç çağrısı ve arama
- AutomationBench (public)
- Uygulamalar arasında çok adımlı iş akışlarını otomatikleştirme.
- MCP Atlas
- Model Context Protocol (MCP) üzerinden sunulan araçları doğru kullanma.
- τ³ banking
- Bankacılık alanında, araçlar ve politikalarla yürütülen müşteri hizmetleri tarzında konuşmalar.
- BrowseComp (context mgmt)
- Web'de gezinerek ve bağlamı yöneterek bulunması zor bilgileri bulma.
- DeepSearchQA (context mgmt)
- Kaynakları arayıp birleştirmeyi gerektiren çok adımlı araştırma soruları.
Genel yetenekler
- AA-LCR (long context)
- Çok uzun belgeler üzerinde muhakeme yürütme (Artificial Analysis uzun bağlam muhakemesi).
- LongBench v2
- Uzun girdileri anlama ve bunlarla ilgili soruları yanıtlama.
- IFBench
- Kesin, doğrulanabilir biçimlendirme ve içerik talimatlarını izleme.
- AA Omniscience index (public split)
- Kendinden emin ama yanlış yanıtlar (halüsinasyonlar) için ceza uygulanan olgusal bilgi.