İçeriğe geç
reflectionbeam

Bire bir karşılaştırma

Beam vs DeepSeek V4.1 Flash

2:7

Beam, ortak kıyaslamaların 9 tanesinden 2 tanesini kazanıyor

Sonuç

DeepSeek V4.1 Flash, ortak 9 benchmark'ın 7'sinde önde; DeepSWE ve AutomationBench'te büyük, Terminal-Bench'te ise 10 puanlık farkla kazanıyor. Beam, CritPt'te kazanıyor ve kendinden emin biçimde verilen yanlış yanıtları cezalandıran AA Omniscience endeksinde daha iyi sonuç alıyor. Bu karşılaştırmada verimlilik Beam'in lehine değil: DeepSeek V4.1 Flash, üretilen token başına yalnızca 16 milyar parametre etkinleştiriyor; bu, Beam'in 23 milyarından daha az. Ayrıca ağırlıkları MIT lisansı altında zaten kamuya açık.

Kıyaslama bazında

KıyaslamaBeamDeepSeek V4.1 FlashFark
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Tüm puanlar Reflection'ın duyurusundan (8 Ekim 2026 tarihli revizyon) alınmıştır. DeepSeek V4.1 Flash puanları, Reflection'ın Artificial Analysis ve DataCurve'den aktardığı puanlardır.

İki model

BeamDeepSeek V4.1 Flash
GeliştiriciReflection AIDeepSeek
MerkezAmerika Birleşik DevletleriÇin
Parametreler (toplam / etkin)501B / 23B552B / 16B
AğırlıklarApache 2.0, Ekim 2026'nın ilerleyen günlerinde sunulacağı vaat edildiMIT
Yayınlandı5 Ekim 202610 Eylül 2026
Nasıl erişilirBekleme listeli beta API; ağırlıklar yakındaHugging Face, DeepSeek API, OpenRouter

Diğer karşılaştırmalar