İçeriğe geç
reflectionbeam

Bire bir karşılaştırma

Beam vs Qwen 3.8 Max

0:13

Beam, ortak kıyaslamaların 13 tanesinden 0 tanesini kazanıyor

Sonuç

Qwen 3.8 Max, ortak 13 benchmark'ın tamamında önde; ancak bazı farklar küçük (GPQA 92.6'ya karşı 90.5, AA-LCR 80.3'e karşı 79.3, LongBench 66.3'e karşı 65.5). Qwen 3.8 Max, token başına 95 milyar etkin parametre kullanan, 2.4 trilyon parametreli bir model. Bu, Beam'in etkin boyutunun yaklaşık dört katı ve Reflection'ın işaret ettiği hesaplama farkı da bu.

Kıyaslama bazında

KıyaslamaBeamQwen 3.8 MaxFark
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Tüm puanlar Reflection'ın duyurusundan (8 Ekim 2026 tarihli revizyon) alınmıştır. Qwen 3.8 Max puanları, Reflection'ın Artificial Analysis ve DataCurve'den aktardığı puanlardır.

İki model

BeamQwen 3.8 Max
GeliştiriciReflection AIAlibaba (Qwen)
MerkezAmerika Birleşik DevletleriÇin
Parametreler (toplam / etkin)501B / 23B2.4T / 95B
AğırlıklarApache 2.0, Ekim 2026'nın ilerleyen günlerinde sunulacağı vaat edildiQwen3.8-Max License (custom)
Yayınlandı5 Ekim 20263 Ağustos 2026
Nasıl erişilirBekleme listeli beta API; ağırlıklar yakındaHugging Face, Alibaba Cloud Model Studio, OpenRouter

Diğer karşılaştırmalar