Lumaktaw sa nilalaman
reflectionbeam

Direktang paghahambing

Beam vs Qwen 3.8 Max

0:13

Nanalo ang Beam sa 0 sa 13 benchmark na pareho nilang iniulat

Pasya

Nangunguna ang Qwen 3.8 Max sa lahat ng 13 magkakaparehong benchmark, bagaman maliit lang ang ilang agwat (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Modelong may 2.4 trilyong parameter ang Qwen 3.8 Max, at 95 bilyon ang aktibo sa bawat token—humigit-kumulang apat na beses ng aktibong laki ng Beam. Ito ang agwat sa compute na tinutukoy ng Reflection.

Bawat benchmark

BenchmarkBeamQwen 3.8 MaxPagkakaiba
DeepSWE v1.144.451.0-6.6
SWE-Bench Pro v165.567.7-2.2
Terminal-Bench v2.180.186.6-6.5
Humanity's Last Exam (no tools)36.243.6-7.4
SciCode49.752.1-2.4
CritPt (AA)16.320.0-3.7
GPQA Diamond90.592.6-2.1
AutomationBench (public)37.039.8-2.8
MCP Atlas78.784.5-5.8
τ³ banking38.055.2-17.2
AA-LCR (long context)79.380.3-1.0
LongBench v265.566.3-0.8
IFBench79.782.8-3.1

Lahat ng score ay mula sa anunsyo ng Reflection (rebisyon noong October 8, 2026). Ang mga score para sa Qwen 3.8 Max ay ayon sa mga binanggit ng Reflection mula sa Artificial Analysis at DataCurve.

Ang dalawang modelo

BeamQwen 3.8 Max
DeveloperReflection AIAlibaba (Qwen)
Nakabase saEstados UnidosTsina
Mga parameter (kabuuan / aktibo)501B / 23B2.4T / 95B
Mga weightApache 2.0, ipinangako para sa bandang huling bahagi ng Oktubre 2026Qwen3.8-Max License (custom)
InilabasOktubre 5, 2026Agosto 3, 2026
Paano mag-accessAPI beta na nasa waitlist; paparating ang mga weightHugging Face, Alibaba Cloud Model Studio, OpenRouter

Iba pang paghahambing