Ga naar de inhoud
reflectionbeam

Directe vergelijking

Beam vs Qwen 3.8 Max

0:13

Beam wint 0 van de 13 gedeelde benchmarks

Conclusie

Qwen 3.8 Max scoort hoger op alle 13 gedeelde benchmarks, al zijn sommige verschillen klein (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Qwen 3.8 Max heeft 2,4 biljoen parameters, waarvan er 95 miljard actief zijn per token: ongeveer vier keer Beam's actieve omvang. Dat is het verschil in rekenkracht waar Reflection op wijst.

Benchmark voor benchmark

BenchmarkBeamQwen 3.8 MaxVerschil
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Alle scores komen uit de aankondiging van Reflection (herzien op 8 oktober 2026). De scores voor Qwen 3.8 Max zijn zoals Reflection ze citeert van Artificial Analysis en DataCurve.

De twee modellen

BeamQwen 3.8 Max
OntwikkelaarReflection AIAlibaba (Qwen)
Gevestigd inVerenigde StatenChina
Parameters (totaal / actief)501B / 23B2.4T / 95B
GewichtenApache 2.0, beloofd voor later in oktober 2026Qwen3.8-Max License (custom)
Uitgebracht5 oktober 20263 augustus 2026
ToegangAPI in bèta met wachtlijst; gewichten volgenHugging Face, Alibaba Cloud Model Studio, OpenRouter

Andere vergelijkingen