Passer au contenu
reflectionbeam

Face à face

Beam vs Qwen 3.8 Max

0:13

Beam remporte 0 des 13 benchmarks communs

Verdict

Qwen 3.8 Max est en tête sur chacun des 13 benchmarks communs, même si les écarts sont faibles sur plusieurs d’entre eux (GPQA : 92.6 contre 90.5, AA-LCR : 80.3 contre 79.3, LongBench : 66.3 contre 65.5). Qwen 3.8 Max est un modèle de 2.4 billions de paramètres, dont 95 milliards actifs par token, soit environ quatre fois la taille active de Beam : c’est l’écart de calcul auquel Reflection fait référence.

Benchmark par benchmark

BenchmarkBeamQwen 3.8 MaxÉcart
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Tous les scores proviennent de l’annonce de Reflection (révision du 8 octobre 2026). Les scores de Qwen 3.8 Max sont ceux cités par Reflection, d’après Artificial Analysis et DataCurve.

Les deux modèles

BeamQwen 3.8 Max
DéveloppeurReflection AIAlibaba (Qwen)
Basé àÉtats-UnisChine
Paramètres (total / actifs)501B / 23B2.4T / 95B
PoidsApache 2.0, promis pour plus tard en octobre 2026Qwen3.8-Max License (custom)
Date de sortie5 octobre 20263 août 2026
Moyens d’accèsAPI bêta sur liste d’attente ; poids à venirHugging Face, Alibaba Cloud Model Studio, OpenRouter

Autres comparaisons