Vai al contenuto
reflectionbeam

Confronto diretto

Beam vs Qwen 3.8 Max

0:13

Beam vince 0 dei 13 benchmark in comune

Verdetto

Qwen 3.8 Max è in testa in tutti e 13 i benchmark condivisi, anche se diversi divari sono ridotti (GPQA 92.6 contro 90.5, AA-LCR 80.3 contro 79.3, LongBench 66.3 contro 65.5). Qwen 3.8 Max è un modello da 2.4 trilioni di parametri, con 95 miliardi attivi per token, circa quattro volte le dimensioni attive di Beam: è questo il divario di calcolo a cui fa riferimento Reflection.

Confronto benchmark per benchmark

BenchmarkBeamQwen 3.8 MaxDifferenza
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Tutti i punteggi provengono dall'annuncio di Reflection (revisione dell'8 ottobre 2026). I punteggi di Qwen 3.8 Max sono quelli citati da Reflection, tratti da Artificial Analysis e DataCurve.

I due modelli

BeamQwen 3.8 Max
SviluppatoreReflection AIAlibaba (Qwen)
Con sede inStati UnitiCina
Parametri (totali / attivi)501B / 23B2.4T / 95B
PesiApache 2.0, promesso per la fine di ottobre 2026Qwen3.8-Max License (custom)
Data di rilascio5 ottobre 20263 agosto 2026
Come accedereAPI beta con lista d'attesa; i pesi arriverannoHugging Face, Alibaba Cloud Model Studio, OpenRouter

Altri confronti