Przejdź do treści
reflectionbeam

Bezpośrednie porównanie

Beam vs Qwen 3.8 Max

0:13

Beam wygrywa w 0 z 13 wspólnych benchmarków

Werdykt

Qwen 3.8 Max prowadzi we wszystkich 13 wspólnych benchmarkach, choć różnice w kilku przypadkach są niewielkie (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Qwen 3.8 Max to model z 2.4 biliona parametrów, z których 95 miliardów jest aktywnych na token — około cztery razy więcej aktywnych parametrów niż w Beam. To właśnie na tę różnicę w zapotrzebowaniu na moc obliczeniową wskazuje Reflection.

Porównanie benchmark po benchmarku

BenchmarkBeamQwen 3.8 MaxRóżnica
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Wszystkie wyniki pochodzą z ogłoszenia Reflection (aktualizacja z 8 października 2026). Wyniki dla Qwen 3.8 Max podano za Reflection, na podstawie danych Artificial Analysis i DataCurve.

Oba modele

BeamQwen 3.8 Max
DeweloperReflection AIAlibaba (Qwen)
SiedzibaStany ZjednoczoneChiny
Parametry (łącznie / aktywne)501B / 23B2.4T / 95B
WagiApache 2.0, obiecana na późniejszą część października 2026Qwen3.8-Max License (custom)
Data premiery5 października 20263 sierpnia 2026
Jak uzyskać dostępAPI beta — lista oczekujących; wagi pojawią się późniejHugging Face, Alibaba Cloud Model Studio, OpenRouter

Pozostałe porównania