Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs Qwen 3.8 Max

0:13

Beam gewinnt 0 von 13 gemeinsamen Benchmarks

Fazit

Qwen 3.8 Max liegt bei allen 13 gemeinsamen Benchmarks vorne, auch wenn einige Abstände gering sind (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Qwen 3.8 Max ist ein Modell mit 2.4 Billionen Parametern und 95 Milliarden aktiven Parametern pro Token, also etwa viermal so vielen aktiven Parametern wie Beam. Auf diesen Unterschied bei der Rechenleistung verweist Reflection.

Benchmark für Benchmark

BenchmarkBeamQwen 3.8 MaxDifferenz
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für Qwen 3.8 Max sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamQwen 3.8 Max
EntwicklerReflection AIAlibaba (Qwen)
SitzVereinigte StaatenChina
Parameter (gesamt / aktiv)501B / 23B2.4T / 95B
GewichteApache 2.0, für später im Oktober 2026 angekündigtQwen3.8-Max License (custom)
Veröffentlicht5. Oktober 20263. August 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, Alibaba Cloud Model Studio, OpenRouter

Weitere Vergleiche