Lewati ke konten
reflectionbeam

Adu langsung

Beam vs Qwen 3.8 Max

0:13

Beam unggul pada 0 dari 13 benchmark yang sama

Kesimpulan

Qwen 3.8 Max unggul pada setiap dari 13 benchmark yang sama, meskipun beberapa selisihnya kecil (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Qwen 3.8 Max adalah model dengan 2.4 triliun parameter dan 95 miliar parameter aktif per token, sekitar empat kali ukuran aktif Beam, yang menurut Reflection menjelaskan kesenjangan komputasi.

Perbandingan per benchmark

BenchmarkBeamQwen 3.8 MaxSelisih
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Semua skor berasal dari pengumuman Reflection (revisi 8 Oktober 2026). Skor untuk Qwen 3.8 Max adalah sebagaimana dikutip Reflection dari Artificial Analysis dan DataCurve.

Kedua model

BeamQwen 3.8 Max
DeveloperReflection AIAlibaba (Qwen)
Berbasis diAmerika SerikatChina
Parameter (total / aktif)501B / 23B2.4T / 95B
BobotApache 2.0, dijanjikan hadir nanti pada Oktober 2026Qwen3.8-Max License (custom)
Dirilis5 Oktober 20263 Agustus 2026
Cara mengaksesAPI beta masuk daftar tunggu; bobot segera hadirHugging Face, Alibaba Cloud Model Studio, OpenRouter

Perbandingan lainnya