Pular para o conteúdo
reflectionbeam

Confronto direto

Beam vs Qwen 3.8 Max

0:13

Beam vence em 0 dos 13 benchmarks em comum

Veredito

Qwen 3.8 Max lidera em todos os 13 benchmarks em comum, embora algumas diferenças sejam pequenas (GPQA 92.6 vs 90.5, AA-LCR 80.3 vs 79.3, LongBench 66.3 vs 65.5). Qwen 3.8 Max é um modelo de 2,4 trilhões de parâmetros, com 95 bilhões ativos por token, cerca de quatro vezes o tamanho ativo de Beam, diferença de computação apontada pela Reflection.

Benchmark por benchmark

BenchmarkBeamQwen 3.8 MaxDiferença
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Todas as pontuações vêm do anúncio da Reflection (revisão de 8 de outubro de 2026). As pontuações de Qwen 3.8 Max são as citadas pela Reflection, com base em Artificial Analysis e DataCurve.

Os dois modelos

BeamQwen 3.8 Max
DesenvolvedorReflection AIAlibaba (Qwen)
Sediado emEstados UnidosChina
Parâmetros (total / ativos)501B / 23B2.4T / 95B
PesosApache 2.0, prometida para mais tarde em outubro de 2026Qwen3.8-Max License (custom)
Lançado5 de outubro de 20263 de agosto de 2026
Como acessarAPI beta com lista de espera; pesos a caminhoHugging Face, Alibaba Cloud Model Studio, OpenRouter

Outras comparações