Saltar al contenido
reflectionbeam

Cara a cara

Beam vs Qwen 3.8 Max

0:13

Beam gana 0 de las 13 pruebas comparativas compartidas

Veredicto

Qwen 3.8 Max lidera en los 13 benchmarks compartidos, aunque varias diferencias son pequeñas (GPQA 92.6 frente a 90.5, AA-LCR 80.3 frente a 79.3, LongBench 66.3 frente a 65.5). Qwen 3.8 Max es un modelo de 2.4 billones de parámetros, con 95 mil millones activos por token, aproximadamente cuatro veces el tamaño activo de Beam, y esa es la diferencia de cómputo a la que apunta Reflection.

Prueba comparativa por prueba comparativa

BenchmarkBeamQwen 3.8 MaxDiferencia
DeepSWE v1.144,451,0-6,6
SWE-Bench Pro v165,567,7-2,2
Terminal-Bench v2.180,186,6-6,5
Humanity's Last Exam (no tools)36,243,6-7,4
SciCode49,752,1-2,4
CritPt (AA)16,320,0-3,7
GPQA Diamond90,592,6-2,1
AutomationBench (public)37,039,8-2,8
MCP Atlas78,784,5-5,8
τ³ banking38,055,2-17,2
AA-LCR (long context)79,380,3-1,0
LongBench v265,566,3-0,8
IFBench79,782,8-3,1

Todas las puntuaciones proceden del anuncio de Reflection (revisión del 8 de octubre de 2026). Las puntuaciones de Qwen 3.8 Max son las citadas por Reflection a partir de Artificial Analysis y DataCurve.

Los dos modelos

BeamQwen 3.8 Max
DesarrolladorReflection AIAlibaba (Qwen)
SedeEstados UnidosChina
Parámetros (totales / activos)501B / 23B2.4T / 95B
PesosApache 2.0, prometida para más adelante en octubre de 2026Qwen3.8-Max License (custom)
Lanzamiento5 de octubre de 20263 de agosto de 2026
Cómo accederAPI beta con lista de espera; pesos próximamenteHugging Face, Alibaba Cloud Model Studio, OpenRouter

Otras comparaciones