Saltar al contenido
reflectionbeam

Cara a cara

Beam vs DeepSeek V4.1 Flash

2:7

Beam gana 2 de las 9 pruebas comparativas compartidas

Veredicto

DeepSeek V4.1 Flash va por delante en 7 de los 9 benchmarks compartidos, con grandes ventajas en DeepSWE y AutomationBench y una ventaja de 10 puntos en Terminal-Bench. Beam gana en CritPt y tiene un índice AA Omniscience mejor, que penaliza las respuestas incorrectas dadas con seguridad. En este caso, Beam no sale favorecido en eficiencia: DeepSeek V4.1 Flash activa solo 16 mil millones de parámetros por token generado, menos que los 23 mil millones de Beam, y sus pesos ya son públicos con licencia MIT.

Prueba comparativa por prueba comparativa

BenchmarkBeamDeepSeek V4.1 FlashDiferencia
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Todas las puntuaciones proceden del anuncio de Reflection (revisión del 8 de octubre de 2026). Las puntuaciones de DeepSeek V4.1 Flash son las citadas por Reflection a partir de Artificial Analysis y DataCurve.

Los dos modelos

BeamDeepSeek V4.1 Flash
DesarrolladorReflection AIDeepSeek
SedeEstados UnidosChina
Parámetros (totales / activos)501B / 23B552B / 16B
PesosApache 2.0, prometida para más adelante en octubre de 2026MIT
Lanzamiento5 de octubre de 202610 de septiembre de 2026
Cómo accederAPI beta con lista de espera; pesos próximamenteHugging Face, DeepSeek API, OpenRouter

Otras comparaciones