Saltar al contenido
reflectionbeam

Cara a cara

Beam vs Kimi K3

1:13

Beam gana 1 de las 14 pruebas comparativas compartidas

Veredicto

La propia Reflection señala a Kimi K3 como el modelo que sigue por delante en capacidad bruta. Kimi K3 gana 13 de los 14 benchmarks compartidos, a menudo por 10 puntos o más en programación agéntica y búsqueda. La única victoria de Beam es τ³ banking. La contrapartida es el tamaño: Kimi K3 tiene 2.8 billones de parámetros, con 104 mil millones activos por token, unas 4.5 veces los 23 mil millones de Beam, y sus pesos ocupan alrededor de 1.4 TB incluso en formato de 4 bits.

Prueba comparativa por prueba comparativa

BenchmarkBeamKimi K3Diferencia
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Todas las puntuaciones proceden del anuncio de Reflection (revisión del 8 de octubre de 2026). Las puntuaciones de Kimi K3 son las citadas por Reflection a partir de Artificial Analysis y DataCurve.

Los dos modelos

BeamKimi K3
DesarrolladorReflection AIMoonshot AI
SedeEstados UnidosChina
Parámetros (totales / activos)501B / 23B2.8T / 104B
PesosApache 2.0, prometida para más adelante en octubre de 2026Kimi K3 License (custom)
Lanzamiento5 de octubre de 202616 de julio de 2026
Cómo accederAPI beta con lista de espera; pesos próximamenteHugging Face, Moonshot API, OpenRouter

Otras comparaciones