Passer au contenu
reflectionbeam

Face à face

Beam vs Kimi K3

1:13

Beam remporte 1 des 14 benchmarks communs

Verdict

Reflection cite elle-même Kimi K3 comme le modèle qui reste devant en capacités brutes. Kimi K3 remporte 13 des 14 benchmarks communs, souvent avec au moins 10 points d’avance en codage agentique et en recherche. La seule victoire de Beam est sur τ³ banking. Le compromis, c’est la taille : Kimi K3 compte 2.8 billions de paramètres, dont 104 milliards actifs par token, soit environ 4,5 fois les 23 milliards de Beam, et ses poids occupent environ 1.4 TB, même en format 4 bits.

Benchmark par benchmark

BenchmarkBeamKimi K3Écart
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Tous les scores proviennent de l’annonce de Reflection (révision du 8 octobre 2026). Les scores de Kimi K3 sont ceux cités par Reflection, d’après Artificial Analysis et DataCurve.

Les deux modèles

BeamKimi K3
DéveloppeurReflection AIMoonshot AI
Basé àÉtats-UnisChine
Paramètres (total / actifs)501B / 23B2.8T / 104B
PoidsApache 2.0, promis pour plus tard en octobre 2026Kimi K3 License (custom)
Date de sortie5 octobre 202616 juillet 2026
Moyens d’accèsAPI bêta sur liste d’attente ; poids à venirHugging Face, Moonshot API, OpenRouter

Autres comparaisons