Ga naar de inhoud
reflectionbeam

Directe vergelijking

Beam vs Kimi K3

1:13

Beam wint 1 van de 14 gedeelde benchmarks

Conclusie

Reflection noemt Kimi K3 zelf als het model dat qua pure mogelijkheden nog vooroploopt. Kimi K3 wint 13 van de 14 gedeelde benchmarks, vaak met 10 punten of meer voor agentic coding en search. Beam wint alleen op τ³ banking. De afweging zit in de omvang: Kimi K3 heeft 2,8 biljoen parameters, waarvan er 104 miljard actief zijn per token — ongeveer 4,5 keer Beam's 23 miljard. Zelfs in 4-bit-formaat nemen de gewichten ongeveer 1,4 TB in beslag.

Benchmark voor benchmark

BenchmarkBeamKimi K3Verschil
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Alle scores komen uit de aankondiging van Reflection (herzien op 8 oktober 2026). De scores voor Kimi K3 zijn zoals Reflection ze citeert van Artificial Analysis en DataCurve.

De twee modellen

BeamKimi K3
OntwikkelaarReflection AIMoonshot AI
Gevestigd inVerenigde StatenChina
Parameters (totaal / actief)501B / 23B2.8T / 104B
GewichtenApache 2.0, beloofd voor later in oktober 2026Kimi K3 License (custom)
Uitgebracht5 oktober 202616 juli 2026
ToegangAPI in bèta met wachtlijst; gewichten volgenHugging Face, Moonshot API, OpenRouter

Andere vergelijkingen