Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs Kimi K3

1:13

Beam gewinnt 1 von 14 gemeinsamen Benchmarks

Fazit

Reflection selbst nennt Kimi K3 als das Modell, das bei den reinen Fähigkeiten weiterhin vorne liegt. Kimi K3 gewinnt 13 der 14 gemeinsamen Benchmarks, oft mit mindestens 10 Punkten Vorsprung bei agentischem Programmieren und bei Suchaufgaben. Beams einziger Sieg ist τ³ banking. Der Kompromiss ist die Größe: Kimi K3 hat 2.8 Billionen Parameter und 104 Milliarden aktive Parameter pro Token, etwa 4.5-mal so viele wie Beams 23 Milliarden. Selbst in 4-Bit-Form nehmen seine Gewichte rund 1.4 TB ein.

Benchmark für Benchmark

BenchmarkBeamKimi K3Differenz
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für Kimi K3 sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamKimi K3
EntwicklerReflection AIMoonshot AI
SitzVereinigte StaatenChina
Parameter (gesamt / aktiv)501B / 23B2.8T / 104B
GewichteApache 2.0, für später im Oktober 2026 angekündigtKimi K3 License (custom)
Veröffentlicht5. Oktober 202616. Juli 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, Moonshot API, OpenRouter

Weitere Vergleiche