Lewati ke konten
reflectionbeam

Adu langsung

Beam vs Kimi K3

1:13

Beam unggul pada 1 dari 14 benchmark yang sama

Kesimpulan

Reflection sendiri menyebut Kimi K3 sebagai model yang masih unggul dalam kemampuan mentah. Kimi K3 menang pada 13 dari 14 benchmark yang sama, sering kali dengan keunggulan 10 poin atau lebih dalam coding agen dan pencarian. Satu-satunya kemenangan Beam adalah τ³ banking. Komprominya adalah ukuran: Kimi K3 memiliki 2.8 triliun parameter dengan 104 miliar parameter aktif per token, sekitar 4.5 kali jumlah 23 miliar milik Beam, dan bobotnya membutuhkan sekitar 1.4 TB bahkan dalam format 4-bit.

Perbandingan per benchmark

BenchmarkBeamKimi K3Selisih
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Semua skor berasal dari pengumuman Reflection (revisi 8 Oktober 2026). Skor untuk Kimi K3 adalah sebagaimana dikutip Reflection dari Artificial Analysis dan DataCurve.

Kedua model

BeamKimi K3
DeveloperReflection AIMoonshot AI
Berbasis diAmerika SerikatChina
Parameter (total / aktif)501B / 23B2.8T / 104B
BobotApache 2.0, dijanjikan hadir nanti pada Oktober 2026Kimi K3 License (custom)
Dirilis5 Oktober 202616 Juli 2026
Cara mengaksesAPI beta masuk daftar tunggu; bobot segera hadirHugging Face, Moonshot API, OpenRouter

Perbandingan lainnya