Lumaktaw sa nilalaman
reflectionbeam

Direktang paghahambing

Beam vs Kimi K3

1:13

Nanalo ang Beam sa 1 sa 14 benchmark na pareho nilang iniulat

Pasya

Kimi K3 ang modelong mismong tinukoy ng Reflection na nananatiling nangunguna sa hilaw na kakayahan. Panalo ang Kimi K3 sa 13 sa 14 na magkakaparehong benchmark, kadalasan ay may lamang na 10 puntos o higit pa sa agentic coding at paghahanap. τ³ banking lang ang benchmark na napapanalunan ng Beam. Ang kapalit nito ay laki: may 2.8 trilyong parameter ang Kimi K3, at 104 bilyon ang aktibo sa bawat token—humigit-kumulang 4.5 beses ng 23 bilyon ng Beam—at umaabot sa mga 1.4 TB ang mga weight nito kahit nasa 4-bit na anyo.

Bawat benchmark

BenchmarkBeamKimi K3Pagkakaiba
DeepSWE v1.144.468.0-23.6
SWE-Bench Pro v2-Hard77.288.2-11.0
Terminal-Bench v2.180.188.3-8.2
SWE Atlas Codebase QnA34.668.0-33.4
Humanity's Last Exam (no tools)36.246.9-10.7
SciCode49.758.7-9.0
CritPt (AA)16.323.4-7.1
GPQA Diamond90.593.5-3.0
AutomationBench (public)37.046.7-9.7
MCP Atlas78.782.3-3.6
τ³ banking38.037.1+0.9
BrowseComp (context mgmt)77.491.2-13.8
DeepSearchQA (context mgmt)80.195.0-14.9
AA-LCR (long context)79.388.7-9.4

Lahat ng score ay mula sa anunsyo ng Reflection (rebisyon noong October 8, 2026). Ang mga score para sa Kimi K3 ay ayon sa mga binanggit ng Reflection mula sa Artificial Analysis at DataCurve.

Ang dalawang modelo

BeamKimi K3
DeveloperReflection AIMoonshot AI
Nakabase saEstados UnidosTsina
Mga parameter (kabuuan / aktibo)501B / 23B2.8T / 104B
Mga weightApache 2.0, ipinangako para sa bandang huling bahagi ng Oktubre 2026Kimi K3 License (custom)
InilabasOktubre 5, 2026Hulyo 16, 2026
Paano mag-accessAPI beta na nasa waitlist; paparating ang mga weightHugging Face, Moonshot API, OpenRouter

Iba pang paghahambing