본문으로 건너뛰기
reflectionbeam

맞대결

Beam vs Kimi K3

1:13

Beam은 공통 벤치마크 14개 중 1개에서 승리

결론

Reflection은 Kimi K3를 원시 성능에서 여전히 앞서는 모델로 직접 꼽습니다. Kimi K3는 공통 벤치마크 14개 중 13개에서 앞서며, 에이전트형 코딩과 검색에서는 종종 10점 이상 차이가 납니다. Beam이 앞서는 유일한 항목은 τ³ banking입니다. 다만 규모 차이가 있습니다. Kimi K3는 총 2조 8000억 매개변수에 토큰당 활성 매개변수 1040억으로, Beam의 230억보다 약 4.5배 많습니다. 가중치는 4비트 형식으로도 약 1.4 TB에 달합니다.

벤치마크별 비교

벤치마크BeamKimi K3차이
DeepSWE v1.144.468.0-23.6
SWE-Bench Pro v2-Hard77.288.2-11.0
Terminal-Bench v2.180.188.3-8.2
SWE Atlas Codebase QnA34.668.0-33.4
Humanity's Last Exam (no tools)36.246.9-10.7
SciCode49.758.7-9.0
CritPt (AA)16.323.4-7.1
GPQA Diamond90.593.5-3.0
AutomationBench (public)37.046.7-9.7
MCP Atlas78.782.3-3.6
τ³ banking38.037.1+0.9
BrowseComp (context mgmt)77.491.2-13.8
DeepSearchQA (context mgmt)80.195.0-14.9
AA-LCR (long context)79.388.7-9.4

모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. Kimi K3의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.

두 모델

BeamKimi K3
개발사Reflection AIMoonshot AI
기반 국가미국중국
매개변수(전체 / 활성)501B / 23B2.8T / 104B
가중치Apache 2.0, 2026년 10월 후반 공개 예정Kimi K3 License (custom)
출시일2026년 10월 5일2026년 7월 16일
이용 방법대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개Hugging Face, Moonshot API, OpenRouter

기타 비교