맞대결
Beam vs Kimi K3
1:13
Beam은 공통 벤치마크 14개 중 1개에서 승리
결론
Reflection은 Kimi K3를 원시 성능에서 여전히 앞서는 모델로 직접 꼽습니다. Kimi K3는 공통 벤치마크 14개 중 13개에서 앞서며, 에이전트형 코딩과 검색에서는 종종 10점 이상 차이가 납니다. Beam이 앞서는 유일한 항목은 τ³ banking입니다. 다만 규모 차이가 있습니다. Kimi K3는 총 2조 8000억 매개변수에 토큰당 활성 매개변수 1040억으로, Beam의 230억보다 약 4.5배 많습니다. 가중치는 4비트 형식으로도 약 1.4 TB에 달합니다.
벤치마크별 비교
| 벤치마크 | Beam | Kimi K3 | 차이 | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | 68.0 | -23.6 | |
| SWE-Bench Pro v2-Hard | 77.2 | 88.2 | -11.0 | |
| Terminal-Bench v2.1 | 80.1 | 88.3 | -8.2 | |
| SWE Atlas Codebase QnA | 34.6 | 68.0 | -33.4 | |
| Humanity's Last Exam (no tools) | 36.2 | 46.9 | -10.7 | |
| SciCode | 49.7 | 58.7 | -9.0 | |
| CritPt (AA) | 16.3 | 23.4 | -7.1 | |
| GPQA Diamond | 90.5 | 93.5 | -3.0 | |
| AutomationBench (public) | 37.0 | 46.7 | -9.7 | |
| MCP Atlas | 78.7 | 82.3 | -3.6 | |
| τ³ banking | 38.0 | 37.1 | +0.9 | |
| BrowseComp (context mgmt) | 77.4 | 91.2 | -13.8 | |
| DeepSearchQA (context mgmt) | 80.1 | 95.0 | -14.9 | |
| AA-LCR (long context) | 79.3 | 88.7 | -9.4 |
모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. Kimi K3의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.
두 모델
| Beam | Kimi K3 | |
|---|---|---|
| 개발사 | Reflection AI | Moonshot AI |
| 기반 국가 | 미국 | 중국 |
| 매개변수(전체 / 활성) | 501B / 23B | 2.8T / 104B |
| 가중치 | Apache 2.0, 2026년 10월 후반 공개 예정 | Kimi K3 License (custom) |
| 출시일 | 2026년 10월 5일 | 2026년 7월 16일 |
| 이용 방법 | 대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개 | Hugging Face, Moonshot API, OpenRouter |
기타 비교
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–513개의 공통 벤치마크
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–1313개의 공통 벤치마크
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–79개의 공통 벤치마크
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–1212개의 공통 벤치마크
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–115개의 공통 벤치마크
Thinking Machines Lab
Beam vs Inkling
Beam 13–215개의 공통 벤치마크