맞대결
Beam vs Inkling
13:2
Beam은 공통 벤치마크 15개 중 13개에서 승리
결론
Thinking Machines Lab의 Inkling은 2026년의 또 다른 주요 미국 오픈 가중치 모델로, 이미 Apache 2.0 라이선스로 제공됩니다. Beam은 공통 벤치마크 15개 중 13개에서 앞서며, SWE-Bench Pro, Terminal-Bench, CritPt에서 큰 차이를 보입니다. Inkling은 IFBench와 AA Omniscience index에서 근소하게 앞섭니다. Reflection은 Inkling의 RL에 3000만 회의 롤아웃이 사용된 반면 Beam에는 1억 회 이상이 사용됐다고 밝혔습니다.
벤치마크별 비교
| 벤치마크 | Beam | Inkling | 차이 | |
|---|---|---|---|---|
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | +20.3 | |
| SWE-Bench Pro v1 | 65.5 | 54.3 | +11.2 | |
| Terminal-Bench v2.1 | 80.1 | 63.8 | +16.3 | |
| SWE-Bench Verified | 80.9 | 77.6 | +3.3 | |
| AIME 2026 | 97.8 | 97.1 | +0.7 | |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | +6.5 | |
| SciCode | 49.7 | 46.1 | +3.6 | |
| CritPt (AA) | 16.3 | 5.4 | +10.9 | |
| GPQA Diamond | 90.5 | 87.2 | +3.3 | |
| MCP Atlas | 78.7 | 76.0 | +2.7 | |
| τ³ banking | 38.0 | 25.0 | +13.0 | |
| BrowseComp (context mgmt) | 77.4 | 77.1 | +0.3 | |
| AA-LCR (long context) | 79.3 | 77.3 | +2.0 | |
| IFBench | 79.7 | 79.8 | -0.1 | |
| AA Omniscience index (public split) | 13.0 | 14.2 | -1.2 |
모든 점수는 Reflection의 발표(2026년 10월 8일 개정판)에서 가져왔습니다. Inkling의 점수는 Reflection이 Artificial Analysis와 DataCurve를 인용한 값입니다.
두 모델
| Beam | Inkling | |
|---|---|---|
| 개발사 | Reflection AI | Thinking Machines Lab |
| 기반 국가 | 미국 | 미국 |
| 매개변수(전체 / 활성) | 501B / 23B | 975B / 41B |
| 가중치 | Apache 2.0, 2026년 10월 후반 공개 예정 | Apache 2.0 |
| 출시일 | 2026년 10월 5일 | 2026년 7월 15일 |
| 이용 방법 | 대기자 명단에 등록해야 하는 베타 API, 가중치는 추후 공개 | Hugging Face, Tinker API |
기타 비교
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–513개의 공통 벤치마크
Moonshot AI
Beam vs Kimi K3
Beam 1–1314개의 공통 벤치마크
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–1313개의 공통 벤치마크
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–79개의 공통 벤치마크
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–1212개의 공통 벤치마크
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–115개의 공통 벤치마크