直接比較
Beam vs Inkling
13:2
共通するベンチマーク15件中、Beamが13件で勝利
判定
Thinking Machines LabのInklingは、2026年に登場したもう1つの米国の大型オープンウェイトモデルで、すでにApache 2.0で提供されています。Beamは共通する15のベンチマークのうち13でInklingを上回り、SWE-Bench Pro、Terminal-Bench、CritPtでは大差をつけています。IFBenchとAA Omniscience indexではInklingがわずかに優位です。Reflectionによると、InklingのRLでは3000万回のロールアウトが使われたのに対し、Beamでは1億回以上が使われました。
ベンチマークごとの比較
| ベンチマーク | Beam | Inkling | 差 | |
|---|---|---|---|---|
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | +20.3 | |
| SWE-Bench Pro v1 | 65.5 | 54.3 | +11.2 | |
| Terminal-Bench v2.1 | 80.1 | 63.8 | +16.3 | |
| SWE-Bench Verified | 80.9 | 77.6 | +3.3 | |
| AIME 2026 | 97.8 | 97.1 | +0.7 | |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | +6.5 | |
| SciCode | 49.7 | 46.1 | +3.6 | |
| CritPt (AA) | 16.3 | 5.4 | +10.9 | |
| GPQA Diamond | 90.5 | 87.2 | +3.3 | |
| MCP Atlas | 78.7 | 76.0 | +2.7 | |
| τ³ banking | 38.0 | 25.0 | +13.0 | |
| BrowseComp (context mgmt) | 77.4 | 77.1 | +0.3 | |
| AA-LCR (long context) | 79.3 | 77.3 | +2.0 | |
| IFBench | 79.7 | 79.8 | -0.1 | |
| AA Omniscience index (public split) | 13.0 | 14.2 | -1.2 |
すべてのスコアはReflectionの発表(2026年10月8日改訂版)に基づいています。Inklingのスコアは、ReflectionがArtificial AnalysisおよびDataCurveから引用したものです。
2つのモデル
| Beam | Inkling | |
|---|---|---|
| 開発元 | Reflection AI | Thinking Machines Lab |
| 拠点 | 米国 | 米国 |
| パラメータ(合計/有効) | 501B / 23B | 975B / 41B |
| 重み | Apache 2.0、2026年10月後半に提供予定 | Apache 2.0 |
| リリース日 | 2026年10月5日 | 2026年7月15日 |
| 利用方法 | ベータAPIはウェイトリスト制。モデルウェイトは近日公開予定 | Hugging Face, Tinker API |
その他の比較
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Beam 8–5共通するベンチマーク13件
Moonshot AI
Beam vs Kimi K3
Beam 1–13共通するベンチマーク14件
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Beam 0–13共通するベンチマーク13件
DeepSeek
Beam vs DeepSeek V4.1 Flash
Beam 2–7共通するベンチマーク9件
Z.ai (Zhipu AI)
Beam vs GLM 5.3
Beam 0–12共通するベンチマーク12件
NVIDIA
Beam vs Nemotron 3 Ultra
Beam 13–1共通するベンチマーク15件