ベンチマーク
Beamのベンチマーク結果
エージェント型コーディング、推論、ツール利用、汎用スキルにわたる21項目のベンチマークを、Reflectionが公開した内容そのままに、ほかの7つのオープンモデルと並べて掲載しています。
Reflectionの発表で報告された数値です(表は2026年10月8日に更新)。他モデルのスコアは、Reflectionが引用したArtificial AnalysisとDataCurveの数値です。重みが公開され次第、独立した再現テストを実施する予定です。
| ベンチマーク | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | — | — | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | — | — | 84.3 | 88.2 | — | — |
| SWE-Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | — | — | 67.7 | — |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | — | — | — | 61.0 | 68.0 | — | — |
| SWE-Bench Multilingual | 78.0 | — | 67.7 | — | — | — | — | — |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | — | — | — | — | — |
| AIME 2026 | 97.8 | 97.1 | — | 99.2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | — | 59.0 | 58.7 | 52.1 | 52.0 |
| CritPt (AA) | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87.0 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| AutomationBench (public) | 37.0 | — | — | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| MCP Atlas | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | — |
| τ³ banking | 38.0 | 25.0 | 22.6 | 37.1 | — | 37.1 | 55.2 | — |
| BrowseComp (context mgmt) | 77.4 | 77.1 | 44.4 | — | — | 91.2 | — | — |
| DeepSearchQA (context mgmt) | 80.1 | — | — | — | — | 95.0 | — | — |
| AA-LCR (long context) | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| LongBench v2 | 65.5 | — | 61.9 | 64.0 | — | — | 66.3 | — |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | — | — | 82.8 | — |
| AA Omniscience index (public split) | 13.0 | 14.2 | 8.6 | — | 22.6 | — | — | 6.6 |
00.0 行内で報告された最高スコア— 報告なし
数値からわかること
Beamはソフトウェアエンジニアリングで最も強みを発揮します。SWE-Bench Verifiedで80.9を記録し、Inklingの77.6を上回っています。また、SWE-Bench Multilingualでは78.0を記録し、Nemotron 3 Ultraの67.7を上回っています。これらのベンチマークは、より大規模な中国製モデルでは結果が報告されていません。さらに、SWE-Bench Pro v1(65.5対62.1)とMCP Atlas(78.7対77.8)でもGLM 5.2をわずかに上回っています。
純粋な推論では、トップモデルにやや及びません。GPQA Diamondでは90.5で、Kimi K3の93.5を下回っています。また、ツールなしのHumanity's Last Examでは36.2で、46.9には届いていません。
Reflectionの主張は、Beamがすべての項目で勝つということではありません。回答あたりの計算量を大幅に抑えながら、トップモデルに迫る性能を発揮するというものです。結果を報告している項目の大半では、依然としてKimi K3、GLM 5.3、Qwen 3.8 Maxがリードしています。
各ベンチマークの測定内容
エージェント型コーディング・ターミナル
- DeepSWE v1.1
- エージェントが長期にわたるソフトウェアエンジニアリングのタスクを、最初から最後まで解決する能力。
- SWE-Bench Pro v2-Hard
- SWE-Bench Proの高難度スプリット。現実のリポジトリにある難しい課題が対象です。
- SWE-Bench Pro v1
- プロのコードベースにおける実際のGitHub課題。従来のSWE-Benchより難易度が高く、データの汚染も少ないベンチマークです。
- Terminal-Bench v2.1
- 実際のLinuxターミナル内でタスクを完了する能力。シェル、ツール、ビルド、デバッグが対象です。
- SWE Atlas Codebase QnA
- 大規模で未知のコードベースに関する質問への回答。
- SWE-Bench Multilingual
- 複数のプログラミング言語にわたる、SWE-Bench形式の課題修正。
- SWE-Bench Verified
- SWE-Benchの人手検証済みサブセット:非公開テストに合格するよう課題を修正。
推論
- AIME 2026
- 2026年のアメリカ数学招待試験の問題。
- Humanity's Last Exam (no tools)
- Humanity's Last Exam:ツールを使わずに解答する、多分野にわたる専門家レベルの問題。
- SciCode
- 研究レベルの科学問題を解くコードの作成。
- CritPt (AA)
- Artificial Analysisが実施する、研究レベルの物理推論問題。
- GPQA Diamond
- 調べてすぐに答えが見つからないよう設計された、大学院レベルの生物学・化学・物理学の問題。
ツール呼び出し・検索
- AutomationBench (public)
- 複数のアプリにまたがる多段階の業務ワークフローの自動化。
- MCP Atlas
- Model Context Protocol(MCP)経由で公開されたツールの適切な使用。
- τ³ banking
- ツールやポリシーを使った、銀行業務分野のカスタマーサービス形式の会話。
- BrowseComp (context mgmt)
- コンテキストを管理しながらウェブを閲覧し、見つけにくい事実を探す。
- DeepSearchQA (context mgmt)
- 検索と情報源の統合が必要な、多段階の調査質問。
汎用能力
- AA-LCR (long context)
- 非常に長い文書に対する推論(Artificial Analysisの長文コンテキスト推論)。
- LongBench v2
- 長い入力の理解と、それに関する質問への回答。
- IFBench
- 正確で検証可能な形式および内容の指示に従うこと。
- AA Omniscience index (public split)
- 自信満々な誤答(幻覚)にペナルティを課す、事実知識の評価。