Бенчмарки
Результаты Beam в бенчмарках
21 бенчмарк по агентному программированию, рассуждениям, использованию инструментов и общим способностям — точно в том виде, в каком их опубликовала Reflection, рядом с результатами семи других открытых моделей.
Это результаты, опубликованные разработчиками в анонсе Reflection (таблица обновлена October 8, 2026). Результаты других моделей взяты из Artificial Analysis и DataCurve, на которые ссылается Reflection. Независимые воспроизведения появятся после публикации весов.
| Бенчмарк | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Лучший опубликованный результат в строке— Не опубликовано
Что говорят цифры
Лучше всего Beam показывает себя в задачах по разработке ПО. Результат на SWE-Bench Verified — 80.9 (выше, чем 77.6 у Inkling), а на SWE-Bench Multilingual — 78.0 (выше, чем 67.7 у Nemotron 3 Ultra). Более крупные китайские модели не публиковали результаты по этим бенчмаркам. Кроме того, Beam немного опережает GLM 5.2 на SWE-Bench Pro v1 (65.5 против 62.1) и MCP Atlas (78.7 против 77.8).
В задачах на чистое рассуждение Beam немного уступает лидерам: 90.5 на GPQA Diamond против 93.5 у Kimi K3 и 36.2 на Humanity's Last Exam без инструментов против 46.9.
Тезис Reflection не в том, что Beam побеждает во всём, а в том, что он близок к лидерам, затрачивая на каждый ответ гораздо меньше вычислительных ресурсов. Kimi K3, GLM 5.3 и Qwen 3.8 Max по-прежнему лидируют в большинстве строк, где опубликованы их результаты.
Что измеряет каждый бенчмарк
Агентное программирование и работа в терминале
- DeepSWE v1.1
- Длительные задачи по разработке ПО, которые агент выполняет от начала до конца.
- SWE-Bench Pro v2-Hard
- Сложная часть SWE-Bench Pro: непростые задачи из реальных репозиториев.
- SWE-Bench Pro v1
- Реальные задачи из GitHub в профессиональных кодовых базах — сложнее и с меньшим риском попадания в обучающие данные, чем классический SWE-Bench.
- Terminal-Bench v2.1
- Выполнение задач в настоящем терминале Linux: работа с оболочкой, инструментами и сборками, а также отладка.
- SWE Atlas Codebase QnA
- Ответы на вопросы о крупных незнакомых кодовых базах.
- SWE-Bench Multilingual
- Исправление задач в стиле SWE-Bench на многих языках программирования.
- SWE-Bench Verified
- Проверенная людьми подвыборка SWE-Bench: исправьте проблему так, чтобы прошли скрытые тесты.
Рассуждение
- AIME 2026
- Задачи из AIME 2026 года.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: вопросы экспертного уровня по множеству областей, на которые нужно ответить без инструментов.
- SciCode
- Написание кода для решения научных задач исследовательского уровня.
- CritPt (AA)
- Задачи на физическое рассуждение исследовательского уровня, как в тестировании Artificial Analysis.
- GPQA Diamond
- Вопросы по биологии, химии и физике на уровне аспирантуры, ответы на которые трудно найти поиском.
Вызов инструментов и поиск
- AutomationBench (public)
- Автоматизация многоэтапных бизнес-процессов в разных приложениях.
- MCP Atlas
- Корректное использование инструментов, предоставляемых через Model Context Protocol (MCP).
- τ³ banking
- Диалоги в стиле службы поддержки клиентов в банковской сфере с использованием инструментов и политик.
- BrowseComp (context mgmt)
- Поиск труднодоступных фактов в интернете с управлением контекстом.
- DeepSearchQA (context mgmt)
- Многоэтапные исследовательские вопросы, требующие поиска и объединения источников.
Общие способности
- AA-LCR (long context)
- Рассуждения по очень длинным документам (длинноконтекстное рассуждение Artificial Analysis).
- LongBench v2
- Понимание длинных входных данных и ответы на вопросы по ним.
- IFBench
- Соблюдение точных, проверяемых инструкций по формату и содержанию.
- AA Omniscience index (public split)
- Фактические знания со штрафом за уверенные неверные ответы (галлюцинации).