Перейти к содержимому
reflectionbeam

Бенчмарки

Результаты Beam в бенчмарках

21 бенчмарк по агентному программированию, рассуждениям, использованию инструментов и общим способностям — точно в том виде, в каком их опубликовала Reflection, рядом с результатами семи других открытых моделей.

Это результаты, опубликованные разработчиками в анонсе Reflection (таблица обновлена October 8, 2026). Результаты других моделей взяты из Artificial Analysis и DataCurve, на которые ссылается Reflection. Независимые воспроизведения появятся после публикации весов.

БенчмаркBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Лучший опубликованный результат в строке— Не опубликовано

Что говорят цифры

Лучше всего Beam показывает себя в задачах по разработке ПО. Результат на SWE-Bench Verified — 80.9 (выше, чем 77.6 у Inkling), а на SWE-Bench Multilingual — 78.0 (выше, чем 67.7 у Nemotron 3 Ultra). Более крупные китайские модели не публиковали результаты по этим бенчмаркам. Кроме того, Beam немного опережает GLM 5.2 на SWE-Bench Pro v1 (65.5 против 62.1) и MCP Atlas (78.7 против 77.8).

В задачах на чистое рассуждение Beam немного уступает лидерам: 90.5 на GPQA Diamond против 93.5 у Kimi K3 и 36.2 на Humanity's Last Exam без инструментов против 46.9.

Тезис Reflection не в том, что Beam побеждает во всём, а в том, что он близок к лидерам, затрачивая на каждый ответ гораздо меньше вычислительных ресурсов. Kimi K3, GLM 5.3 и Qwen 3.8 Max по-прежнему лидируют в большинстве строк, где опубликованы их результаты.

Что измеряет каждый бенчмарк

Агентное программирование и работа в терминале

DeepSWE v1.1
Длительные задачи по разработке ПО, которые агент выполняет от начала до конца.
SWE-Bench Pro v2-Hard
Сложная часть SWE-Bench Pro: непростые задачи из реальных репозиториев.
SWE-Bench Pro v1
Реальные задачи из GitHub в профессиональных кодовых базах — сложнее и с меньшим риском попадания в обучающие данные, чем классический SWE-Bench.
Terminal-Bench v2.1
Выполнение задач в настоящем терминале Linux: работа с оболочкой, инструментами и сборками, а также отладка.
SWE Atlas Codebase QnA
Ответы на вопросы о крупных незнакомых кодовых базах.
SWE-Bench Multilingual
Исправление задач в стиле SWE-Bench на многих языках программирования.
SWE-Bench Verified
Проверенная людьми подвыборка SWE-Bench: исправьте проблему так, чтобы прошли скрытые тесты.

Рассуждение

AIME 2026
Задачи из AIME 2026 года.
Humanity's Last Exam (no tools)
Humanity's Last Exam: вопросы экспертного уровня по множеству областей, на которые нужно ответить без инструментов.
SciCode
Написание кода для решения научных задач исследовательского уровня.
CritPt (AA)
Задачи на физическое рассуждение исследовательского уровня, как в тестировании Artificial Analysis.
GPQA Diamond
Вопросы по биологии, химии и физике на уровне аспирантуры, ответы на которые трудно найти поиском.

Вызов инструментов и поиск

AutomationBench (public)
Автоматизация многоэтапных бизнес-процессов в разных приложениях.
MCP Atlas
Корректное использование инструментов, предоставляемых через Model Context Protocol (MCP).
τ³ banking
Диалоги в стиле службы поддержки клиентов в банковской сфере с использованием инструментов и политик.
BrowseComp (context mgmt)
Поиск труднодоступных фактов в интернете с управлением контекстом.
DeepSearchQA (context mgmt)
Многоэтапные исследовательские вопросы, требующие поиска и объединения источников.

Общие способности

AA-LCR (long context)
Рассуждения по очень длинным документам (длинноконтекстное рассуждение Artificial Analysis).
LongBench v2
Понимание длинных входных данных и ответы на вопросы по ним.
IFBench
Соблюдение точных, проверяемых инструкций по формату и содержанию.
AA Omniscience index (public split)
Фактические знания со штрафом за уверенные неверные ответы (галлюцинации).