본문으로 건너뛰기
reflectionbeam

벤치마크

Beam 벤치마크 결과

에이전트형 코딩, 추론, 도구 사용, 일반 역량에 걸친 21개 벤치마크 결과를 Reflection이 공개한 그대로 다른 오픈 모델 7종과 나란히 비교합니다.

Reflection의 발표 자료에 실린 제공업체 자체 보고 수치입니다(표는 2026년 10월 8일 업데이트). 다른 모델의 점수는 Reflection이 인용한 Artificial Analysis와 DataCurve 자료에서 가져왔습니다. 가중치가 공개되면 독립적인 재현 결과도 추가할 예정입니다.

벤치마크BeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4——44.061.068.051.074.2
SWE-Bench Pro v2-Hard77.256.9——84.388.2——
SWE-Bench Pro v165.554.346.462.1——67.7—
Terminal-Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6———61.068.0——
SWE-Bench Multilingual78.0—67.7—————
SWE-Bench Verified80.977.670.7—————
AIME 202697.897.1—99.2————
Humanity's Last Exam (no tools)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6—59.058.752.152.0
CritPt (AA)16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.287.091.291.793.592.690.9
AutomationBench (public)37.0——26.248.246.739.854.8
MCP Atlas78.776.063.177.884.282.384.5—
τ³ banking38.025.022.637.1—37.155.2—
BrowseComp (context mgmt)77.477.144.4——91.2——
DeepSearchQA (context mgmt)80.1————95.0——
AA-LCR (long context)79.377.379.378.379.788.780.384.0
LongBench v265.5—61.964.0——66.3—
IFBench79.779.881.773.3——82.8—
AA Omniscience index (public split)13.014.28.6—22.6——6.6

00.0 해당 항목에서 보고된 최고 점수— 보고되지 않음

수치가 보여주는 점

Beam은 소프트웨어 엔지니어링에서 가장 강력합니다. SWE-Bench Verified에서 80.9점으로 Inkling의 77.6점을 앞서고, SWE-Bench Multilingual에서 78.0점으로 Nemotron 3 Ultra의 67.7점을 앞섭니다. 대형 중국어 모델들은 이 벤치마크 결과를 보고하지 않았으며, Beam은 SWE-Bench Pro v1(65.5 대 62.1)과 MCP Atlas(78.7 대 77.8)에서도 GLM 5.2를 근소하게 앞섭니다.

순수 추론에서는 선두 모델보다 약간 뒤처집니다. GPQA Diamond에서 90.5점으로 Kimi K3의 93.5점에 못 미치고, 도구를 사용하지 않는 Humanity's Last Exam에서는 36.2점을 기록해 46.9점보다 낮습니다.

Reflection의 주장은 Beam이 모든 항목에서 이긴다는 것이 아니라, 답변당 훨씬 적은 연산량으로 선두에 근접한다는 것입니다. 결과를 보고한 항목 대부분에서는 여전히 Kimi K3, GLM 5.3, Qwen 3.8 Max가 앞섭니다.

각 벤치마크가 측정하는 항목

에이전트형 코딩 및 터미널

DeepSWE v1.1
에이전트가 장기간 진행되는 소프트웨어 엔지니어링 작업을 처음부터 끝까지 해결하는 능력.
SWE-Bench Pro v2-Hard
SWE-Bench Pro의 어려운 데이터 분할: 실제 저장소의 까다로운 문제.
SWE-Bench Pro v1
전문 개발 코드베이스의 실제 GitHub 이슈. 기존 SWE-Bench보다 어렵고 데이터 오염 가능성이 낮습니다.
Terminal-Bench v2.1
실제 Linux 터미널에서 셸, 도구, 빌드, 디버깅을 활용해 작업을 완료하는 능력.
SWE Atlas Codebase QnA
대규모의 낯선 코드베이스에 관한 질문에 답하기.
SWE-Bench Multilingual
여러 프로그래밍 언어에 걸쳐 SWE-Bench 유형의 이슈 해결하기.
SWE-Bench Verified
사람이 검증한 SWE-Bench 하위 집합: 숨겨진 테스트를 통과하도록 이슈 수정하기.

추론

AIME 2026
2026년 AIME 문제.
Humanity's Last Exam (no tools)
Humanity's Last Exam: 도구를 사용하지 않고 답하는 여러 분야의 전문가 수준 질문.
SciCode
연구 수준의 과학 문제를 해결하는 코드 작성하기.
CritPt (AA)
Artificial Analysis 평가의 연구 수준 물리 추론 문제.
GPQA Diamond
검색으로 답을 찾기 어렵도록 설계된 대학원 수준의 생물학, 화학, 물리학 질문.

도구 호출 및 검색

AutomationBench (public)
여러 앱에서 다단계 비즈니스 워크플로 자동화하기.
MCP Atlas
Model Context Protocol (MCP)을 통해 제공되는 도구를 올바르게 사용하기.
τ³ banking
도구와 정책을 사용하는 은행 업무 관련 고객 서비스 유형 대화.
BrowseComp (context mgmt)
맥락을 관리하면서 웹을 탐색해 찾기 어려운 정보 찾기.
DeepSearchQA (context mgmt)
검색하고 여러 출처의 정보를 결합해야 하는 다단계 조사 질문.

일반 역량

AA-LCR (long context)
매우 긴 문서에 대해 추론하기(Artificial Analysis의 긴 컨텍스트 추론).
LongBench v2
긴 입력을 이해하고 질문에 답하기.
IFBench
정확하고 검증 가능한 형식 및 내용 지침 따르기.
AA Omniscience index (public split)
확신에 찬 오답(환각)에 페널티를 적용하는 사실 지식 평가.