Pular para o conteúdo
reflectionbeam

Benchmarks

Resultados de benchmark do Beam

21 benchmarks de programação agêntica, raciocínio, uso de ferramentas e habilidades gerais, exatamente como publicados pela Reflection, ao lado de outros sete modelos abertos.

Estes são números divulgados pelos fornecedores no anúncio da Reflection (tabela atualizada em October 8, 2026). As pontuações dos outros modelos vêm da Artificial Analysis e da DataCurve, conforme citadas pela Reflection. Reproduções independentes virão quando os pesos forem públicos.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Melhor pontuação divulgada na linha— Não divulgado

O que os números mostram

O Beam se destaca mais em engenharia de software. Ele marca 80.9 no SWE-Bench Verified (à frente dos 77.6 do Inkling) e 78.0 no SWE-Bench Multilingual (à frente dos 67.7 do Nemotron 3 Ultra), benchmarks cujos resultados os modelos chineses maiores não divulgaram; além disso, supera por pouco o GLM 5.2 no SWE-Bench Pro v1 (65.5 vs 62.1) e no MCP Atlas (78.7 vs 77.8).

Em raciocínio puro, fica um pouco atrás dos líderes: 90.5 no GPQA Diamond, contra 93.5 do Kimi K3, e 36.2 no Humanity's Last Exam sem ferramentas, contra 46.9.

O argumento da Reflection não é que Beam vence em tudo, mas que chega perto usando muito menos computação por resposta. Kimi K3, GLM 5.3 e Qwen 3.8 Max ainda lideram na maioria das linhas em que divulgaram resultados.

O que cada benchmark mede

Programação agêntica e terminal

DeepSWE v1.1
Tarefas de engenharia de software de longa duração, resolvidas de ponta a ponta por um agente.
SWE-Bench Pro v2-Hard
A divisão mais difícil do SWE-Bench Pro: problemas complexos de repositórios do mundo real.
SWE-Bench Pro v1
Problemas reais do GitHub em bases de código profissionais, mais difíceis e menos sujeitos à contaminação do que o SWE-Bench clássico.
Terminal-Bench v2.1
Conclusão de tarefas em um terminal Linux real: shell, ferramentas, compilações e depuração.
SWE Atlas Codebase QnA
Responder a perguntas sobre bases de código grandes e desconhecidas.
SWE-Bench Multilingual
Resolver issues no estilo SWE-Bench em várias linguagens de programação.
SWE-Bench Verified
Subconjunto do SWE-Bench verificado por humanos: corrigir o problema para que os testes ocultos passem.

Raciocínio

AIME 2026
Problemas do American Invitational Mathematics Examination de 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: perguntas de nível especialista em diversas áreas, respondidas sem ferramentas.
SciCode
Escrever código para resolver problemas científicos de nível de pesquisa.
CritPt (AA)
Problemas de raciocínio em física de nível de pesquisa, conforme executados pela Artificial Analysis.
GPQA Diamond
Perguntas avançadas de biologia, química e física, elaboradas para serem difíceis de responder apenas com pesquisa.

Uso de ferramentas e pesquisa

AutomationBench (public)
Automatizar fluxos de trabalho empresariais com várias etapas entre aplicativos.
MCP Atlas
Usar corretamente as ferramentas disponibilizadas pelo Model Context Protocol (MCP).
τ³ banking
Conversas de atendimento ao cliente no setor bancário, com ferramentas e políticas.
BrowseComp (context mgmt)
Encontrar fatos difíceis de localizar pesquisando na web, com gerenciamento de contexto.
DeepSearchQA (context mgmt)
Perguntas de pesquisa com várias etapas que exigem buscar e combinar fontes.

Capacidades gerais

AA-LCR (long context)
Raciocínio sobre documentos muito extensos (raciocínio de contexto longo da Artificial Analysis).
LongBench v2
Compreender e responder a perguntas sobre entradas longas.
IFBench
Seguir instruções precisas e verificáveis de formatação e conteúdo.
AA Omniscience index (public split)
Conhecimento factual com penalidade por respostas erradas dadas com confiança (alucinações).