Benchmarks
Resultados de benchmark do Beam
21 benchmarks de programação agêntica, raciocínio, uso de ferramentas e habilidades gerais, exatamente como publicados pela Reflection, ao lado de outros sete modelos abertos.
Estes são números divulgados pelos fornecedores no anúncio da Reflection (tabela atualizada em October 8, 2026). As pontuações dos outros modelos vêm da Artificial Analysis e da DataCurve, conforme citadas pela Reflection. Reproduções independentes virão quando os pesos forem públicos.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Melhor pontuação divulgada na linha— Não divulgado
O que os números mostram
O Beam se destaca mais em engenharia de software. Ele marca 80.9 no SWE-Bench Verified (à frente dos 77.6 do Inkling) e 78.0 no SWE-Bench Multilingual (à frente dos 67.7 do Nemotron 3 Ultra), benchmarks cujos resultados os modelos chineses maiores não divulgaram; além disso, supera por pouco o GLM 5.2 no SWE-Bench Pro v1 (65.5 vs 62.1) e no MCP Atlas (78.7 vs 77.8).
Em raciocínio puro, fica um pouco atrás dos líderes: 90.5 no GPQA Diamond, contra 93.5 do Kimi K3, e 36.2 no Humanity's Last Exam sem ferramentas, contra 46.9.
O argumento da Reflection não é que Beam vence em tudo, mas que chega perto usando muito menos computação por resposta. Kimi K3, GLM 5.3 e Qwen 3.8 Max ainda lideram na maioria das linhas em que divulgaram resultados.
O que cada benchmark mede
Programação agêntica e terminal
- DeepSWE v1.1
- Tarefas de engenharia de software de longa duração, resolvidas de ponta a ponta por um agente.
- SWE-Bench Pro v2-Hard
- A divisão mais difícil do SWE-Bench Pro: problemas complexos de repositórios do mundo real.
- SWE-Bench Pro v1
- Problemas reais do GitHub em bases de código profissionais, mais difíceis e menos sujeitos à contaminação do que o SWE-Bench clássico.
- Terminal-Bench v2.1
- Conclusão de tarefas em um terminal Linux real: shell, ferramentas, compilações e depuração.
- SWE Atlas Codebase QnA
- Responder a perguntas sobre bases de código grandes e desconhecidas.
- SWE-Bench Multilingual
- Resolver issues no estilo SWE-Bench em várias linguagens de programação.
- SWE-Bench Verified
- Subconjunto do SWE-Bench verificado por humanos: corrigir o problema para que os testes ocultos passem.
Raciocínio
- AIME 2026
- Problemas do American Invitational Mathematics Examination de 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: perguntas de nível especialista em diversas áreas, respondidas sem ferramentas.
- SciCode
- Escrever código para resolver problemas científicos de nível de pesquisa.
- CritPt (AA)
- Problemas de raciocínio em física de nível de pesquisa, conforme executados pela Artificial Analysis.
- GPQA Diamond
- Perguntas avançadas de biologia, química e física, elaboradas para serem difíceis de responder apenas com pesquisa.
Uso de ferramentas e pesquisa
- AutomationBench (public)
- Automatizar fluxos de trabalho empresariais com várias etapas entre aplicativos.
- MCP Atlas
- Usar corretamente as ferramentas disponibilizadas pelo Model Context Protocol (MCP).
- τ³ banking
- Conversas de atendimento ao cliente no setor bancário, com ferramentas e políticas.
- BrowseComp (context mgmt)
- Encontrar fatos difíceis de localizar pesquisando na web, com gerenciamento de contexto.
- DeepSearchQA (context mgmt)
- Perguntas de pesquisa com várias etapas que exigem buscar e combinar fontes.
Capacidades gerais
- AA-LCR (long context)
- Raciocínio sobre documentos muito extensos (raciocínio de contexto longo da Artificial Analysis).
- LongBench v2
- Compreender e responder a perguntas sobre entradas longas.
- IFBench
- Seguir instruções precisas e verificáveis de formatação e conteúdo.
- AA Omniscience index (public split)
- Conhecimento factual com penalidade por respostas erradas dadas com confiança (alucinações).