Benchmarks
Resultados de Beam en benchmarks
21 benchmarks de programación agéntica, razonamiento, uso de herramientas y capacidades generales, tal como los publicó Reflection, junto a otros siete modelos abiertos.
Estas son cifras comunicadas por el proveedor en el anuncio de Reflection (tabla actualizada el 8 de octubre de 2026). Las puntuaciones de los otros modelos provienen de Artificial Analysis y DataCurve, según las citas de Reflection. Las reproducciones independientes llegarán cuando los pesos sean públicos.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Mejor puntuación publicada en la fila— No informado
Qué indican las cifras
Beam destaca en ingeniería de software. Obtiene 80.9 en SWE-Bench Verified (por delante de Inkling, con 77.6) y 78.0 en SWE-Bench Multilingual (por delante de Nemotron 3 Ultra, con 67.7), benchmarks en los que los modelos chinos más grandes no publicaron resultados; además, supera por poco a GLM 5.2 en SWE-Bench Pro v1 (65.5 frente a 62.1) y en MCP Atlas (78.7 frente a 77.8).
En razonamiento puro queda un poco por detrás de los líderes: obtiene 90.5 en GPQA Diamond, frente a los 93.5 de Kimi K3, y 36.2 en Humanity's Last Exam sin herramientas, frente a 46.9.
El argumento de Reflection no es que Beam lo gane todo, sino que se acerca a los líderes usando mucho menos cómputo por respuesta. Kimi K3, GLM 5.3 y Qwen 3.8 Max siguen liderando en la mayoría de las filas en las que publicaron resultados.
Qué mide cada benchmark
Programación agéntica y terminal
- DeepSWE v1.1
- Tareas de ingeniería de software de largo horizonte que un agente resuelve de principio a fin.
- SWE-Bench Pro v2-Hard
- La división más difícil de SWE-Bench Pro: problemas difíciles de repositorios del mundo real.
- SWE-Bench Pro v1
- Problemas reales de GitHub en bases de código profesionales, más difíciles y con menor contaminación de datos que los de SWE-Bench clásico.
- Terminal-Bench v2.1
- Completar tareas en una terminal real de Linux: shell, herramientas, compilaciones y depuración.
- SWE Atlas Codebase QnA
- Responder preguntas sobre bases de código grandes y poco conocidas.
- SWE-Bench Multilingual
- Resolución de incidencias al estilo de SWE-Bench en muchos lenguajes de programación.
- SWE-Bench Verified
- Subconjunto de SWE-Bench verificado por personas: corregir la incidencia para que pasen las pruebas ocultas.
Razonamiento
- AIME 2026
- Problemas del American Invitational Mathematics Examination de 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: preguntas de nivel experto sobre muchos campos, respondidas sin herramientas.
- SciCode
- Escritura de código para resolver problemas científicos de nivel de investigación.
- CritPt (AA)
- Problemas de razonamiento en física de nivel de investigación, según las pruebas de Artificial Analysis.
- GPQA Diamond
- Preguntas de biología, química y física de nivel de posgrado, diseñadas para que sea difícil encontrar las respuestas.
Uso de herramientas y búsqueda
- AutomationBench (public)
- Automatización de flujos de trabajo empresariales de varios pasos en distintas aplicaciones.
- MCP Atlas
- Uso correcto de las herramientas disponibles mediante el Model Context Protocol (MCP).
- τ³ banking
- Conversaciones de atención al cliente en el ámbito bancario, con herramientas y políticas.
- BrowseComp (context mgmt)
- Búsqueda en la web de datos difíciles de localizar, con gestión del contexto.
- DeepSearchQA (context mgmt)
- Preguntas de investigación de varios pasos que requieren buscar y combinar fuentes.
Capacidades generales
- AA-LCR (long context)
- Razonamiento sobre documentos muy extensos (razonamiento con contexto largo de Artificial Analysis).
- LongBench v2
- Comprensión y respuesta a preguntas sobre entradas extensas.
- IFBench
- Seguimiento de instrucciones precisas y verificables de formato y contenido.
- AA Omniscience index (public split)
- Conocimiento factual con penalización por respuestas incorrectas dadas con seguridad (alucinaciones).