Saltar al contenido
reflectionbeam

Benchmarks

Resultados de Beam en benchmarks

21 benchmarks de programación agéntica, razonamiento, uso de herramientas y capacidades generales, tal como los publicó Reflection, junto a otros siete modelos abiertos.

Estas son cifras comunicadas por el proveedor en el anuncio de Reflection (tabla actualizada el 8 de octubre de 2026). Las puntuaciones de los otros modelos provienen de Artificial Analysis y DataCurve, según las citas de Reflection. Las reproducciones independientes llegarán cuando los pesos sean públicos.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Mejor puntuación publicada en la fila— No informado

Qué indican las cifras

Beam destaca en ingeniería de software. Obtiene 80.9 en SWE-Bench Verified (por delante de Inkling, con 77.6) y 78.0 en SWE-Bench Multilingual (por delante de Nemotron 3 Ultra, con 67.7), benchmarks en los que los modelos chinos más grandes no publicaron resultados; además, supera por poco a GLM 5.2 en SWE-Bench Pro v1 (65.5 frente a 62.1) y en MCP Atlas (78.7 frente a 77.8).

En razonamiento puro queda un poco por detrás de los líderes: obtiene 90.5 en GPQA Diamond, frente a los 93.5 de Kimi K3, y 36.2 en Humanity's Last Exam sin herramientas, frente a 46.9.

El argumento de Reflection no es que Beam lo gane todo, sino que se acerca a los líderes usando mucho menos cómputo por respuesta. Kimi K3, GLM 5.3 y Qwen 3.8 Max siguen liderando en la mayoría de las filas en las que publicaron resultados.

Qué mide cada benchmark

Programación agéntica y terminal

DeepSWE v1.1
Tareas de ingeniería de software de largo horizonte que un agente resuelve de principio a fin.
SWE-Bench Pro v2-Hard
La división más difícil de SWE-Bench Pro: problemas difíciles de repositorios del mundo real.
SWE-Bench Pro v1
Problemas reales de GitHub en bases de código profesionales, más difíciles y con menor contaminación de datos que los de SWE-Bench clásico.
Terminal-Bench v2.1
Completar tareas en una terminal real de Linux: shell, herramientas, compilaciones y depuración.
SWE Atlas Codebase QnA
Responder preguntas sobre bases de código grandes y poco conocidas.
SWE-Bench Multilingual
Resolución de incidencias al estilo de SWE-Bench en muchos lenguajes de programación.
SWE-Bench Verified
Subconjunto de SWE-Bench verificado por personas: corregir la incidencia para que pasen las pruebas ocultas.

Razonamiento

AIME 2026
Problemas del American Invitational Mathematics Examination de 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: preguntas de nivel experto sobre muchos campos, respondidas sin herramientas.
SciCode
Escritura de código para resolver problemas científicos de nivel de investigación.
CritPt (AA)
Problemas de razonamiento en física de nivel de investigación, según las pruebas de Artificial Analysis.
GPQA Diamond
Preguntas de biología, química y física de nivel de posgrado, diseñadas para que sea difícil encontrar las respuestas.

Uso de herramientas y búsqueda

AutomationBench (public)
Automatización de flujos de trabajo empresariales de varios pasos en distintas aplicaciones.
MCP Atlas
Uso correcto de las herramientas disponibles mediante el Model Context Protocol (MCP).
τ³ banking
Conversaciones de atención al cliente en el ámbito bancario, con herramientas y políticas.
BrowseComp (context mgmt)
Búsqueda en la web de datos difíciles de localizar, con gestión del contexto.
DeepSearchQA (context mgmt)
Preguntas de investigación de varios pasos que requieren buscar y combinar fuentes.

Capacidades generales

AA-LCR (long context)
Razonamiento sobre documentos muy extensos (razonamiento con contexto largo de Artificial Analysis).
LongBench v2
Comprensión y respuesta a preguntas sobre entradas extensas.
IFBench
Seguimiento de instrucciones precisas y verificables de formato y contenido.
AA Omniscience index (public split)
Conocimiento factual con penalización por respuestas incorrectas dadas con seguridad (alucinaciones).