Passer au contenu
reflectionbeam

Benchmarks

Résultats de Beam aux benchmarks

21 benchmarks couvrant la programmation agentique, le raisonnement, l’utilisation d’outils et les compétences générales, tels que publiés par Reflection, présentés aux côtés de sept autres modèles ouverts.

Il s’agit de chiffres communiqués par le fournisseur dans l’annonce de Reflection (tableau mis à jour le 8 octobre 2026). Les scores des autres modèles proviennent d’Artificial Analysis et de DataCurve, comme indiqué par Reflection. Des reproductions indépendantes suivront lorsque les poids seront publics.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Meilleur score publié sur la ligne— Non communiqué

Ce que montrent les chiffres

Beam est particulièrement performant en ingénierie logicielle. Il obtient 80.9 à SWE-Bench Verified (devant Inkling à 77.6) et 78.0 à SWE-Bench Multilingual (devant Nemotron 3 Ultra à 67.7), des benchmarks pour lesquels les grands modèles chinois n’ont pas publié de résultats. Il devance aussi légèrement GLM 5.2 à SWE-Bench Pro v1 (65.5 contre 62.1) et à MCP Atlas (78.7 contre 77.8).

En raisonnement pur, il se situe légèrement derrière les meilleurs : 90.5 à GPQA Diamond, contre 93.5 pour Kimi K3, et 36.2 à Humanity's Last Exam sans outils, contre 46.9.

Reflection ne prétend pas que Beam l’emporte sur tous les tableaux, mais qu’il s’en approche tout en utilisant beaucoup moins de calcul pour chaque réponse. Kimi K3, GLM 5.3 et Qwen 3.8 Max restent en tête sur la plupart des lignes où ils ont publié des résultats.

Ce que mesure chaque benchmark

Programmation agentique et terminal

DeepSWE v1.1
Des tâches d’ingénierie logicielle de longue durée, réalisées de bout en bout par un agent.
SWE-Bench Pro v2-Hard
La partie la plus difficile de SWE-Bench Pro : des problèmes complexes issus de dépôts de code du monde réel.
SWE-Bench Pro v1
De vrais problèmes GitHub issus de bases de code professionnelles, plus difficiles et moins sujets à la contamination que ceux du SWE-Bench classique.
Terminal-Bench v2.1
Réaliser des tâches dans un véritable terminal Linux : shell, outils, compilations et débogage.
SWE Atlas Codebase QnA
Répondre à des questions sur de vastes bases de code peu familières.
SWE-Bench Multilingual
Résolution de problèmes de type SWE-Bench dans de nombreux langages de programmation.
SWE-Bench Verified
Sous-ensemble de SWE-Bench vérifié par des humains : corriger le problème pour que les tests cachés réussissent.

Raisonnement

AIME 2026
Problèmes de l’American Invitational Mathematics Examination 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam : questions de niveau expert dans de nombreux domaines, auxquelles il faut répondre sans outils.
SciCode
Écrire du code pour résoudre des problèmes scientifiques de niveau recherche.
CritPt (AA)
Problèmes de raisonnement en physique de niveau recherche, tels qu’évalués par Artificial Analysis.
GPQA Diamond
Questions de niveau universitaire en biologie, chimie et physique, conçues pour être difficiles à trouver en ligne.

Appels d’outils et recherche

AutomationBench (public)
Automatisation de processus métier en plusieurs étapes dans différentes applications.
MCP Atlas
Utilisation correcte des outils exposés via le Model Context Protocol (MCP).
τ³ banking
Conversations de service client dans le domaine bancaire, avec outils et politiques.
BrowseComp (context mgmt)
Recherche sur le Web de faits difficiles à trouver, avec gestion du contexte.
DeepSearchQA (context mgmt)
Questions de recherche en plusieurs étapes nécessitant de rechercher et de combiner des sources.

Capacités générales

AA-LCR (long context)
Raisonnement sur de très longs documents (raisonnement à long contexte d’Artificial Analysis).
LongBench v2
Compréhension et réponses à des questions portant sur de longs contenus.
IFBench
Respect d’instructions précises et vérifiables concernant le format et le contenu.
AA Omniscience index (public split)
Connaissances factuelles avec pénalité en cas de réponses erronées données avec assurance (hallucinations).