Benchmarks
Résultats de Beam aux benchmarks
21 benchmarks couvrant la programmation agentique, le raisonnement, l’utilisation d’outils et les compétences générales, tels que publiés par Reflection, présentés aux côtés de sept autres modèles ouverts.
Il s’agit de chiffres communiqués par le fournisseur dans l’annonce de Reflection (tableau mis à jour le 8 octobre 2026). Les scores des autres modèles proviennent d’Artificial Analysis et de DataCurve, comme indiqué par Reflection. Des reproductions indépendantes suivront lorsque les poids seront publics.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Meilleur score publié sur la ligne— Non communiqué
Ce que montrent les chiffres
Beam est particulièrement performant en ingénierie logicielle. Il obtient 80.9 à SWE-Bench Verified (devant Inkling à 77.6) et 78.0 à SWE-Bench Multilingual (devant Nemotron 3 Ultra à 67.7), des benchmarks pour lesquels les grands modèles chinois n’ont pas publié de résultats. Il devance aussi légèrement GLM 5.2 à SWE-Bench Pro v1 (65.5 contre 62.1) et à MCP Atlas (78.7 contre 77.8).
En raisonnement pur, il se situe légèrement derrière les meilleurs : 90.5 à GPQA Diamond, contre 93.5 pour Kimi K3, et 36.2 à Humanity's Last Exam sans outils, contre 46.9.
Reflection ne prétend pas que Beam l’emporte sur tous les tableaux, mais qu’il s’en approche tout en utilisant beaucoup moins de calcul pour chaque réponse. Kimi K3, GLM 5.3 et Qwen 3.8 Max restent en tête sur la plupart des lignes où ils ont publié des résultats.
Ce que mesure chaque benchmark
Programmation agentique et terminal
- DeepSWE v1.1
- Des tâches d’ingénierie logicielle de longue durée, réalisées de bout en bout par un agent.
- SWE-Bench Pro v2-Hard
- La partie la plus difficile de SWE-Bench Pro : des problèmes complexes issus de dépôts de code du monde réel.
- SWE-Bench Pro v1
- De vrais problèmes GitHub issus de bases de code professionnelles, plus difficiles et moins sujets à la contamination que ceux du SWE-Bench classique.
- Terminal-Bench v2.1
- Réaliser des tâches dans un véritable terminal Linux : shell, outils, compilations et débogage.
- SWE Atlas Codebase QnA
- Répondre à des questions sur de vastes bases de code peu familières.
- SWE-Bench Multilingual
- Résolution de problèmes de type SWE-Bench dans de nombreux langages de programmation.
- SWE-Bench Verified
- Sous-ensemble de SWE-Bench vérifié par des humains : corriger le problème pour que les tests cachés réussissent.
Raisonnement
- AIME 2026
- Problèmes de l’American Invitational Mathematics Examination 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam : questions de niveau expert dans de nombreux domaines, auxquelles il faut répondre sans outils.
- SciCode
- Écrire du code pour résoudre des problèmes scientifiques de niveau recherche.
- CritPt (AA)
- Problèmes de raisonnement en physique de niveau recherche, tels qu’évalués par Artificial Analysis.
- GPQA Diamond
- Questions de niveau universitaire en biologie, chimie et physique, conçues pour être difficiles à trouver en ligne.
Appels d’outils et recherche
- AutomationBench (public)
- Automatisation de processus métier en plusieurs étapes dans différentes applications.
- MCP Atlas
- Utilisation correcte des outils exposés via le Model Context Protocol (MCP).
- τ³ banking
- Conversations de service client dans le domaine bancaire, avec outils et politiques.
- BrowseComp (context mgmt)
- Recherche sur le Web de faits difficiles à trouver, avec gestion du contexte.
- DeepSearchQA (context mgmt)
- Questions de recherche en plusieurs étapes nécessitant de rechercher et de combiner des sources.
Capacités générales
- AA-LCR (long context)
- Raisonnement sur de très longs documents (raisonnement à long contexte d’Artificial Analysis).
- LongBench v2
- Compréhension et réponses à des questions portant sur de longs contenus.
- IFBench
- Respect d’instructions précises et vérifiables concernant le format et le contenu.
- AA Omniscience index (public split)
- Connaissances factuelles avec pénalité en cas de réponses erronées données avec assurance (hallucinations).