Face à face
Beam vs DeepSeek V4.1 Flash
Beam remporte 2 des 9 benchmarks communs
Verdict
DeepSeek V4.1 Flash devance Beam sur 7 des 9 benchmarks communs, avec de larges avances sur DeepSWE et AutomationBench et 10 points d’avance sur Terminal-Bench. Beam l’emporte sur CritPt et affiche un meilleur indice AA Omniscience, qui pénalise les réponses erronées formulées avec assurance. Côté efficacité, Beam n’est pas avantagé ici : DeepSeek V4.1 Flash n’active que 16 milliards de paramètres par token généré, contre 23 milliards pour Beam, et ses poids sont déjà disponibles publiquement sous MIT.
Benchmark par benchmark
| Benchmark | Beam | DeepSeek V4.1 Flash | Écart | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 74,2 | -29,8 | |
| Terminal-Bench v2.1 | 80,1 | 90,6 | -10,5 | |
| Humanity's Last Exam (no tools) | 36,2 | 39,1 | -2,9 | |
| SciCode | 49,7 | 52,0 | -2,3 | |
| CritPt (AA) | 16,3 | 14,3 | +2,0 | |
| GPQA Diamond | 90,5 | 90,9 | -0,4 | |
| AutomationBench (public) | 37,0 | 54,8 | -17,8 | |
| AA-LCR (long context) | 79,3 | 84,0 | -4,7 | |
| AA Omniscience index (public split) | 13,0 | 6,6 | +6,4 |
Tous les scores proviennent de l’annonce de Reflection (révision du 8 octobre 2026). Les scores de DeepSeek V4.1 Flash sont ceux cités par Reflection, d’après Artificial Analysis et DataCurve.
Les deux modèles
| Beam | DeepSeek V4.1 Flash | |
|---|---|---|
| Développeur | Reflection AI | DeepSeek |
| Basé à | États-Unis | Chine |
| Paramètres (total / actifs) | 501B / 23B | 552B / 16B |
| Poids | Apache 2.0, promis pour plus tard en octobre 2026 | MIT |
| Date de sortie | 5 octobre 2026 | 10 septembre 2026 |
| Moyens d’accès | API bêta sur liste d’attente ; poids à venir | Hugging Face, DeepSeek API, OpenRouter |
Autres comparaisons
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Moonshot AI
Beam vs Kimi K3
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Z.ai (Zhipu AI)
Beam vs GLM 5.3
NVIDIA
Beam vs Nemotron 3 Ultra
Thinking Machines Lab