Passer au contenu
reflectionbeam

Face à face

Beam vs DeepSeek V4.1 Flash

2:7

Beam remporte 2 des 9 benchmarks communs

Verdict

DeepSeek V4.1 Flash devance Beam sur 7 des 9 benchmarks communs, avec de larges avances sur DeepSWE et AutomationBench et 10 points d’avance sur Terminal-Bench. Beam l’emporte sur CritPt et affiche un meilleur indice AA Omniscience, qui pénalise les réponses erronées formulées avec assurance. Côté efficacité, Beam n’est pas avantagé ici : DeepSeek V4.1 Flash n’active que 16 milliards de paramètres par token généré, contre 23 milliards pour Beam, et ses poids sont déjà disponibles publiquement sous MIT.

Benchmark par benchmark

BenchmarkBeamDeepSeek V4.1 FlashÉcart
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Tous les scores proviennent de l’annonce de Reflection (révision du 8 octobre 2026). Les scores de DeepSeek V4.1 Flash sont ceux cités par Reflection, d’après Artificial Analysis et DataCurve.

Les deux modèles

BeamDeepSeek V4.1 Flash
DéveloppeurReflection AIDeepSeek
Basé àÉtats-UnisChine
Paramètres (total / actifs)501B / 23B552B / 16B
PoidsApache 2.0, promis pour plus tard en octobre 2026MIT
Date de sortie5 octobre 202610 septembre 2026
Moyens d’accèsAPI bêta sur liste d’attente ; poids à venirHugging Face, DeepSeek API, OpenRouter

Autres comparaisons