Ga naar de inhoud
reflectionbeam

Directe vergelijking

Beam vs DeepSeek V4.1 Flash

2:7

Beam wint 2 van de 9 gedeelde benchmarks

Conclusie

DeepSeek V4.1 Flash scoort hoger op 7 van de 9 gedeelde benchmarks, met grote voorsprongen op DeepSWE en AutomationBench en een voorsprong van 10 punten op Terminal-Bench. Beam wint op CritPt en heeft een betere AA Omniscience-index, die zelfverzekerde foute antwoorden afstraft. Op het vlak van efficiëntie heeft Beam hier geen voordeel: DeepSeek V4.1 Flash activeert slechts 16 miljard parameters per gegenereerd token, minder dan Beam's 23 miljard, en de gewichten zijn al openbaar beschikbaar onder MIT.

Benchmark voor benchmark

BenchmarkBeamDeepSeek V4.1 FlashVerschil
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Alle scores komen uit de aankondiging van Reflection (herzien op 8 oktober 2026). De scores voor DeepSeek V4.1 Flash zijn zoals Reflection ze citeert van Artificial Analysis en DataCurve.

De twee modellen

BeamDeepSeek V4.1 Flash
OntwikkelaarReflection AIDeepSeek
Gevestigd inVerenigde StatenChina
Parameters (totaal / actief)501B / 23B552B / 16B
GewichtenApache 2.0, beloofd voor later in oktober 2026MIT
Uitgebracht5 oktober 202610 september 2026
ToegangAPI in bèta met wachtlijst; gewichten volgenHugging Face, DeepSeek API, OpenRouter

Andere vergelijkingen