Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs DeepSeek V4.1 Flash

2:7

Beam gewinnt 2 von 9 gemeinsamen Benchmarks

Fazit

DeepSeek V4.1 Flash liegt bei 7 der 9 gemeinsamen Benchmarks vorne, mit deutlichem Vorsprung bei DeepSWE und AutomationBench sowie 10 Punkten bei Terminal-Bench. Beam gewinnt bei CritPt und erzielt einen besseren AA Omniscience-Index, bei dem selbstsicher vorgetragene falsche Antworten negativ bewertet werden. Bei der Effizienz hat Beam hier keinen Vorteil: DeepSeek V4.1 Flash aktiviert pro generiertem Token nur 16 Milliarden Parameter, weniger als Beams 23 Milliarden, und die Gewichte sind bereits unter MIT öffentlich verfügbar.

Benchmark für Benchmark

BenchmarkBeamDeepSeek V4.1 FlashDifferenz
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für DeepSeek V4.1 Flash sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamDeepSeek V4.1 Flash
EntwicklerReflection AIDeepSeek
SitzVereinigte StaatenChina
Parameter (gesamt / aktiv)501B / 23B552B / 16B
GewichteApache 2.0, für später im Oktober 2026 angekündigtMIT
Veröffentlicht5. Oktober 202610. September 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, DeepSeek API, OpenRouter

Weitere Vergleiche