Direktvergleich
Beam vs DeepSeek V4.1 Flash
Beam gewinnt 2 von 9 gemeinsamen Benchmarks
Fazit
DeepSeek V4.1 Flash liegt bei 7 der 9 gemeinsamen Benchmarks vorne, mit deutlichem Vorsprung bei DeepSWE und AutomationBench sowie 10 Punkten bei Terminal-Bench. Beam gewinnt bei CritPt und erzielt einen besseren AA Omniscience-Index, bei dem selbstsicher vorgetragene falsche Antworten negativ bewertet werden. Bei der Effizienz hat Beam hier keinen Vorteil: DeepSeek V4.1 Flash aktiviert pro generiertem Token nur 16 Milliarden Parameter, weniger als Beams 23 Milliarden, und die Gewichte sind bereits unter MIT öffentlich verfügbar.
Benchmark für Benchmark
| Benchmark | Beam | DeepSeek V4.1 Flash | Differenz | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 74,2 | -29,8 | |
| Terminal-Bench v2.1 | 80,1 | 90,6 | -10,5 | |
| Humanity's Last Exam (no tools) | 36,2 | 39,1 | -2,9 | |
| SciCode | 49,7 | 52,0 | -2,3 | |
| CritPt (AA) | 16,3 | 14,3 | +2,0 | |
| GPQA Diamond | 90,5 | 90,9 | -0,4 | |
| AutomationBench (public) | 37,0 | 54,8 | -17,8 | |
| AA-LCR (long context) | 79,3 | 84,0 | -4,7 | |
| AA Omniscience index (public split) | 13,0 | 6,6 | +6,4 |
Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für DeepSeek V4.1 Flash sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.
Die beiden Modelle
| Beam | DeepSeek V4.1 Flash | |
|---|---|---|
| Entwickler | Reflection AI | DeepSeek |
| Sitz | Vereinigte Staaten | China |
| Parameter (gesamt / aktiv) | 501B / 23B | 552B / 16B |
| Gewichte | Apache 2.0, für später im Oktober 2026 angekündigt | MIT |
| Veröffentlicht | 5. Oktober 2026 | 10. September 2026 |
| Zugriff | Beta-API mit Warteliste; Gewichte folgen | Hugging Face, DeepSeek API, OpenRouter |
Weitere Vergleiche
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Moonshot AI
Beam vs Kimi K3
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Z.ai (Zhipu AI)
Beam vs GLM 5.3
NVIDIA
Beam vs Nemotron 3 Ultra
Thinking Machines Lab