Przejdź do treści
reflectionbeam

Bezpośrednie porównanie

Beam vs DeepSeek V4.1 Flash

2:7

Beam wygrywa w 2 z 9 wspólnych benchmarków

Werdykt

DeepSeek V4.1 Flash wygrywa 7 z 9 wspólnych benchmarków, z dużą przewagą w DeepSWE i AutomationBench oraz przewagą 10 punktów w Terminal-Bench. Beam wygrywa w CritPt i ma lepszy indeks AA Omniscience, który obniża ocenę za pewne siebie, lecz błędne odpowiedzi. Pod względem wydajności Beam nie ma tu przewagi: DeepSeek V4.1 Flash aktywuje tylko 16 miliardów parametrów na wygenerowany token, mniej niż 23 miliardy w Beam, a jego wagi są już publicznie dostępne na licencji MIT.

Porównanie benchmark po benchmarku

BenchmarkBeamDeepSeek V4.1 FlashRóżnica
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Wszystkie wyniki pochodzą z ogłoszenia Reflection (aktualizacja z 8 października 2026). Wyniki dla DeepSeek V4.1 Flash podano za Reflection, na podstawie danych Artificial Analysis i DataCurve.

Oba modele

BeamDeepSeek V4.1 Flash
DeweloperReflection AIDeepSeek
SiedzibaStany ZjednoczoneChiny
Parametry (łącznie / aktywne)501B / 23B552B / 16B
WagiApache 2.0, obiecana na późniejszą część października 2026MIT
Data premiery5 października 202610 września 2026
Jak uzyskać dostępAPI beta — lista oczekujących; wagi pojawią się późniejHugging Face, DeepSeek API, OpenRouter

Pozostałe porównania