Lumaktaw sa nilalaman
reflectionbeam

Direktang paghahambing

Beam vs DeepSeek V4.1 Flash

2:7

Nanalo ang Beam sa 2 sa 9 benchmark na pareho nilang iniulat

Pasya

Nangunguna ang DeepSeek V4.1 Flash sa 7 sa 9 na magkakaparehong benchmark, na may malaking lamang sa DeepSWE at AutomationBench at lamang na 10 puntos sa Terminal-Bench. Panalo ang Beam sa CritPt at mas maganda ang AA Omniscience index nito, na nagpapababa ng score para sa mga maling sagot na ibinigay nang may kumpiyansa. Hindi pabor sa Beam ang kahusayan dito: 16 bilyong parameter lang ang ina-activate ng DeepSeek V4.1 Flash sa bawat nalilikhang token—mas kaunti kaysa 23 bilyon ng Beam—at pampubliko na ang mga weight nito sa ilalim ng MIT.

Bawat benchmark

BenchmarkBeamDeepSeek V4.1 FlashPagkakaiba
DeepSWE v1.144.474.2-29.8
Terminal-Bench v2.180.190.6-10.5
Humanity's Last Exam (no tools)36.239.1-2.9
SciCode49.752.0-2.3
CritPt (AA)16.314.3+2.0
GPQA Diamond90.590.9-0.4
AutomationBench (public)37.054.8-17.8
AA-LCR (long context)79.384.0-4.7
AA Omniscience index (public split)13.06.6+6.4

Lahat ng score ay mula sa anunsyo ng Reflection (rebisyon noong October 8, 2026). Ang mga score para sa DeepSeek V4.1 Flash ay ayon sa mga binanggit ng Reflection mula sa Artificial Analysis at DataCurve.

Ang dalawang modelo

BeamDeepSeek V4.1 Flash
DeveloperReflection AIDeepSeek
Nakabase saEstados UnidosTsina
Mga parameter (kabuuan / aktibo)501B / 23B552B / 16B
Mga weightApache 2.0, ipinangako para sa bandang huling bahagi ng Oktubre 2026MIT
InilabasOktubre 5, 2026Setyembre 10, 2026
Paano mag-accessAPI beta na nasa waitlist; paparating ang mga weightHugging Face, DeepSeek API, OpenRouter

Iba pang paghahambing