Vai al contenuto
reflectionbeam

Confronto diretto

Beam vs DeepSeek V4.1 Flash

2:7

Beam vince 2 dei 9 benchmark in comune

Verdetto

DeepSeek V4.1 Flash è in vantaggio in 7 dei 9 benchmark condivisi, con ampi margini su DeepSWE e AutomationBench e 10 punti di vantaggio su Terminal-Bench. Beam vince su CritPt e ha un indice AA Omniscience migliore, che penalizza le risposte errate date con sicurezza. In questo caso l'efficienza non è a favore di Beam: DeepSeek V4.1 Flash attiva solo 16 miliardi di parametri per token generato, meno dei 23 miliardi di Beam, e i suoi pesi sono già pubblici con licenza MIT.

Confronto benchmark per benchmark

BenchmarkBeamDeepSeek V4.1 FlashDifferenza
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Tutti i punteggi provengono dall'annuncio di Reflection (revisione dell'8 ottobre 2026). I punteggi di DeepSeek V4.1 Flash sono quelli citati da Reflection, tratti da Artificial Analysis e DataCurve.

I due modelli

BeamDeepSeek V4.1 Flash
SviluppatoreReflection AIDeepSeek
Con sede inStati UnitiCina
Parametri (totali / attivi)501B / 23B552B / 16B
PesiApache 2.0, promesso per la fine di ottobre 2026MIT
Data di rilascio5 ottobre 202610 settembre 2026
Come accedereAPI beta con lista d'attesa; i pesi arriverannoHugging Face, DeepSeek API, OpenRouter

Altri confronti