Pular para o conteúdo
reflectionbeam

Confronto direto

Beam vs DeepSeek V4.1 Flash

2:7

Beam vence em 2 dos 9 benchmarks em comum

Veredito

DeepSeek V4.1 Flash está à frente em 7 dos 9 benchmarks em comum, com grandes vantagens em DeepSWE e AutomationBench e uma vantagem de 10 pontos em Terminal-Bench. Beam vence em CritPt e tem um índice AA Omniscience melhor, que penaliza respostas erradas dadas com confiança. A eficiência não favorece Beam neste caso: DeepSeek V4.1 Flash ativa apenas 16 bilhões de parâmetros por token gerado, menos que os 23 bilhões de Beam, e seus pesos já são públicos sob MIT.

Benchmark por benchmark

BenchmarkBeamDeepSeek V4.1 FlashDiferença
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Todas as pontuações vêm do anúncio da Reflection (revisão de 8 de outubro de 2026). As pontuações de DeepSeek V4.1 Flash são as citadas pela Reflection, com base em Artificial Analysis e DataCurve.

Os dois modelos

BeamDeepSeek V4.1 Flash
DesenvolvedorReflection AIDeepSeek
Sediado emEstados UnidosChina
Parâmetros (total / ativos)501B / 23B552B / 16B
PesosApache 2.0, prometida para mais tarde em outubro de 2026MIT
Lançado5 de outubro de 202610 de setembro de 2026
Como acessarAPI beta com lista de espera; pesos a caminhoHugging Face, DeepSeek API, OpenRouter

Outras comparações