Pular para o conteúdo
reflectionbeam

Confronto direto

Beam vs Kimi K3

1:13

Beam vence em 1 dos 14 benchmarks em comum

Veredito

A própria Reflection aponta Kimi K3 como o modelo que continua à frente em capacidade bruta. Kimi K3 vence 13 dos 14 benchmarks em comum, muitas vezes por 10 pontos ou mais em programação agêntica e busca. A única vitória de Beam é em τ³ banking. A contrapartida é o tamanho: Kimi K3 tem 2,8 trilhões de parâmetros, com 104 bilhões ativos por token, cerca de 4,5 vezes os 23 bilhões de Beam, e seus pesos ocupam aproximadamente 1,4 TB mesmo no formato de 4 bits.

Benchmark por benchmark

BenchmarkBeamKimi K3Diferença
DeepSWE v1.144,468,0-23,6
SWE-Bench Pro v2-Hard77,288,2-11,0
Terminal-Bench v2.180,188,3-8,2
SWE Atlas Codebase QnA34,668,0-33,4
Humanity's Last Exam (no tools)36,246,9-10,7
SciCode49,758,7-9,0
CritPt (AA)16,323,4-7,1
GPQA Diamond90,593,5-3,0
AutomationBench (public)37,046,7-9,7
MCP Atlas78,782,3-3,6
τ³ banking38,037,1+0,9
BrowseComp (context mgmt)77,491,2-13,8
DeepSearchQA (context mgmt)80,195,0-14,9
AA-LCR (long context)79,388,7-9,4

Todas as pontuações vêm do anúncio da Reflection (revisão de 8 de outubro de 2026). As pontuações de Kimi K3 são as citadas pela Reflection, com base em Artificial Analysis e DataCurve.

Os dois modelos

BeamKimi K3
DesenvolvedorReflection AIMoonshot AI
Sediado emEstados UnidosChina
Parâmetros (total / ativos)501B / 23B2.8T / 104B
PesosApache 2.0, prometida para mais tarde em outubro de 2026Kimi K3 License (custom)
Lançado5 de outubro de 202616 de julho de 2026
Como acessarAPI beta com lista de espera; pesos a caminhoHugging Face, Moonshot API, OpenRouter

Outras comparações