Pular para o conteúdo
reflectionbeam

Cartão do modelo

Especificações do Beam

Tudo o que a Reflection AI publicou sobre como o Beam foi desenvolvido e treinado. Os números vêm do anúncio oficial e da documentação para desenvolvedores; as estimativas estão identificadas.

Visão geral

DesenvolvedorReflection AI (New York)
Anunciado2026-10-05
Tipo de modeloModelo de linguagem esparso de mistura de especialistas
Parâmetros totais501B
Parâmetros ativos por token23B
Camadas52
AtençãoAtenção local e global intercalada
Janela de contexto (beta da API)256K tokens
Comprimento de contexto alcançado no meio do treinamento1M tokens
Saída máxima (API)128K tokens
Limite de conhecimento2026-06-30
ModalidadeEntrada de texto, saída de texto
RaciocínioSempre ativo, com uma configuração de esforço de raciocínio
Recursos da APIUso de ferramentas, saídas estruturadas, transmissão em fluxo
Licença dos pesosApache 2.0 (pesos prometidos para mais tarde em outubro de 2026)
ID do modelo na APIBeam-501B-A23B

Por que 501B no total, mas 23B ativos?

Em um modelo de Mistura de Especialistas, cada camada contém muitas redes pequenas de “especialistas”, e um roteador seleciona algumas delas para cada token. Beam armazena 501 bilhões de parâmetros, mas cada token passa por apenas cerca de 23 bilhões deles.

O resultado: o processamento por token é parecido com o de um modelo denso de 23B, o que torna Beam mais barato de servir, enquanto a capacidade total continua alta. A desvantagem é o uso de memória. Todos os 501B parâmetros ainda precisam ficar na memória das GPUs para servir o modelo.

Reflection afirma que seu roteamento é excepcionalmente equilibrado: ao fim do pré-treinamento, o especialista mais ocupado tinha apenas 1.04× a carga média, então todos os especialistas são usados.

501B100%
23B4.6%

Como Beam foi treinado

Pré-treinamento

23.8 trilhões de tokens da web, de fontes públicas e de conjuntos de dados licenciados, com forte ênfase em código, redação técnica e STEM. Cerca de 95% dos tokens brutos da web foram filtrados. O treinamento foi executado em 6,144 GPUs NVIDIA GB300 NVL72 em menos de quatro semanas, com 92.3% de taxa de processamento útil perto do fim.

Treinamento intermediário

Uma etapa projetada para preparar o modelo para a aprendizagem por reforço: documentos longos e ricos em raciocínio, repositórios de código e tarefas de longo prazo. Foi nessa etapa que o contexto efetivo de Beam foi ampliado para 1 milhão de tokens.

Aprendizagem por reforço

Mais de 100 milhões de rollouts em 10,500 GPUs GB300 ao longo de quatro semanas, em quase um milhão de ambientes de programação, agentes e STEM, e cerca de 1.3 bilhão de sandboxes. Reflection o descreve como uma das maiores execuções de RL de qualquer laboratório aberto e afirma que as pontuações ainda estavam subindo quando ela terminou.

Segurança e alinhamento

Um modelo separado de segurança e alinhamento foi treinado a partir da mesma base e combinado com o modelo de RL por destilação on-policy com múltiplos professores. Reflection afirma que publicará avaliações de segurança no relatório técnico e tornará abertas as avaliações internas de segurança.

Esforço de raciocínio e eficiência de tokens

Beam foi treinado com uma penalidade de comprimento que recompensa respostas corretas e desencoraja tokens desnecessários. Na API, você escolhe um nível de esforço de raciocínio: configurações mais baixas respondem mais rápido e com menos tokens; configurações mais altas dedicam mais tempo a problemas difíceis.

De quanta memória Beam precisa?

Reflection ainda não publicou os requisitos de hardware. Estas são nossas estimativas aproximadas apenas para os pesos (parâmetros × bytes por parâmetro). Implantações reais precisam de memória adicional para o cache KV e as ativações.

PrecisãoApenas pesosHardware de exemplo
BF16 / FP16≈ 1.002 GB8× GPUs de 192 GB (cerca de 1.5 TB) ou um cluster com vários nós
FP8≈ 501 GB8× GPUs de 80 GB é apertado; 8× de 141 GB ou mais oferece espaço suficiente
INT4 / 4-bit≈ 251 GBNo mínimo, 4× GPUs de 80 GB; mais para contextos longos

Estimativas, não requisitos oficiais. Vamos substituí-las pelos números da Reflection quando a ficha do modelo for publicada.