Saltar al contenido
reflectionbeam

Ficha del modelo

Especificaciones de Beam

Todo lo que Reflection AI ha publicado sobre cómo se construye y entrena Beam. Las cifras proceden del anuncio oficial y de la documentación para desarrolladores; las estimaciones están indicadas.

De un vistazo

DesarrolladorReflection AI (New York)
Anunciado2026-10-05
Tipo de modeloModelo de lenguaje de mezcla dispersa de expertos
Parámetros totales501B
Parámetros activos por token23B
Capas52
AtenciónAtención local y global intercalada
Ventana de contexto (versión beta de la API)256K tokens
Longitud de contexto alcanzada durante el entrenamiento intermedio1M tokens
Salida máxima (API)128K tokens
Fecha de corte de conocimientos2026-06-30
ModalidadEntrada de texto, salida de texto
RazonamientoSiempre activo, con un ajuste del esfuerzo de razonamiento
Funciones de la APILlamadas a herramientas, salidas estructuradas y streaming
Licencia de los pesosApache 2.0 (pesos prometidos para más adelante, en octubre de 2026)
ID del modelo en la APIBeam-501B-A23B

¿Por qué 501B en total, pero 23B activos?

En un modelo de mezcla de expertos, cada capa contiene muchas redes pequeñas de «expertos» y un enrutador selecciona unas pocas para cada token. Beam almacena 501 mil millones de parámetros, pero cada token solo pasa por unos 23 mil millones.

El resultado: el cómputo por token es similar al de un modelo denso de 23B, lo que hace que servir Beam sea más económico, mientras que la capacidad total sigue siendo grande. La desventaja es la memoria. Para servir el modelo, los 501B parámetros deben estar en la memoria de la GPU.

Reflection afirma que su enrutamiento está excepcionalmente equilibrado: al final del preentrenamiento, el experto más ocupado solo soportaba 1.04× la carga promedio, así que se utilizan todos los expertos.

501B100%
23B4.6%

Cómo se entrenó Beam

Preentrenamiento

23.8 billones de tokens de la web, fuentes públicas y conjuntos de datos con licencia, con especial énfasis en código, escritura técnica y STEM. Se filtró alrededor del 95% de los tokens web sin procesar. El entrenamiento se ejecutó en 6,144 GPU NVIDIA GB300 NVL72 en menos de cuatro semanas, con un goodput del 92.3% hacia el final.

Entrenamiento intermedio

Una etapa diseñada para preparar el modelo para el aprendizaje por refuerzo: documentos extensos con abundante razonamiento, repositorios de código y tareas de horizonte largo. En esta etapa se amplió el contexto efectivo de Beam a 1 millón de tokens.

Aprendizaje por refuerzo

Más de 100 millones de rollouts en 10,500 GPU GB300 durante cuatro semanas, en casi un millón de entornos de programación, agentes y STEM, y alrededor de 1.3 mil millones de sandboxes. Reflection lo considera una de las ejecuciones de RL más grandes de cualquier laboratorio abierto y afirma que las puntuaciones seguían subiendo cuando terminó.

Seguridad y alineación

Se entrenó un modelo independiente de seguridad y alineación a partir de la misma base y se combinó con el modelo de RL mediante destilación multi-teacher on-policy. Reflection afirma que publicará evaluaciones de seguridad en el informe técnico y hará públicas sus evaluaciones internas de seguridad como código abierto.

Esfuerzo de razonamiento y eficiencia de tokens

Beam se entrenó con una penalización por longitud que recompensa las respuestas correctas y desincentiva los tokens innecesarios. En la API, puedes elegir el esfuerzo de razonamiento: los ajustes más bajos responden más rápido y con menos tokens; los más altos dedican más tiempo a los problemas difíciles.

¿Cuánta memoria necesita Beam?

Reflection aún no ha publicado los requisitos de hardware. Estas son nuestras estimaciones aproximadas solo para los pesos (parámetros × bytes por parámetro). Las implementaciones reales necesitan memoria adicional para la caché KV y las activaciones.

PrecisiónSolo pesosHardware de ejemplo
BF16 / FP16≈ 1002 GB8× GPU de 192 GB (unos 1.5 TB) o un clúster multinodo
FP8≈ 501 GB8× GPU de 80 GB van justas; 8× de 141 GB o más ofrecen margen
INT4 / 4-bit≈ 251 GB4× GPU de 80 GB como mínimo; más para contextos largos

Estimaciones, no requisitos oficiales. Las sustituiremos por las cifras de Reflection cuando se publique la ficha del modelo.