Preentrenamiento
23.8 billones de tokens de la web, fuentes públicas y conjuntos de datos con licencia, con especial énfasis en código, escritura técnica y STEM. Se filtró alrededor del 95% de los tokens web sin procesar. El entrenamiento se ejecutó en 6,144 GPU NVIDIA GB300 NVL72 en menos de cuatro semanas, con un goodput del 92.3% hacia el final.