Pré-treinamento
23.8 trilhões de tokens da web, de fontes públicas e de conjuntos de dados licenciados, com forte ênfase em código, redação técnica e STEM. Cerca de 95% dos tokens brutos da web foram filtrados. O treinamento foi executado em 6,144 GPUs NVIDIA GB300 NVL72 em menos de quatro semanas, com 92.3% de taxa de processamento útil perto do fim.