Voortraining
23,8 biljoen tokens uit het web, openbare bronnen en datasets met licentie, met veel nadruk op code, technisch schrijven en STEM. Ongeveer 95% van de ruwe webtokens werd eruit gefilterd. Uitgevoerd op 6.144 NVIDIA GB300 NVL72-GPU's in minder dan vier weken, met tegen het einde een goodput van 92,3%.