Preaddestramento
23.8 trilioni di token provenienti dal web, da fonti pubbliche e da dataset su licenza, con una forte attenzione a codice, scrittura tecnica e STEM. È stato filtrato circa il 95% dei token web grezzi. L'addestramento è stato eseguito su 6,144 GPU NVIDIA GB300 NVL72 in meno di quattro settimane, con un goodput del 92.3% verso la fine.