Prapelatihan
23,8 triliun token dari web, sumber publik, dan set data berlisensi, dengan penekanan kuat pada kode, tulisan teknis, dan STEM. Sekitar 95% token web mentah disaring. Pelatihan dijalankan pada 6.144 GPU NVIDIA GB300 NVL72 dalam waktu kurang dari empat minggu, dengan goodput 92,3% menjelang akhir.