Préentraînement
23,8 billions de tokens issus du Web, de sources publiques et de jeux de données sous licence, avec une forte priorité accordée au code, à la rédaction technique et aux disciplines STEM. Environ 95 % des tokens bruts du Web ont été filtrés. Entraînement sur 6 144 GPU NVIDIA GB300 NVL72 en moins de quatre semaines, avec un débit utile de 92,3 % vers la fin.