Pretrening
23.8 biliona tokenów z internetu, źródeł publicznych i licencjonowanych zbiorów danych, ze szczególnym naciskiem na kod, teksty techniczne i STEM. Odfiltrowano około 95% tokenów z surowych danych internetowych. Trening przeprowadzono na 6,144 procesorach graficznych NVIDIA GB300 NVL72 w niecałe cztery tygodnie, osiągając pod koniec 92.3% goodput.