Pretraining
ฝึกด้วย 23.8 ล้านล้าน token จากเว็บ แหล่งข้อมูลสาธารณะ และชุดข้อมูลที่ได้รับอนุญาต โดยเน้นโค้ด งานเขียนเชิงเทคนิค และ STEM อย่างมาก คัดกรอง token จากเว็บดิบออกประมาณ 95% ฝึกบน NVIDIA GB300 NVL72 จำนวน 6,144 GPU ภายในเวลาไม่ถึงสี่สัปดาห์ โดยมี goodput 92.3% ในช่วงท้าย