Pretraining
23,8 Billionen Tokens aus dem Web, öffentlichen Quellen und lizenzierten Datensätzen, mit starkem Schwerpunkt auf Code, technischen Texten und MINT. Etwa 95 % der Tokens aus Rohdaten des Webs wurden herausgefiltert. Das Training lief auf 6,144 NVIDIA GB300 NVL72 GPUs in weniger als vier Wochen, gegen Ende mit einem Goodput von 92,3 %.