10
How Is the Model Trained?
1
Massive Pretraining
Web
Code
Math
Docs
Languages
Agents
Long Context
32T+ tokens
Web, code, math, docs, languages
Agent tasks and long-context data
2
Train Specialists
Math, code, agent, instruction experts
Focused domain training
Deepen specialist performance
3
Unified Distillation
Distill expert capabilities
Merge knowledge into one model
Stronger integrated performance
First train subject experts, then let one generalist model learn from all of them.