Post-Training and Fine-Tuning
Post-Trianing 流程
1 | 预训练模型 Base Model |
Post-Trianing 常见方式
- SFT(Supervised Fine-Tuning,监督微调)
- 全量 SFT : 更新所有参数
- LoRA SFT : 冻结模型+训练LoRA
1
2
3
4
5
6
7
8
9输入
↓
模型
↓
预测标准答案
↓
计算loss
↓
更新参数
- RLHF(Reinforcement Learning from Human Feedback):强化学习人类反馈。
- SFT
1
2
3Base Model
↓
SFT Model - 训练奖励模型 Reward Model
- 强化学习 PPO
1
2
3
4
5回答
↓
Reward Model
↓
分数
- SFT
- DPO(Direct Preference Optimization):不训练奖励模型,直接用偏好数据优化模型。
1
2
3
4
5{
"prompt":"写邮件",
"chosen":"好的邮件",
"rejected":"差的邮件"
} - IPO / KTO / ORPO 等偏好优化, DPO的拓展
- Continued Pretraining(持续预训练): 让模型学习新的领域知识。
- Instruction Tuning(指令调优)
- Reasoning Fine-tuning(推理微调): 学习思考过程
1
2
3
4
5{
"question":"一个数学问题",
"reasoning":"步骤",
"answer":"结果"
} - Tool / Agent Fine-tuning : 训练模型使用工具。
1
2
3
4
5
6{
"name":"search",
"arguments":{
"query":"天气"
}
} - 多模态后训练(VLM)
- Vision SFT
- Visual Preference Alignment
SFT (Supervised Fine-Tuning,监督微调)
通过人工构造的高质量输入-输出示例,使预训练模型学习遵循指令、完成特定任务,并形成符合人类期望的交互行为。
训练数据:
1 | { |
本质: 语言模型训练
1 | 输入 |
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 klklkl's blogs!
