59
什么是SFT(监督微调)和RLHF(人类反馈强化学习)?两者在大模型训练中的作用?
模型微调与训练中等
📋 面试问题
什么是SFT(监督微调)和RLHF(人类反馈强化学习)?两者在大模型训练中的作用?
✅ 期望回答
SFT (Supervised Fine-Tuning):
维度 SFT RLHF
学习信号 行为克隆 人类偏好
目标 模仿正确回答 提升回答质量
训练成本 低 高
效果 学会格式和风格 学会对齐人类偏好
趋势:DPO (Direct Preference Optimization)正逐步替代RLHF——直接优化偏好而无需显式Reward Model,训练更简单
- 用高质量的人工标注的(Instruction, Response)数据对预训练模型做微调
- 目标:让模型学会「遵循指令」,适应问答、对话等任务格式
- 阶段:Pre-training -> SFT -> RLHF
- 三阶段:收集人类偏好数据(对比两个回答哪个更好)-> 训练Reward Model(模拟人类偏好打分)-> 用PPO强化学习微调模型,最大化Reward Model打分
- 目标:让模型的输出更符合人类偏好(有用、无害、诚实)
- RLHF是ChatGPT/Claude取得突破的核心技术
#SFT#RLHF#DPO