59

什么是SFT(监督微调)和RLHF(人类反馈强化学习)?两者在大模型训练中的作用?

模型微调与训练中等

📋 面试问题

什么是SFT(监督微调)和RLHF(人类反馈强化学习)?两者在大模型训练中的作用?

✅ 期望回答

SFT (Supervised Fine-Tuning):
  • 用高质量的人工标注的(Instruction, Response)数据对预训练模型做微调
  • 目标:让模型学会「遵循指令」,适应问答、对话等任务格式
  • 阶段:Pre-training -> SFT -> RLHF

RLHF (Reinforcement Learning from Human Feedback):
  • 三阶段:收集人类偏好数据(对比两个回答哪个更好)-> 训练Reward Model(模拟人类偏好打分)-> 用PPO强化学习微调模型,最大化Reward Model打分
  • 目标:让模型的输出更符合人类偏好(有用、无害、诚实)
  • RLHF是ChatGPT/Claude取得突破的核心技术

两者的关系: 维度SFTRLHF 学习信号行为克隆人类偏好 目标模仿正确回答提升回答质量 训练成本低高 效果学会格式和风格学会对齐人类偏好 趋势:DPO (Direct Preference Optimization)正逐步替代RLHF——直接优化偏好而无需显式Reward Model,训练更简单
#SFT#RLHF#DPO