60
什么是DPO(Direct Preference Optimization)?为什么说它比RLHF更简单?
模型微调与训练中等
📋 面试问题
什么是DPO(Direct Preference Optimization)?为什么说它比RLHF更简单?
✅ 期望回答
DPO直接将人类偏好数据作为监督信号优化模型,无需显式训练Reward Model和RL算法
DPO vs RLHF:- RLHF(三步):SFT -> 训练Reward Model -> PPO强化学习
- DPO(一步):直接在偏好数据上用交叉熵损失微调模型
- 代码量骤减(无需PPO实现和Reward Model训练)
- 训练更稳定(分类交叉熵 vs 强化学习的不稳定奖励信号)
- 效果可比甚至超过RLHF
#DPO#RLHF#对齐