60

什么是DPO(Direct Preference Optimization)?为什么说它比RLHF更简单?

模型微调与训练中等

📋 面试问题

什么是DPO(Direct Preference Optimization)?为什么说它比RLHF更简单?

✅ 期望回答

DPO直接将人类偏好数据作为监督信号优化模型,无需显式训练Reward Model和RL算法

DPO vs RLHF:
  • RLHF(三步):SFT -> 训练Reward Model -> PPO强化学习
复杂、不稳定,Reward Model可能被LLM「攻击」(找到骗高分的输出)

  • DPO(一步):直接在偏好数据上用交叉熵损失微调模型
简单、稳定,显式避免「骗分」问题(不需要隐式Reward Model)

DPO的工作原理:偏好数据:(Prompt, 优选回答, 被拒回答)。损失函数引导模型增加生成优选回答的概率、减少生成被拒回答的概率。相当于在SFT阶段直接加入了对齐信号 优势:
  • 代码量骤减(无需PPO实现和Reward Model训练)
  • 训练更稳定(分类交叉熵 vs 强化学习的不稳定奖励信号)
  • 效果可比甚至超过RLHF

代表模型:Mistral-7B-Instruct、Zephyr-7B-beta、Qwen 2使用DPO
#DPO#RLHF#对齐