64

LoRA中r (秩/rank)和alpha参数如何选择?对效果和效率有什么影响?

模型微调与训练中等

📋 面试问题

LoRA中r (秩/rank)和alpha参数如何选择?对效果和效率有什么影响?

✅ 期望回答

r(秩):
  • 控制LoRA矩阵的容量/表示能力
  • r越大 -> 可训练参数越多 -> 模型越灵活 -> 效果越好 -> 但显存和训练时间增加
  • 经验选择:
- 简单任务(情感分类、实体识别):r=8~16

- 中等任务(指令微调):r=16~64

- 复杂任务(代码生成、多任务学习):r=64~128

alpha:
  • 缩放因子,影响LoRA更新的幅度
  • 实际更新 = (alpha/r) x BA
  • 通常alpha=2r或alpha=r(如r=16时alpha=32或16)

最新进展:
  • DoRA(Weight-Decomposed Low-Rank Adaptation):解耦LoRA更新的方向和幅值,效果优于原始LoRA
  • LoRA+:在不同层使用不同的学习率(深层>浅层),通常显著优化的效果
#LoRA参数#秩选择#DoRA