64
LoRA中r (秩/rank)和alpha参数如何选择?对效果和效率有什么影响?
模型微调与训练中等
📋 面试问题
LoRA中r (秩/rank)和alpha参数如何选择?对效果和效率有什么影响?
✅ 期望回答
r(秩):
- 控制LoRA矩阵的容量/表示能力
- r越大 -> 可训练参数越多 -> 模型越灵活 -> 效果越好 -> 但显存和训练时间增加
- 经验选择:
- 中等任务(指令微调):r=16~64
- 复杂任务(代码生成、多任务学习):r=64~128
alpha:- 缩放因子,影响LoRA更新的幅度
- 实际更新 = (alpha/r) x BA
- 通常alpha=2r或alpha=r(如r=16时alpha=32或16)
- DoRA(Weight-Decomposed Low-Rank Adaptation):解耦LoRA更新的方向和幅值,效果优于原始LoRA
- LoRA+:在不同层使用不同的学习率(深层>浅层),通常显著优化的效果
#LoRA参数#秩选择#DoRA