58
什么是QLoRA?相比普通LoRA有什么优势?
模型微调与训练中等
📋 面试问题
什么是QLoRA?相比普通LoRA有什么优势?
✅ 期望回答
QLoRA = Quantized LoRA,将预训练权重从FP16量化为NF4(4-bit NormalFloat),在此量化基础模型上训练LoRA权重
核心创新:- NF4量化:一种信息论最优的4-bit量化格式,比标准INT4更适合正态分布的大模型权重
- 双重量化:不仅量化模型权重,还量化量化常数(进一步节省0.4 bit/参数)
- 分页优化器:利用CPU做梯度检查点,避免GPU OOM
- 显存更低:LoRA(7B+FP16约16GB)-> QLoRA(7B+4-bit约6GB),即可在消费级GPU(RTX 3060 12GB)上微调70B的模型
- 效果接近全量:QLoRA微调效果非常接近全参数微调(差距通常<1%),而显存节省了5-10倍
- 训练速度比普通LoRA慢30-50%(反量化开销)
- 推理时需要反量化,不适合直接做推理部署
- 对某些特定任务(如需要极高精度的数学推理),低bit微调仍有细微精度损失
#QLoRA#量化#消费级GPU