14
什么是模型量化(Quantization)?PTQ和QAT的区别是什么?
大模型基础理论中等
📋 面试问题
什么是模型量化(Quantization)?PTQ和QAT的区别是什么?
✅ 期望回答
量化是将模型参数和激活值从高精度(FP32/FP16)转为低精度(INT8/INT4/NF4)的过程,以减少显存占用和加速推理
PTQ (Post-Training Quantization,训练后量化):- 模型训练完成后,对权重和/或激活值做量化,无需重新训练
- 优点:快速、简单、无需训练数据
- 缺点:低比特(4-bit以下)时精度损失较大
- 代表方法:GPTQ(逐层最优量化)、AWQ(激活感知权重量化)、GGUF/llama.cpp中的量化方法
- 训练时模拟量化效果(伪量化节点),让模型在训练过程中适应低精度
- 优点:精度高,低比特下效果更好
- 缺点:需要完整训练流程,成本高
- 适用场景:对精度要求极高的场景(边缘部署、私有化)
- 生产环境常用PTQ方法(GPTQ/AWQ + INT4)即可满足大部分需求
- BitsAndBytes NF4(4-bit NormalFloat量化)配合QLoRA实现消费级GPU微调
#量化#PTQ#QAT