14

什么是模型量化(Quantization)?PTQ和QAT的区别是什么?

大模型基础理论中等

📋 面试问题

什么是模型量化(Quantization)?PTQ和QAT的区别是什么?

✅ 期望回答

量化是将模型参数和激活值从高精度(FP32/FP16)转为低精度(INT8/INT4/NF4)的过程,以减少显存占用和加速推理

PTQ (Post-Training Quantization,训练后量化):
  • 模型训练完成后,对权重和/或激活值做量化,无需重新训练
  • 优点:快速、简单、无需训练数据
  • 缺点:低比特(4-bit以下)时精度损失较大
  • 代表方法:GPTQ(逐层最优量化)、AWQ(激活感知权重量化)、GGUF/llama.cpp中的量化方法

QAT (Quantization-Aware Training,量化感知训练):
  • 训练时模拟量化效果(伪量化节点),让模型在训练过程中适应低精度
  • 优点:精度高,低比特下效果更好
  • 缺点:需要完整训练流程,成本高
  • 适用场景:对精度要求极高的场景(边缘部署、私有化)

当前实践:
  • 生产环境常用PTQ方法(GPTQ/AWQ + INT4)即可满足大部分需求
  • BitsAndBytes NF4(4-bit NormalFloat量化)配合QLoRA实现消费级GPU微调
#量化#PTQ#QAT