68

什么是PagedAttention (vLLM)?为什么能大幅提升推理效率?

模型部署与推理优化困难

📋 面试问题

什么是PagedAttention (vLLM)?为什么能大幅提升推理效率?

✅ 期望回答

PagedAttention借鉴操作系统的虚拟内存和分页机制,将KV Cache切分为固定大小的Block(页),按需分配

问题背景:
  • 传统KV Cache:为每个请求预留最大序列长度(如8192)的连续显存,导致两个问题:
1) 大量预留但未使用的显存被浪费(内部碎片率60-80%)

2) 显存碎片化,无法分配新请求(虽然总空闲足够但碎片化)

PagedAttention解决方案:
  • 将KV Cache切分为固定大小的Block(如16个token/page)
  • 像虚拟内存一样,Block不需要在显存中连续存放
  • 每个请求按需申请KV Cache内存
  • 理论上可以达到接近100%的显存利用率

效果:
  • 显存浪费从60-80%降至<5%
  • 在相同GPU下支持2-3倍更大的Batch Size
  • 吞吐量提升10-30倍(显存瓶颈 -> 计算瓶颈的转变)
#PagedAttention#vLLM#KV Cache