68
什么是PagedAttention (vLLM)?为什么能大幅提升推理效率?
模型部署与推理优化困难
📋 面试问题
什么是PagedAttention (vLLM)?为什么能大幅提升推理效率?
✅ 期望回答
PagedAttention借鉴操作系统的虚拟内存和分页机制,将KV Cache切分为固定大小的Block(页),按需分配
问题背景:- 传统KV Cache:为每个请求预留最大序列长度(如8192)的连续显存,导致两个问题:
2) 显存碎片化,无法分配新请求(虽然总空闲足够但碎片化)
PagedAttention解决方案:- 将KV Cache切分为固定大小的Block(如16个token/page)
- 像虚拟内存一样,Block不需要在显存中连续存放
- 每个请求按需申请KV Cache内存
- 理论上可以达到接近100%的显存利用率
- 显存浪费从60-80%降至<5%
- 在相同GPU下支持2-3倍更大的Batch Size
- 吞吐量提升10-30倍(显存瓶颈 -> 计算瓶颈的转变)
#PagedAttention#vLLM#KV Cache