2
请解释Attention机制中的Q、K、V分别代表什么?为什么要这样设计?
大模型基础理论简单
📋 面试问题
请解释Attention机制中的Q、K、V分别代表什么?为什么要这样设计?
✅ 期望回答
- Query (Q):当前token想要「查询」什么(「我需要关注谁?」),由当前token的输入线性变换得到
- Key (K):每个token的「标签」,用于与Query计算匹配度(「我是什么?」)
- Value (V):每个token的实际内容/信息,被加权聚合(「我的信息是什么?」)
- 检索类比:类似数据库查询——Query是搜索请求,Key是索引键,Value是实际数据
- 内容-位置分离:Key用于计算注意力权重,Value用于信息聚合,两者可以来自不同表示空间
- 可学习投影:Q/K/V分别通过不同的权重矩阵\(W^Q, W^K, W^V\)投影,模型自动学习如何匹配和聚合
\(\text{Attention}(Q, K, V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})V\)
除以\(\sqrt{d_k}\)是为了防止点积过大导致softmax梯度消失
#Attention#QKV#Self-Attention