1
请解释Transformer架构的核心创新,以及它相比RNN/LSTM的主要优势是什么?
大模型基础理论中等
📋 面试问题
请解释Transformer架构的核心创新,以及它相比RNN/LSTM的主要优势是什么?
✅ 期望回答
核心创新:
- Self-Attention机制:每个位置的编码能直接关注序列中所有其他位置,捕获任意距离的依赖关系(全局感受野)
- 位置编码:通过正弦/余弦函数或可学习嵌入注入序列顺序信息,解决Attention本身不感知位置的问题
- Multi-Head Attention:允许模型在不同子空间学习不同类型的注意力模式,增强表示能力
- Layer Normalization + Residual Connection:稳定深层网络训练,解决梯度消失问题
- Encoder-Decoder架构:Encoder并行编码源序列,Decoder自回归生成目标序列
- 并行计算:RNN序列依赖导致无法并行,Transformer在训练时可完全并行化所有位置的Attention计算
- 长程依赖:RNN受梯度消失/爆炸限制,LSTM可处理约100步,Transformer可处理数千token距离
- 训练效率:不需要BPTT(时间反向传播),每层计算图独立
- 表示能力:Multi-Head Attention能捕获多种关系(语法、语义、指代等)
#Transformer#Self-Attention#架构