1

请解释Transformer架构的核心创新,以及它相比RNN/LSTM的主要优势是什么?

大模型基础理论中等

📋 面试问题

请解释Transformer架构的核心创新,以及它相比RNN/LSTM的主要优势是什么?

✅ 期望回答

核心创新:
  • Self-Attention机制:每个位置的编码能直接关注序列中所有其他位置,捕获任意距离的依赖关系(全局感受野)
  • 位置编码:通过正弦/余弦函数或可学习嵌入注入序列顺序信息,解决Attention本身不感知位置的问题
  • Multi-Head Attention:允许模型在不同子空间学习不同类型的注意力模式,增强表示能力
  • Layer Normalization + Residual Connection:稳定深层网络训练,解决梯度消失问题
  • Encoder-Decoder架构:Encoder并行编码源序列,Decoder自回归生成目标序列

相比RNN/LSTM的优势:
  • 并行计算:RNN序列依赖导致无法并行,Transformer在训练时可完全并行化所有位置的Attention计算
  • 长程依赖:RNN受梯度消失/爆炸限制,LSTM可处理约100步,Transformer可处理数千token距离
  • 训练效率:不需要BPTT(时间反向传播),每层计算图独立
  • 表示能力:Multi-Head Attention能捕获多种关系(语法、语义、指代等)
#Transformer#Self-Attention#架构