4
GPT系列和BERT系列的根本区别是什么?各适用于什么场景?
大模型基础理论简单
📋 面试问题
GPT系列和BERT系列的根本区别是什么?各适用于什么场景?
✅ 期望回答
根本区别:
维度 GPT (自回归) BERT (自编码)
预训练目标 Next Token Prediction Masked Language Model (MLM)
注意力掩码 Causal Mask(只看左边) 双向(Full Attention)
架构 Decoder-only Encoder-only
方向性 单向(自回归) 双向(上下文)
适用场景:
- GPT/Decoder-only:文本生成、对话、代码补全、自回归任务(ChatGPT、GPT-4、LLaMA、Claude)
- BERT/Encoder-only:文本分类、NER、情感分析、句子对匹配(阅读理解、语义相似度)
- Encoder-Decoder模型(T5/BART):翻译、摘要、改写——当前主流大模型发展方向是Decoder-only(训练效率更高、Scaling更友好)
#GPT#BERT#Decoder-only