12
请解释MoE (Mixture of Experts) 架构及其优缺点。
大模型基础理论困难
📋 面试问题
请解释MoE (Mixture of Experts) 架构及其优缺点。
✅ 期望回答
MoE将FFN层替换为多个专家(Expert)子网络,每个token由一个门控网络(Router/Gate)动态选择Top-k个专家进行计算
工作原理:- 输入token经过Router计算每个专家的得分:\(g = \text{softmax}(xW_g)\)
- 选择Top-k专家,加权求和:\(y = \sum_{i \in \text{TopK}} g_i \cdot E_i(x)\)
- 不同token可能被路由到不同专家,实现「条件计算」(每个token只激活部分参数)
- 参数效率:总参数量很大但每个token只激活少数专家(如Mixtral 8x7B总参数量47B,推理时只激活~13B)
- 训练效率:可以分配到多张GPU
- 扩展性:增加专家数量轻松扩展模型容量
- 负载不均衡:Router可能总是选择少数专家,导致部分专家「闲置」(需Load Balancing Loss)
- 显存占用大:所有专家权重需全量加载到GPU显存
- 通信开销:MoE在分布式训练中跨设备通信成本高
- 微调困难:SFT时专家利用率可能不均衡
代表模型:Mixtral 8x7B、Qwen2-MoE、DeepSeek-V2
#MoE#架构#Mixtral