10
什么是Scaling Law?对大模型开发有什么指导意义?
大模型基础理论中等
📋 面试问题
什么是Scaling Law?对大模型开发有什么指导意义?
✅ 期望回答
Scaling Law描述了模型性能(Loss)与模型参数量N、训练数据量D、计算量C之间的幂律关系:\(L = L_0 + \frac{A}{N^\alpha} + \frac{B}{D^\beta} + \frac{C}{C_{min}^\gamma}\)
核心发现(Kaplan et al. / Chinchilla Scaling Law):- Kaplan(OpenAI):模型性能随参数量、数据量、计算量幂律提升;大模型比小模型更计算高效
- Chinchilla(DeepMind):给定计算预算,参数量和训练token数应等比增长(平均1参数对应20文本token);此前很多模型「不够训」(参数很大但训练数据不够)
- 资源分配:给定GPU预算,模型大小和数据量的最优配比
- 小模型策略:在数据充足时,小模型+多数据 > 大模型+少数据(如LLaMA-3 8B超越LLaMA-2 70B)
- 预训练规划:给定数据量,合理选择模型参数量,避免浪费计算
- 中国现状反思:很多时候参数竞赛忽略了数据质量和训练的充分性
#Scaling Law#Chinchilla#预训练