8

什么是上下文学习 (In-Context Learning, ICL)?其原理是什么?

大模型基础理论中等

📋 面试问题

什么是上下文学习 (In-Context Learning, ICL)?其原理是什么?

✅ 期望回答

ICL指给模型几个输入-输出示例作为Prompt前缀,模型无需参数更新就能在新的query上做出正确预测

原理假说:
  • 贝叶斯推断视角:模型通过Attention隐式地「推断」当前任务分布,Few-shot示例提供了隐式的任务描述
  • 梯度下降视角:ICL等价于在隐式空间中做一步梯度下降(「Transformer是Meta-Optimizer」),Attention层的计算可以模拟线性回归
  • 先验匹配:模型在预训练数据中见过类似的任务结构和in-context pattern,因此在足够大规模后学会了「模式识别」

影响因素:
  • 示例质量 > 示例数量
  • 示例顺序影响结果(Order Sensitivity)——标签分布尽量均衡
  • 示例的真实输入-输出映射很关键,但标签本身不一定需要正确(说明模型更多从格式而非内容中学习)
#ICL#Few-shot#上下文学习