93

什么是Long Context(长上下文)技术?目前主流方案有哪些?

前沿技术与发展趋势中等

📋 面试问题

什么是Long Context(长上下文)技术?目前主流方案有哪些?

✅ 期望回答

长上下文指模型能处理的token数从4K扩展到128K、1M甚至无限

方案:
  • 位置编码外推:NTK-aware、YaRN、Pi(位置插值)、RoPE微调
  • 架构优化:ALiBi(基于偏置的线性外推)、xPos
  • 注意力优化:Ring Attention(分布式计算注意力)、StreamingLLM(滑动窗口+Sink Tokens)
  • 稀疏注意力:Longformer(局部+全局注意力)、BigBird(随机+窗口+全局)

代表模型:Claude 3.5(200K)、Gemini 1.5 Pro(1M-2M)、Kimi(200K)
#长上下文#RoPE#注意力优化