61

微调数据的质量和数量哪个更重要?如何构建高质量微调数据集?

模型微调与训练中等

📋 面试问题

微调数据的质量和数量哪个更重要?如何构建高质量微调数据集?

✅ 期望回答

质量 >> 数量

研究发现(如LLaMA-2 / LIMA论文):1000条高质量、多样化的微调数据效果优于数万条低质量数据

高质量微调数据的要求:
  • 指令多样性:覆盖多种任务类型(问答、摘要、代码、翻译、推理、创意写作)
  • 回答准确性:每个回答经过专家验证,确保无事实错误
  • 一致性:同一类问题回答风格和格式保持一致
  • 覆盖度:覆盖目标场景的常见指令类型和边界情况
  • 输出风格:回答风格匹配期望的使用场景

构建方法:
  • 人工标注(500-2000条):最贵但质量最好
  • LLM合成+人工筛选:GPT-4生成候选回答 -> 人工筛选/评分
  • 自动增强:种子数据 + LLM改写生成多样化的变体问题(Self-Instruct、Evol-Instruct方法)
  • 现实数据回写:从生产环境收集真实用户Query -> 人工回答 -> 加入微调数据集

成本参考:1000条专家级标注约2000-4000美元
#微调数据#数据质量#Self-Instruct