88

在大模型应用中,如何处理文档智能处理(如合同审查、报表分析)场景?

业务理解与场景落地困难

📋 面试问题

在大模型应用中,如何处理文档智能处理(如合同审查、报表分析)场景?

✅ 期望回答

技术架构:
  • 文档解析:非结构化文档解析(PDF/Word/扫描件)-> 结构化提取(Unstructured.io、LlamaParse、Marker等工具)
  • 分块策略:根据文档层级结构分块(语义分块、递归分块、Markdown标题分块),关键字段保留原始表格/段落位置
  • 多步处理:不是单个Prompt解决所有问题,而是Pipeline:章节分解 -> 逐章分析 -> 要点汇总 -> 风险标注

合同审查场景:
  • 检索引擎:根据合同类型(采购、租赁、劳动)检索对应的审查规则库
  • 逐条对比:LLM逐条对照规则判断条款合规性
  • 风险标注:对问题条款标注风险等级和修改建议
  • 结果溯源:每个判断都要引用原文条款位置

关键难点:
  • 表格、多级标题、修订痕迹、签字页等复杂格式的处理
  • OCR文字识别准确率(扫描件场景)
  • 长文档(100+页)的上下文管理
  • 法律合规风险——需人类专家最终审核
#文档处理#合同审查#RAG