88
在大模型应用中,如何处理文档智能处理(如合同审查、报表分析)场景?
业务理解与场景落地困难
📋 面试问题
在大模型应用中,如何处理文档智能处理(如合同审查、报表分析)场景?
✅ 期望回答
技术架构:
- 文档解析:非结构化文档解析(PDF/Word/扫描件)-> 结构化提取(Unstructured.io、LlamaParse、Marker等工具)
- 分块策略:根据文档层级结构分块(语义分块、递归分块、Markdown标题分块),关键字段保留原始表格/段落位置
- 多步处理:不是单个Prompt解决所有问题,而是Pipeline:章节分解 -> 逐章分析 -> 要点汇总 -> 风险标注
- 检索引擎:根据合同类型(采购、租赁、劳动)检索对应的审查规则库
- 逐条对比:LLM逐条对照规则判断条款合规性
- 风险标注:对问题条款标注风险等级和修改建议
- 结果溯源:每个判断都要引用原文条款位置
- 表格、多级标题、修订痕迹、签字页等复杂格式的处理
- OCR文字识别准确率(扫描件场景)
- 长文档(100+页)的上下文管理
- 法律合规风险——需人类专家最终审核
#文档处理#合同审查#RAG