← 返回维度总览
🏢

场景落地

7 道题 · 电商客服 / 合同审查 / 医疗应用 / 效果评估 / 成本平衡

💡 场景落地类题目考察“技术理解 + 业务敏感度”的综合能力,回答时需要结合真实业务场景分析,展示从技术到价值的完整闭环思考。

📋 如果要设计一个电商智能客服系统,你会如何选择技术方案?需要考虑哪些因素?

方案设计:
  • 意图识别:用微调小模型(LLaMA-3 8B + LoRA)或Few-shot Prompt做意图分类
  • FAQ匹配:Embedding + 向量数据库(Milvus/Qdrant)做语义匹配,优先返回已知标准答案
  • RAG兜底:调用知识库(商品信息、退换货政策等)+ LLM生成回答
  • 多轮对话:LangChain/LangGraph管理对话状态,支持槽位填充和意图澄清
  • 人机协作:低置信度或无匹配时自动转人工,带回话上下文

关键考量:
  • 延迟:电商C端场景要求首字延迟<1秒,需要GPU推理加速+vLLM+INT4量化
  • 准确率:FAQ匹配率应 >90%,RAG准确率应 >80%,错误可能导致客诉
  • 成本:单轮对话成本应 <0.01元(使用国产模型如Qwen-72B-INT4可大幅降本)
  • 安全:Prompt注入防护、敏感词过滤、防止越狱
  • 可观测性:记录对话链路、检索命中率、生成质量评分、用户满意度
智能客服电商系统设计
查看详情

📋 大模型在代码生成场景(如Copilot)中有哪些典型问题和解决方案?

典型问题:
  • 幻觉代码:调用不存在的API、创建不存在的库函数
  • 安全漏洞:生成含SQL注入、XSS等漏洞的代码
  • 风格不一致:代码风格(命名、缩进、架构)与项目不匹配
  • 上下文不足:不了解项目结构、数据库Schema、已有模块
  • 无法验证:生成的代码可能语法错误、逻辑错误

解决方案:
  • RAG + 代码库索引:将项目代码、文档、Schema、API文档索引到向量数据库,生成时检索相关上下文
  • 多步验证:生成 -> 静态检查(Linter/Type Checker)-> 单元测试自动生成并执行 -> 修复错误
  • 结构化输出:使用JSON Mode/Function Calling生成结构化代码改动(AST Patch而非raw text)
  • 安全规则注入:System Prompt中加入安全编码规范(OWASP Top 10等)
  • 人工审查:代码审查仍不可或缺,AI是辅助而非替代
代码生成Copilot安全
查看详情

📋 在大模型应用中,如何处理文档智能处理(如合同审查、报表分析)场景?

技术架构:
  • 文档解析:非结构化文档解析(PDF/Word/扫描件)-> 结构化提取(Unstructured.io、LlamaParse、Marker等工具)
  • 分块策略:根据文档层级结构分块(语义分块、递归分块、Markdown标题分块),关键字段保留原始表格/段落位置
  • 多步处理:不是单个Prompt解决所有问题,而是Pipeline:章节分解 -> 逐章分析 -> 要点汇总 -> 风险标注

合同审查场景:
  • 检索引擎:根据合同类型(采购、租赁、劳动)检索对应的审查规则库
  • 逐条对比:LLM逐条对照规则判断条款合规性
  • 风险标注:对问题条款标注风险等级和修改建议
  • 结果溯源:每个判断都要引用原文条款位置

关键难点:
  • 表格、多级标题、修订痕迹、签字页等复杂格式的处理
  • OCR文字识别准确率(扫描件场景)
  • 长文档(100+页)的上下文管理
  • 法律合规风险——需人类专家最终审核
文档处理合同审查RAG
查看详情

📋 你怎么看LLM在医疗领域的落地?有哪些特殊挑战?

应用场景:
  • 辅助诊断:基于病历、检查报告、影像报告生成初步诊断建议
  • 病历质控:自动发现病历矛盾(如诊断与用药不匹配)
  • 医学文献检索:RAG+医学文献库,生成最新循证医学建议
  • 患者教育:根据患者情况生成通俗易懂的健康指导

特殊挑战:
  • 极高正确率要求:医疗场景容错率极低,任何错误都可能导致严重后果
  • 数据稀缺与隐私:高质量医学数据获取困难,HIPAA/GDPR/个保法等合规要求
  • 时效性:医学知识快速更新,需持续将最新RCT/指南注入RAG知识库
  • 责任归属:AI辅助诊断出错后责任如何划分尚未有明确法规
  • 可解释性:需要提供诊断依据,而非黑盒输出
  • 垂类模型:需要专门在医疗数据上微调的领域模型

落地策略:先做辅助工具(减少医生重复劳动),后做诊断支持(建议+医生决策),绝不做全自动诊断
医疗合规垂类模型
查看详情

📋 你如何评估一个大模型应用在生产环境中的效果?设计一个完整的评估体系。

评估体系(五层金字塔): L1 - 模型基准评估(离线):
  • 学术Benchmark:MMLU(知识)、HellaSwag(推理)、HumanEval(代码)、GSM8K(数学)
  • 自有测试集:覆盖核心业务场景的标注数据集(>1000条),含正确答案和评分标准

L2 - 组件评估(离线):
  • RAG评估:Recall@k(检索是否命中相关文档)、Precision(命中文档是否相关)
  • Agent评估:工具调用成功率、多步任务完成率、路径效率

L3 - 生成质量评估(离线+在线):
  • 自动化:LLM-as-Judge(用GPT-4评分)、RAGAS框架
  • 人工:定频抽样人工评分(1-5分),覆盖多维度

L4 - 业务指标(在线 A/B Test):
  • 用户满意度(点赞率/点踩率)、回复采纳率、问题解决率
  • 效率指标:处理时间、转人工率、平均对话轮次

L5 - 商业指标(在线):
  • 成本(单轮对话成本、日总成本)
  • 对业务KPI的影响(客户留存、NPS、GMV转化率)

迭代闭环:问题Case -> 标注 -> 改进(Prompt/RAG/微调)-> 重新评估 -> 上线 -> 监控
评估体系生产环境A/B Test
查看详情

📋 在大模型应用开发中,你如何平衡效果和成本?请举例说明。

成本构成:
  • 推理成本(API调用费/GPU租赁费)占总成本70-90%
  • Embedding成本(RAG索引构建和实时检索)
  • 向量数据库存储和查询成本
  • 人工标注和运维成本

平衡策略:
  • 路由分层(Cascade):简单问题用小模型(LLaMA-3 8B),复杂问题用大模型(GPT-4o)。通过分类器判断问题复杂度
  • 缓存机制:高频相同/相似问题(>80%语义相似度)直接返回缓存结果。可用Redis+向量相似度检索
  • Prompt优化:精简System Prompt和Few-shot示例,减少输入token
  • 模型选择:生产环境评估国产模型(Qwen-72B-INT4、DeepSeek-V2)效果,性价比通常更高
  • 批处理:非实时场景(如批量标注、离线分析)用vLLM连续批处理

实例:某客服系统日均10万次对话,采用分层策略(50%小模型+30%中等模型+20%大模型),日均成本从800元降至120元
成本优化分层策略缓存
查看详情

📋 你认为未来1-2年大模型应用开发的最大趋势是什么?

  • Agent化:从单轮问答走向多步骤自主执行的Agent系统
  • 多模态融合:文本、图像、音频、视频的统一理解和生成
  • 端侧部署:模型小型化(1B-7B)+ 手机/PC本地运行,保护隐私并降低延迟
  • RAG进化:从简单向量检索走向GraphRAG、多模态RAG、实时RAG
  • 成本下降:模型效率提升(MoE、量化)+ 推理优化(投机采样、Continuous Batching)
  • 标准化:MCP等协议推动工具生态标准化,降低集成成本
趋势Agent多模态
查看详情