跳到正文

RAG 项目指标化复盘

RAG 项目的检索、重排、生成链路和指标证明

原题:请详细介绍一个你参与的RAG(检索增强生成)相关项目,包括项目背景、技术方案、你的具体贡献以及遇到的挑战和解决方案。

RAG基础 · 百度真题

回答与解析

真实性边界

这是 RAG 项目经历题。公司、客户、语料规模、模型、索引、个人贡献和指标必须来自候选人的真实项目。不得使用题库预设的制造业知识库、设备编码或效果数字。

回答框架

  1. 场景与目标:用户问题、知识来源、更新频率、权限、主指标和服务预算。
  2. 个人职责:填写本人实际负责的模块,例如文档、检索、重排、生成、评测、服务或监控,并明确团队依赖。
  3. 完整链路:采集与解析 → 分块和元数据 → 索引 → 查询处理 → 召回 → 重排 → 上下文 → 生成与引用 → 观测。
  4. 选型取舍:稀疏/稠密/混合检索、RRF/加权融合、是否重排及参数依据。
  5. 因果证据:固定评测集上的基线、单变量消融、延迟与成本变化、bad case 和上线边界。

事实填空

项目服务【真实场景】,语料来自【合法来源】,规模和版本【】。我负责【本人模块】,基线【】。失败切片【】由【日志/标注/回放】发现,采用【真实改动】,结果【真实指标和口径】,代价【】,仍失败【】,回退【】。

证据自检

准备语料版本、评测集构造、防泄漏、Recall@K/MRR/NDCG、答案支持率、P95/P99、QPS、成本、消融表和失败样本。不能把召回提升直接等同于答案正确,也不能把同期业务增长直接归因于 RAG。

追问入口

可继续追问表格/OCR、精确标识符、权限过滤、RRF 参数、重排贡献、引用校验、增量索引、缓存隔离和多租户扩展。

口语版讲法(约90秒)

  • RAG本质是让大模型先查后答,不是硬记
  • 数据层:多源解析和表格保留
  • 检索层:混合召回加重排,型号编码单独倒排
  • 生成层:置信度阈值防幻觉,版本冲突处理
  • 落地前提和风险

我会选一个自己真实参与的 RAG 项目,从业务问题讲到可验证证据。项目服务【真实场景】,语料来自【语料来源】,我负责【本人职责】;其他模块会说明团队分工,不把整条链路都算成个人贡献。

技术上我会画出【技术链路】,包括解析与分块、元数据和权限、索引、查询处理、召回、重排、上下文、生成、引用与监控。然后挑一个最有代表性的 bad case,说明【关键改动】为什么针对根因,而不是直接罗列 BM25、向量检索或 RRF。检索、排序和生成分层评测,每轮固定语料与测试集做消融。

项目结果按【评测结果】填写,同时交代 Recall@K 或排序指标、答案支持率、P95/P99、成本和观察窗口,不能用一个“准确率”概括全链路。我还会准备【失败案例】,解释它是知识缺失、过滤、召回、排序还是生成问题,以及对应的拒答、降级或回滚。语料、embedding、索引、reranker、Prompt 和模型都版本化,多租户权限和缓存隔离单独验证。这样面试官追问任何一层,都能回到真实 trace 和实验。

关键一句:即使检索准,模型仍可能忽略部分上下文,需要更精细的段落关联策略,但会引入延迟

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你做过客服知识库,用户问“XX型号故障码E301怎么解决”,系统得从一堆PDF手册里找答案。你能讲讲你是怎么把这种多源文档整合起来,让检索又快又准的吗?

  2. 问法 2 · 层层追问

    你之前做过RAG项目吧?先聊聊整体流程……数据是怎么处理的?……检索部分呢,向量加关键词召回有做吗?……那效果怎么样,有没有遇到特别难搞的问题,比如表格或者版本冲突?

  3. 问法 3 · 直球架构

    请详细讲一个你主导的RAG项目,从数据层、检索层到生成层,你的具体贡献是什么?遇到过哪些技术挑战,比如表格解析或结果冲突,怎么解决的?最好有量化指标。

同模块相关题目