RAG 项目指标化复盘
RAG 项目的检索、重排、生成链路和指标证明
原题:请详细介绍一个你参与的RAG(检索增强生成)相关项目,包括项目背景、技术方案、你的具体贡献以及遇到的挑战和解决方案。
RAG基础 · 百度真题
回答与解析
真实性边界
这是 RAG 项目经历题。公司、客户、语料规模、模型、索引、个人贡献和指标必须来自候选人的真实项目。不得使用题库预设的制造业知识库、设备编码或效果数字。
回答框架
- 场景与目标:用户问题、知识来源、更新频率、权限、主指标和服务预算。
- 个人职责:填写本人实际负责的模块,例如文档、检索、重排、生成、评测、服务或监控,并明确团队依赖。
- 完整链路:采集与解析 → 分块和元数据 → 索引 → 查询处理 → 召回 → 重排 → 上下文 → 生成与引用 → 观测。
- 选型取舍:稀疏/稠密/混合检索、RRF/加权融合、是否重排及参数依据。
- 因果证据:固定评测集上的基线、单变量消融、延迟与成本变化、bad case 和上线边界。
事实填空
项目服务【真实场景】,语料来自【合法来源】,规模和版本【】。我负责【本人模块】,基线【】。失败切片【】由【日志/标注/回放】发现,采用【真实改动】,结果【真实指标和口径】,代价【】,仍失败【】,回退【】。
证据自检
准备语料版本、评测集构造、防泄漏、Recall@K/MRR/NDCG、答案支持率、P95/P99、QPS、成本、消融表和失败样本。不能把召回提升直接等同于答案正确,也不能把同期业务增长直接归因于 RAG。
追问入口
可继续追问表格/OCR、精确标识符、权限过滤、RRF 参数、重排贡献、引用校验、增量索引、缓存隔离和多租户扩展。
口语版讲法(约90秒)
- RAG本质是让大模型先查后答,不是硬记
- 数据层:多源解析和表格保留
- 检索层:混合召回加重排,型号编码单独倒排
- 生成层:置信度阈值防幻觉,版本冲突处理
- 落地前提和风险
我会选一个自己真实参与的 RAG 项目,从业务问题讲到可验证证据。项目服务【真实场景】,语料来自【语料来源】,我负责【本人职责】;其他模块会说明团队分工,不把整条链路都算成个人贡献。
技术上我会画出【技术链路】,包括解析与分块、元数据和权限、索引、查询处理、召回、重排、上下文、生成、引用与监控。然后挑一个最有代表性的 bad case,说明【关键改动】为什么针对根因,而不是直接罗列 BM25、向量检索或 RRF。检索、排序和生成分层评测,每轮固定语料与测试集做消融。
项目结果按【评测结果】填写,同时交代 Recall@K 或排序指标、答案支持率、P95/P99、成本和观察窗口,不能用一个“准确率”概括全链路。我还会准备【失败案例】,解释它是知识缺失、过滤、召回、排序还是生成问题,以及对应的拒答、降级或回滚。语料、embedding、索引、reranker、Prompt 和模型都版本化,多租户权限和缓存隔离单独验证。这样面试官追问任何一层,都能回到真实 trace 和实验。
关键一句:即使检索准,模型仍可能忽略部分上下文,需要更精细的段落关联策略,但会引入延迟
面试官还可能这样问
- 问法 1 · 场景切入
假设你做过客服知识库,用户问“XX型号故障码E301怎么解决”,系统得从一堆PDF手册里找答案。你能讲讲你是怎么把这种多源文档整合起来,让检索又快又准的吗?
- 问法 2 · 层层追问
你之前做过RAG项目吧?先聊聊整体流程……数据是怎么处理的?……检索部分呢,向量加关键词召回有做吗?……那效果怎么样,有没有遇到特别难搞的问题,比如表格或者版本冲突?
- 问法 3 · 直球架构
请详细讲一个你主导的RAG项目,从数据层、检索层到生成层,你的具体贡献是什么?遇到过哪些技术挑战,比如表格解析或结果冲突,怎么解决的?最好有量化指标。