跳到正文

附录:把这个 RAG 项目写进简历 & 面试应答

能把本书学的 RAG 项目,写成一段经得起追问的简历经历,并答得上每个模块的高频面试追问

📊 学习时长:45-60 分钟 🎯 完成后能力:能把本书学的 RAG 项目,写成一段经得起追问的简历经历,并答得上每个模块的高频面试追问 🔗 关联面试题:5 道(覆盖 5 个不同角度,见 Part 3)

这一章你会学到什么

  • ✓ 跟着做:把一句空泛的"做过 RAG"改写成有深度、能打的简历 bullet
  • ✓ 看懂项目经历的四要素(背景 / 架构 / 个人贡献 / 方法论)
  • ✓ 掌握写简历的万能公式:动词 + 技术方案 + 量化指标
  • ✓ 学会五条事实核验原则,只写自己真正做过且能解释的内容
  • ✓ 拿到一份完整的项目经历结构,以及高频面试追问清单
  • ✓ 知道量化指标该怎么准备(用真数,别编)

本章按三段式组织(这是附录,Part 1 是"动手写简历",Part 2 是"面试应答"):

段落 给谁看 内容 占比
🚀 Part 1 · 主线实战 想把项目写进简历 四要素 + 公式 + 改写练习 ~45%
🎯 Part 2 · 面试深度 想答好面试追问 五原则 + 完整结构 + 追问清单 ~45%
🏆 Part 3 · 验收串题 检验学到位没 关联面试题 + 自检清单 ~10%

🚀 Part 1 · 主线实战 | ~45% 这部分跟着做:把本书学的东西,落成简历上一段能打的项目经历。

在开始之前

你需要:

  • ✅ 已经读完(或跟着做完)本书第 1~10 章,这附录是教你"怎么把学到的写出来、说出来"
  • ✅ 一份你自己的简历(哪怕只有一行"做过 RAG"也行,我们来把它改厚)
  • ✅ 模板见 code-snippets/resume-template.md,边读边往里填

先看一个常见问题(这是本章的"为什么")

"参与开发了一个基于 RAG 的智能问答系统。"

这句话看不出求职者具体负责什么,也无法判断是否真正做过。面试官继续问"检索怎么做的""幻觉怎么评估的",如果回答里没有代码、实验、日志或设计记录,项目主张就站不住。

本附录不提供一段可以直接背的完美故事,而是要求你把每个模块写成:真实问题 → 个人职责 → 实际方案 → 测量方法 → 实测结果 → 已知边界。没有证据的项就留空、补实验或删除。

一句话:简历和面试不是把教程改写成第一人称,而是把自己真正做过的事讲清楚。

这附录,我们就先动手把一句空泛描述改厚。

3 个核心概念(先白话,再要点)

概念 1:有深度的项目经历 = 四要素

一段经得起追问的 RAG 项目经历,要齐这四样:

背景/动机(为什么做 RAG)、系统架构(离线建库 + 在线问答的流程)、个人贡献(是"我"做了什么,不是"系统"做了什么)、方法论(问题→假设→验证→优化的思考链)。缺任何一个,都会显得单薄。

概念 2:写好每条 bullet 的万能公式

个人动作 + 具体技术方案 + 可核验结果。 三样齐了,一条 bullet 才能说明你做过什么。空泛的"使用了混合检索,显著提升准确率",应改成事实填空句:"我负责 <模块>,实现 <方案>;在 <评估集与配置> 下,<指标><基线实测> 变为 <方案实测>。"没有实测就不要填数字。

概念 3:从 what 到 how 到效果

面试官想听的不是你"用了什么"(what),而是"为什么这么用、怎么用的"(how)和"结果如何"(效果)。简历上每一句,都要能展开成"问题 → 方案 → 效果"这条链。

🛠️ 跟着做:把一句空泛描述改厚

Step 1:拿一条你的简历描述

比如这条很常见的:

优化了文档解析。

四个字,信息量几乎为零。面试官无法判断你做了什么、有多难、效果如何。

Step 2:套公式改写

按"动词 + 技术方案 + 量化指标"重写,把本书第 3 章学的填进去:

针对 <你的真实失败样本>,我实际实现 <你的解析方案>;在 <样本量与标注规则> 下,<指标><基线实测> 变为 <方案实测>,仍存在 <已知边界>

你应该写出这样的对照:改写三步:① 把"优化了"换成具体技术;② 说清为什么这么做;③ 补上量化效果

⚠️ 常见翻车(改写时注意)

  • 只把"优化了"换成"优化了 XXX 算法",还是没说 how:要落到具体做法(集成了什么、设计了什么);
  • 只写效果数字却交代不出指标定义、基线、样本与测量方法:不管数字整不整齐,都会在"怎么测的"追问里失去可信度,见 Part 2;
  • 写了你没吃透的技术:简历写了就要能在面试展开讲,没把握的别硬塞。

Step 3:🛠️ 动手实验,改写你自己的三条

打开你的简历(或 resume-template.md),挑三条最空泛的描述,各套一遍公式改写。改完读一遍,问自己:"这条我能在面试里展开讲 20 分钟吗?" 能,就留下;不能,要么补课、要么删掉。

🧭 你刚才做的,对应本书的什么?

  • 你往简历里填的每一个"具体技术方案",都是本书某一章讲过的:解析切分(第 3 章)、检索(第 5 章)、重排(第 6 章)、多轮(第 8 章)、溯源(第 9 章);
  • 你填的每一个"量化指标",都该用第 10 章那套评估方法亲手量出来;
  • 换句话说:本书十章 = 你简历项目经历的弹药库,这附录只是教你怎么把弹药装进膛。

这一节你掌握了什么?

  • ✅ 项目经历的四要素、写 bullet 的万能公式
  • ✅ 亲手把一句空泛描述改成了有深度的简历条目
  • ✅ 想清了"简历每句都要能在面试展开讲"

🎯 Part 2 · 面试深度 | ~45% 这部分讲透简历优化五原则、完整结构、高频面试追问怎么答、量化指标怎么准备。

2.1 简历五条优化原则

把上面的公式展开,就是五条可操作的原则:

  • ① 量化指标:模糊 → 精确,"显著提升"换成"从 a 提到 b";
  • ② 技术深度:what → how,不只说用了啥,说清怎么做的;
  • ③ 个人贡献:"系统采用了…" → 只填写你能用提交记录、设计文档或实验记录说明的个人工作;
  • ④ 对比挑战:每个技术点都遵循"问题(现状 + 数据)→ 方案 → 效果";
  • ⑤ 业务价值:不止技术指标,还有"服务多少人、降本多少、处理多少查询"。

面试提示:这五条本质是同一件事,让每条项目主张都有证据。可以写"我遇到 X 问题,实现 Y 方案,在 Z 评估设置下得到自己的实测结果",但 X、Y、Z 都必须来自你的项目,不能从教程搬运。

2.2 一份完整的项目经历长什么样

  • 项目背景(2-3 句):说清规模 + 价值。示例句式:"从 0 到 1 构建 <行业> 领域问答系统,处理 <N> 份多格式文档,服务 <M><用户><业务>,日均 <X> 次查询,准确率 <Z>%":一句话把"规模感"和"业务价值"都立起来(尖括号里换成你的真实数据);
  • 主要工作(5 个模块,每个 3-5 条 bullet):解析切分 / 检索召回 / 重排 / 多轮记忆 / 生成溯源:正好是本书第 3~9 章,每条用公式写,配一张架构图;
  • 项目成果(四个维度):技术指标、答案质量、业务价值、技术沉淀。

不同身份深度可以不同:实习/校招重点把"我跟着走通了完整链路、理解每步为什么"讲清;社招则要突出"我主导/优化了哪几块、拿到了什么可量化结果"。同一个项目,按岗位调整详略,但四要素和公式不变。

面试提示:主要工作模块和本书章节可以对应,但读完一章不等于做过一个模块。只有你实际运行、修改、测量并留下证据的内容,才能写进简历。教程负责提供练习路径,事实仍由你的项目记录提供。

2.3 高频面试追问清单

简历写好只是入场券,面试官一定会顺着它往下挖。好消息是:他追问的,本书每一章都讲过。

每个模块都备 2-3 个高频问题,而每章末尾的"关联面试题",就是你的弹药库。比如:

  • "你切分怎么做的?为什么不用固定长度?" → 第 3 章(核辐射事故 + 三代演进);
  • "为什么要混合检索?两套分数怎么融合?" → 第 5 章(BM25 短板 + RRF);
  • "都召回了为什么还要精排?" → 第 6 章(粗排排错 + Lost in the Middle);
  • "多轮里的指代怎么处理?历史太长怎么办?" → 第 8 章(指代消解 + 裁剪);
  • "怎么保证答案不是编的、能溯源?" → 第 9 章(拒答 + 引用归因);
  • "你怎么知道优化真的有效?" → 第 10 章(评估集 + Recall/MRR)。

业内行话:回答追问的黄金结构还是那条链:"我们遇到的问题(带数据)→ 我的假设和方案 → 验证后的效果"。面试官真正想确认的,不是你知道某个 buzzword,而是你有没有完整走过"发现问题→解决问题→量化验证"的工程闭环。这条思考链,比任何术语都值钱。

回答框架(以"你切分怎么做的?"为例,每个尖括号都由你填写):

"项目里的资料是 <真实资料类型>,我负责 <真实职责>。基线使用 <原方案>,在 <失败样本> 上出现 <实际问题>

我实现了 <你实际完成的方案>,选择它而不是 <备选方案>,因为 <真实约束>

我们在 <样本量、标注规则、运行配置> 下比较,结果是 <你的实测>;仍未解决的是 <真实边界>。证据保存在 <代码/日志/设计记录>。"

这个框架要求你同时交代职责、决策、测量和边界。开篇的核辐射场景只能作为教学演练,不能替换成自己的线上事故。

业内行话(自我介绍):面试第一题往往是自我介绍。别流水账,套一个"我是谁 + 一句话亮点项目 + 我最能打的一两个技术点 + 为什么对大模型/这个岗位感兴趣"的结构,30-60 秒说完,把面试官的注意力主动引到你最想被追问的那个 RAG 项目上,后面就能顺势讲你最熟的内容。

2.4 量化指标怎么准备(别编)

简历最有杀伤力的是数字,但数字必须是真的:

  • 别凭空编:整数、小数、漂亮或不漂亮的数字都可能真实,也都可能虚构。可信度不由数字格式决定,而由指标定义、基线与对照、样本来源和规模、标注规则、运行配置及日志共同决定;
  • 用第 10 章的方法量出来:根据业务风险和覆盖范围确定评估集规模,固定同一评估集和运行配置,让候选方案各跑一遍,记录 Recall/MRR、失败样本与原始结果。能把这些证据拿出来复查,效果主张才有说服力。

业内行话:不要让小数位替证据背书。准备简历时,应当先定义指标与评估集,保留脚本、配置、日志和结果快照,再写实际测得的结果;如果没有可复查记录,就不写效果数字。

2.5 常见翻车点

  • 只说 what 不说 how:写"用了重排",一问原理就卡;
  • 全是"系统"没有"我":看不出个人贡献,像在背架构图;
  • 效果数字没有证据链:说不清指标定义、样本、基线、配置和运行记录;
  • 写了不懂的技术:简历写了就要能答,别写没吃透的。

一条铁律:简历上写的每一句,都要能在面试里展开讲 20 分钟。 做不到的,要么补课补到能讲,要么从简历里删掉:宁可少写,不可写了答不上。


🏆 Part 3 · 验收串题 | ~10% 学到这一步,做几道题验证一下,知道自己学到位没。

关联面试题(5 道,覆盖 5 个角度)

  1. 【完整介绍 RAG 项目】 请详细介绍一个你参与的 RAG 项目:背景、技术方案、你的具体贡献、遇到的挑战。
  2. 【RAG 技术细节】 请说明你在项目里应用 RAG 的技术细节:检索器设计、知识库构建、与生成的结合。
  3. 【RAG 解决了什么问题】 RAG 在你的项目里解决了哪些具体问题?带来了什么影响?
  4. 【项目深挖追问】 二三面里,面试官通常会针对项目深挖哪些技术实现细节?
  5. 【自我介绍】 做一个简要自我介绍:教育背景、工作经历、技术专长,以及你对大模型领域的理解。

学完这一章你应该能干嘛

跟着做(Part 1):

  • 能说出项目经历四要素,并用万能公式改写一条空泛描述
  • 能把本书学的技术,对应填进简历模板

讲深度(Part 2):

  • 能用五条原则,把整段项目经历从"听过"改成"做过"
  • 能针对每个模块,答出至少一个高频面试追问
  • 能讲清量化指标怎么来(用评估集量真数,不编)
  • 能避开四个常见翻车点

4 项以下 → 回去 Part 1 重做;4–5 项 → Part 2 再看一遍;6 项以上 → 你已经能把这个项目讲明白了。

完整模板 + 全书代码

本书每章的完整可运行代码 + 本附录的简历模板,都在配套 GitHub 仓库:

🔗 github.com/MisterBooo/rag-from-zero

  • 十章可运行代码 + 本附录的简历填空模板
  • clone 下来,跟着做、照着填
  • 欢迎 Star ⭐ / Issue 反馈

写在最后:从第 1 章"为什么做 RAG"到这里"怎么把它写进简历",你已经走完了一条完整的链路:理解原理、动手实现、讲清取舍、量化验证、表达呈现。剩下的,就是把它真正做一遍,然后自信地讲出来。 祝你拿到心仪的 offer。如果这套教程帮到了你,给仓库点个 Star,就是对作者最好的鼓励。


导航

← 上一章:系统评估与上线优化 | 回到项目首页