跳到正文

知识型与行为型错误诊断

先诊断知识缺失与行为/推理错误,再选 RAG 或 RL

原题:在减少大模型生成幻觉的问题上,RAG和强化学习(RL)分别适用于哪些场景?请从机制角度解释RAG主要缓解知识缺失导致的幻觉,而RL更擅长纠正行为或推理模式层面的幻觉。

评估与监控 · 京东真题

回答与解析

机制边界

题目的方向成立,但不能把幻觉严格二分。RAG 在推理时检索外部资料,把答案约束到可更新、可引用的证据,适合知识缺失、知识过时、私域信息和需要出处的问答。它不修改模型参数,效果受召回、重排、文档质量和生成忠实度限制。

强化学习或偏好优化通过奖励塑造输出策略,适合训练模型遵循指令、在证据不足时拒答、正确调用工具、遵守格式或改进可验证任务的行为。它不是可靠的事实写入机制;奖励可能带偏,策略也可能 reward hacking。只有结果或过程能被可信验证时,训练“推理模式”才有可靠反馈;隐藏推理文本本身不是正确性证据。

动态政策、价格和内部文档应优先检索权威数据并给出处;工具选择、拒答和结构化输出可用监督、偏好优化或 RL;数学与代码等任务结合执行器或验证器;高风险问答将 RAG、工具验证、校准拒答和人工复核一起使用。

评估拆分检索 Recall、证据忠实度、事实正确率、工具成功、拒答校准、奖励投机和端到端成功率。RAG 与 RL 是互补组件,不是互斥万能方案。

口语版讲法(约90秒)

  • 幻觉分类定调
  • RAG解决知识缺失
  • RL解决行为偏差
  • 落地互补与风险
  • 总结与可延伸点

RAG 和强化学习解决不同但重叠的问题。RAG 在推理时检索外部资料,适合动态或私域知识,也便于给出处。它不修改模型参数,检索漏召回、文档冲突或模型忽略证据时仍会出错。

强化学习或偏好优化通过奖励塑造输出策略,可以教模型拒答、调用工具和遵守格式,也能用于数学和代码等可验证任务。但它不是可靠的事实写入方法,奖励会有偏差,策略也可能投机。隐藏推理文本不能被当成正确性的证明。

生产系统通常组合两者:策略决定是否检索或调用工具,检索器返回并重排证据,模型基于证据生成,再由引用检查、规则、执行器或人工复核验证。证据不足时澄清或拒答。

评估要分别看检索召回、证据忠实度、事实准确率、工具成功率、拒答校准和端到端成功率。

关键一句:RL可以用来优化RAG的检索决策,比如让模型学会什么时候该检索、什么时候不该检索。

核验来源

  1. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  2. Training language models to follow instructions with human feedback

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商客服机器人,用户问订单状态,模型瞎编了一个物流信息。你觉得这种情况该用RAG还是强化学习来修?

  2. 问法 2 · 层层追问

    大模型老是胡说八道,一般怎么治?……RAG能解决哪些胡说?……那如果模型明明知道答案,但还是乱说,比如推理跳步,又该咋办?

  3. 问法 3 · 直球架构

    从机制上讲,RAG和强化学习分别适合处理哪种幻觉?比如知识缺失型和行为偏差型,你解释一下各自原理和适用场景。

同模块相关题目