跳到正文

LLM 幻觉与安全风险怎么缓解?

从训练数据、解码策略到后处理,多角度应对方案

原题:在大语言模型的应用中,如何有效缓解模型生成内容中的幻觉(Hallucination)和安全风险(如偏见、有害内容)?请从训练数据、模型架构、解码策略、后处理和评估等多个角度阐述应对方法。

评估与监控 · 字节真题

回答与解析

幻觉与安全需要分层治理

数据与后训练:做来源、许可、重复、隐私和有害内容治理;SFT 教会目标行为,偏好优化可改善帮助性与安全性。DPO 直接用 chosen/rejected 偏好对优化 policy 相对 reference 的概率,不训练独立 reward model,不能说“把偏好编码进奖励模型”。

系统与证据:对知识密集或时效任务使用检索、数据库和工具,并要求引用可回溯;对不可信文档做提示注入隔离,工具使用最小权限、参数校验和审计。

解码与模型:温度、top-p 和约束解码影响随机性与格式,不保证事实正确。Contrastive Decoding 比较 expert 与较弱 amateur 模型的 token 分数,抑制两者都容易给出的退化候选;它不是简单重复惩罚,也不是事实保证。

后处理与评测:按断言核验来源、使用规则/分类器过滤、对高风险输出拒答或转人工。水印用于来源追踪或识别生成文本,不会降低幻觉本身。评测应分开测 factuality、faithfulness、偏见、有害内容、越狱、隐私与工具越权,并覆盖正常与对抗流量。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 区分幻觉和安全风险类型
  • 说明数据与偏好优化边界
  • 建立检索、工具与引用证据链
  • 准确解释解码与水印
  • 用分层红队和线上监控验收

【30秒速答】 缓解幻觉和安全风险要组合训练、证据、权限与评测。数据侧治理来源、隐私和有害样本,SFT 或偏好优化塑造行为;DPO 直接优化 chosen/rejected 相对 reference 的概率,不训练独立奖励模型。知识任务接检索和工具并核对引用,工具采用最小权限。Contrastive Decoding 比较 expert 与 amateur 的 token 分数,不是简单重复惩罚,也不保证事实。水印用于来源追踪,不会降低幻觉。最终分别测事实支持、安全分类、越狱、隐私和工具越权。

【90秒主答】 训练数据要记录来源、许可、时间、去重、隐私和敏感类别,避免把错误或有害模式直接放大。SFT 可以教模型遵循格式、引用证据和拒答边界;偏好数据可比较帮助性与安全性。DPO 使用同一 prompt 下的 chosen 与 rejected,并依赖冻结 reference policy 的对数概率比直接更新 policy,不需要先训练一个显式 reward model。若偏好标签偏差、覆盖不足或把过度拒答标成更安全,模型仍会学错,因此需要分层数据和独立安全回归。

知识密集任务要把答案连接到证据。检索可返回最新文档,计算器、代码执行或数据库可处理确定性事实,但 RAG 不是自动真实。检索可能漏证据,模型可能忽略上下文,文档还可能包含提示注入。系统应区分指令与不可信内容,校验引用是否真的支持对应断言,工具采用最小权限、参数白名单、超时和审计,高风险动作需要确认。

【完整展开】 解码只能改变候选分布。降低温度或约束 JSON 能提高复现性和格式通过率,不能把错误知识变正确。Contrastive Decoding 同时使用强 expert 与较弱 amateur,根据两者的 log probability 差异等规则选择 token,目标是减少 amateur 也容易产生的退化文本;具体效果依模型配对和超参数,仍需事实评测。Self-Consistency 对多条推理路径投票也只能提高某些可验证推理任务的稳定性,多数一致并非外部证据。

后处理可以把回答拆成断言,逐条检索、执行规则或交给专用验证器;有害内容、PII、恶意代码和越权请求使用分类器、策略引擎与人工升级。水印把统计信号嵌入生成 token,适合检测来源或治理传播,不会改变模型知识,因此不应列入幻觉缓解。评测要分别报告 factuality、给定来源 faithfulness、引用正确率、拒答准确性、偏见、有害内容、越狱成功率、隐私泄漏和工具调用违规。离线红队、灰度、日志抽检和事故回放共同组成闭环,任何单一安全分数都不能代表完整风险。

关键一句:证据链解决的是可核验性,权限边界解决的是可控性,两者都不能由单个解码技巧替代。

核验来源

  1. Direct Preference Optimization
  2. Contrastive Decoding: Open-ended Text Generation as Optimization
  3. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  4. A Watermark for Large Language Models

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设现在构建一个高风险知识问答系统,模型可能编造事实,也可能输出不安全内容。你会怎样让关键断言可回溯,并限制工具与数据权限?

  2. 问法 2 · 层层追问

    数据治理和后训练能解决什么?……检索与工具怎样提供证据,又怎样防提示注入?……解码能保证事实吗?……后处理、拒答、转人工和红队怎样组合?

  3. 问法 3 · 直球技术

    请从训练数据、后训练、检索/工具、解码、后处理、权限与评测系统说明幻觉和安全风险治理,并明确各层不能保证什么。

同模块相关题目