跳到正文

LLM 准确性提升四大路径

数据、训练、推理优化与外部增强四大路径可行性分析

原题:针对类似ChatGPT的大语言模型,从数据、训练方法、推理优化和外部增强等角度出发,分析提升其输出准确性的技术路径及其可行性。

评估与监控 · 百度真题

回答与解析

提升类似ChatGPT模型的准确性,先要把准确性拆开。事实回答要看引用和事实一致,数学与代码要看最终结果和执行验证,指令任务要看约束遵循,产品还要同时考虑帮助性与安全。一个方法在某一维提升,不代表其他维度同步改善。

数据侧应处理重复、污染、标签错误和目标领域覆盖,并保留独立评测。SFT让模型学习任务格式与示范行为,但示范若带错事实,模型也会复制。继续预训练可补领域分布,却可能带来遗忘。每次数据变更都要在目标、通用与安全集合上做回归。

偏好优化主要学习回答之间的相对偏好,可以改善帮助性、风格或拒答边界,但偏好标注若没有核验事实,不能自动提高事实准确率。RLHF和DPO的数据闭环不同,也没有无条件胜负。需要同时报告偏好胜率、事实指标、长度偏差和安全行为。

推理侧的CoT或多采样可帮助某些组合推理任务,也会生成看似合理的错误步骤。自一致性只说明多个采样同意,不等于事实正确。解码参数、验证器和工具执行应按任务选择,代码用测试,数学用可检查计算,不能靠一条统一prompt解决。

外部增强方面,RAG能把回答连接到可更新语料,但仍可能召回错误、忽略证据或错误引用。工具调用可以把搜索、计算和数据库查询交给外部系统,同时新增权限与注入风险。检索质量、证据支持率、答案忠实度和拒答都需单独评测。

我的实验会先建立无增强基线,再分别加入数据改进、偏好优化、推理提示、检索或工具,每次只改变有限变量。按事实、推理、帮助性、安全、延迟和成本分桶比较,并保留人工盲评。最终选择的是满足目标风险的组合,而不是给DPO、RLHF、CoT和RAG排一个通用名次。

口语版讲法(约4分钟)

  • 定义准确性的多个维度
  • 从数据和训练修正能力
  • 限定偏好优化的作用
  • 说明推理与外部增强边界
  • 建立可验证的系统组合

提升类似ChatGPT模型的准确性,先要把准确性拆开。事实回答要看引用和事实一致,数学与代码要看最终结果和执行验证,指令任务要看约束遵循,产品还要同时考虑帮助性与安全。一个方法在某一维提升,不代表其他维度同步改善。

数据侧应处理重复、污染、标签错误和目标领域覆盖,并保留独立评测。SFT让模型学习任务格式与示范行为,但示范若带错事实,模型也会复制。继续预训练可补领域分布,却可能带来遗忘。每次数据变更都要在目标、通用与安全集合上做回归。

偏好优化主要学习回答之间的相对偏好,可以改善帮助性、风格或拒答边界,但偏好标注若没有核验事实,不能自动提高事实准确率。RLHF和DPO的数据闭环不同,也没有无条件胜负。需要同时报告偏好胜率、事实指标、长度偏差和安全行为。

推理侧的CoT或多采样可帮助某些组合推理任务,也会生成看似合理的错误步骤。自一致性只说明多个采样同意,不等于事实正确。解码参数、验证器和工具执行应按任务选择,代码用测试,数学用可检查计算,不能靠一条统一prompt解决。

外部增强方面,RAG能把回答连接到可更新语料,但仍可能召回错误、忽略证据或错误引用。工具调用可以把搜索、计算和数据库查询交给外部系统,同时新增权限与注入风险。检索质量、证据支持率、答案忠实度和拒答都需单独评测。

我的实验会先建立无增强基线,再分别加入数据改进、偏好优化、推理提示、检索或工具,每次只改变有限变量。按事实、推理、帮助性、安全、延迟和成本分桶比较,并保留人工盲评。最终选择的是满足目标风险的组合,而不是给DPO、RLHF、CoT和RAG排一个通用名次。

上线后还要监控增强组件各自的失效。检索索引可能过期,工具权限或API会变化,偏好模型也可能随用户群漂移。日志应记录证据、工具结果、模型版本和最终决策,让错误能回放。若准确率提升依赖高成本路径,还要报告单位正确答案成本与延迟,避免只优化离线分数。

事实任务还可以要求输出可核验引用,并测引用是否真的支持结论,而不是只看有没有链接。若模型在证据不足时仍强答,应把可选择的拒答纳入准确性设计。支持率、答案正确率和覆盖率需要同时报告,避免靠大量拒答获得表面高精度。

关键一句:偏好胜率提升为何不能直接当成事实准确率提升。

核验来源

  1. TruthfulQA: Measuring How Models Mimic Human Falsehoods
  2. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
  3. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
  4. Training language models to follow instructions with human feedback
  5. Direct Preference Optimization: Your Language Model is Secretly a Reward Model

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做一个智能客服,用户问“今天天气怎么样”,模型直接回答“今天有雨”,但其实它并不知道当前位置。这种事实错误你一般怎么防?从数据、训练到上线整个链路聊聊。

  2. 问法 2 · 层层追问

    大模型输出不准,你觉得根源在哪?……那数据层面能做什么?……训练方法呢,比如对齐有什么效果?……还有没有不用改模型就能提升准确性的手段?

  3. 问法 3 · 直球架构

    从数据、训练方法、推理优化和外部增强四个维度,分析提升大模型输出准确性的技术路径,并评估各自的可行性和适用场景。

同模块相关题目