跳到正文

Reward Model 训练流程详解

输入数据、标签构造、损失函数设计及RLHF中奖励信号来源

原题:请详细阐述奖励模型(Reward Model)的训练流程,包括输入数据的形式、标签如何构造、损失函数的设计,并解释奖励信号在强化学习中(如RLHF)的来源及其标注机制。

RLHF与对齐 · 网易真题

回答与解析

Reward Model 学习相对偏好,PPO 和 DPO 使用方式不同

数据通常由同一 prompt 下的多个候选回答与偏好关系构成。标注者依据帮助性、正确性、安全等指南做排序或成对选择,形成 chosen、rejected;应保留平局、分歧、标注者与版本信息。Reward Model 常在语言模型主干上加标量头,对完整 prompt-response 输出一个 sequence score,并使用 Bradley-Terry 风格成对 logistic loss,使 chosen 分数高于 rejected。该分数只在训练数据与目标定义下有意义,不是跨模型、跨数据的绝对质量单位。

Elo 用比赛结果估计参与者相对 rating,可用于模型竞技场汇总相对胜负,但不是绝对分,也不是 PPO 每一步的即时奖励。在典型 RLHF 中,RM 对完整回复给终局奖励,策略训练还会按 token 加相对 reference policy 的 KL 惩罚,并由 value/advantage 将 return 用于各生成位置。过程奖励是另一类信号,需额外的步骤标注或验证。

DPO 不显式训练独立 RM 或运行 PPO,但它并非没有参考策略与 KL 关系。DPO 目标比较 chosen/rejected 在 policy 与 reference policy 下的对数概率差,beta 控制相对参考策略的偏离强度。无论 RM、PPO 还是 DPO,都要用独立偏好、事实、安全和分布外切片评估,检查长度偏好、标注噪声和 reward overoptimization。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 从同 prompt 的偏好回答对构造数据
  • 用序列标量分数和成对损失训练 RM
  • 区分相对 rating 与绝对质量
  • 解释 PPO 中终局奖励、KL 和 advantage
  • 说明 DPO 的 reference policy 与 beta

【30秒速答】 Reward Model 通常接收同一 prompt 下的 chosen 和 rejected,对完整回答输出标量,用成对 logistic 或 Bradley-Terry 风格损失提高 chosen 相对分数。这个 score 是特定数据分布上的偏好信号,不是绝对正确率。Elo 也是根据胜负更新的相对 rating,不是每步即时奖励。典型 RLHF 中,RM 给序列终局分,逐 token KL 约束策略相对 reference 的偏离,value 和 advantage 再把 return 用于 PPO。DPO 虽不显式训练 RM,也仍使用 reference policy 和 beta。

【90秒主答】 数据构造先固定标注指南,让多个候选回答在帮助性、正确性、安全和风格等维度比较,保留 chosen、rejected、平局、分歧和来源。RM 常从 SFT 模型初始化,在最后有效 token 或序列表示上产生一个标量。对一对回答,可最小化负对数 sigmoid 的分数差,让 chosen 分数大于 rejected。训练要按 prompt 切分,避免同题改写泄漏,并检查不同长度、语言、领域与安全类别。分数的零点和尺度由模型与数据决定,不能把 3.2 解释为跨系统绝对质量。Elo 汇总模型之间的成对胜负,rating 会依赖对手池和更新设置,也只是相对位置。在 PPO 式 RLHF 中,完整响应经过 RM 得到终局 reward,再把 reference logprob 形成的 KL 惩罚分布到 token,value model 估计 return 并得到 advantage。

【完整展开】 标注机制决定 reward 学到什么。若指南偏爱更长、更自信的回答,RM 可能把长度当捷径;事实标签不足时,高分也不能代表事实正确。需要平衡候选质量、随机化展示顺序、复核分歧,并用隐藏测试检查长度、迎合与安全偏差。过程奖励与终局 RM 分开:代码测试、数学步骤验证或人工过程标签可以给中间信号,但不能假设普通偏好 RM 自动产生每步奖励。策略过度优化 RM 可能发现评分漏洞,所以监控 reward、KL、长度、熵以及独立人工和可执行指标。

DPO 从标准 RLHF 目标推导出直接偏好优化。它比较 policy 对 chosen 和 rejected 的相对 logprob,同时减去 reference policy 对同一对回答的 logprob 差,beta 控制约束强度。因此“DPO 没有参考策略或 KL 约束”是错误的;更准确地说,它不显式拟合 RM、不运行在线 PPO,而把偏好与参考约束放进分类式目标。选择 RM+PPO 还是 DPO 取决于是否需要在线探索、是否有可靠奖励、采样成本和系统能力,不能只看训练 loss。

【验证补充】RM 的离线准确率要按 prompt 难度、长度差、语言和安全类别切片,并报告成对准确与校准,而不是把平均 score 当验收。进入策略优化后保留一个不参与训练的人工偏好集和可执行任务集,观察策略是否通过写得更长、复述提示或利用格式漏洞获得高分。

关键一句:RM score 和 Elo 都是相对信号;PPO 的终局 reward、逐 token KL 与 DPO 的 reference 约束必须分别说明。

核验来源

  1. Training language models to follow instructions with human feedback
  2. Direct Preference Optimization: Your Language Model is Secretly a Reward Model
  3. Hugging Face TRL Reward Trainer Documentation

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设你在做电商客服的智能回复,用户问“这个手机怎么样”,模型给了两个不同回答,我们让标注员挑出更好的那个。你会怎么用这些数据训练一个奖励模型?具体说说输入长什么样、标签怎么搞、损失函数怎么设计。

  2. 问法 2 · 层层追问

    RLHF 里奖励模型是怎么训练的?……输入数据是什么形式?……标签怎么来的?……那损失函数用哪个?……训练完怎么用到 PPO 里,奖励信号怎么整合的?

  3. 问法 3 · 直球架构

    请详细讲一下奖励模型的训练流程:输入数据的形式(比如 prompt 和 response 怎么配对)、人工偏好标签怎么构造(比如 pairwise 还是 k-wise)、损失函数的设计(比如 Bradley-Terry 的公式),以及奖励信号在 RLHF 中怎么和 KL 惩罚结合。

同模块相关题目