跳到正文

On-policy、Off-policy 与 DPO 怎么选?

比较样本复用、分布校正与在线 rollout,并区分 DPO 离线偏好优化

原题:在大模型对齐中,PPO 等 on-policy/近 on-policy 方法与 off-policy 强化学习或离线偏好优化各有什么取舍?请从样本复用、分布校正、训练稳定性和更新频率进行比较,并说明为什么不存在脱离数据、奖励与计算条件的“on-policy 必然主流”结论。

RLHF与对齐 · 网易真题

回答与解析

On-policy、off-policy 与偏好优化要分开比较

On-policy 方法用当前或近当前策略生成的数据估计更新,策略变化后旧数据会逐渐失配。PPO 并非每条样本只更新一次:原论文的裁剪代理目标允许对同一批 rollout 做多个 epoch 的 minibatch 更新,但批次不能无限复用。PPO 的 clip 限制重要性比率变化;在 RLHF 中还常额外加入相对参考模型的 KL 惩罚或控制器,但 KL 不是所有 PPO 定义中自动存在的固定组件。

Off-policy 方法允许行为策略与目标策略不同,可用 replay buffer 或历史轨迹提高环境交互样本效率,却要处理分布偏移、重要性校正或价值估计偏差。样本效率、稳定性和更新频率不能脱离算法、奖励与实现给绝对排名。LLM 的生成 rollout 很贵,但奖励模型分布外误差、长序列比率方差和训练系统复杂度也影响选择。

DPO 不应简单叫作 PPO 的普通 off-policy 变体。它在离线偏好对上,用策略与 reference policy 的对数概率差和 beta 构造分类式目标,不需要显式训练奖励模型或在线从当前策略采样。DPO 论文报告其稳定且实现简单,不能笼统断言比 PPO 不稳定。当前对齐实践同时存在离线 SFT/DPO 与在线 PPO、GRPO、GSPO 等路线,因此“主流必然倾向 on-policy”需要按数据、是否可验证奖励、计算预算和分布更新速度具体判断。

口语版讲法(30秒速答 + 90秒主答 + 完整展开)

  • 从行为策略与目标策略关系定义术语
  • 说明 PPO 的有限批次复用和裁剪
  • 解释 off-policy 的复用收益与偏差
  • 把 DPO 从普通 off-policy RL 中分开
  • 按奖励数据与预算给出选择条件

【30秒速答】 On-policy 使用当前或近当前策略的 rollout,分布匹配较直接,但策略更新后旧数据很快过时。PPO 不是样本只用一次,它会对一批 rollout 做多个 epoch 的 minibatch 更新,并用重要性比率裁剪限制步长。RLHF 常叠加参考策略 KL,但这不是所有 PPO 都自动带的固定项。Off-policy 可复用历史数据,环境样本效率更高,却要处理行为策略与目标策略的分布偏移。DPO 是基于离线偏好对和 reference policy 的直接优化,不应简单叫普通 off-policy PPO 变体,也不能笼统说它比 PPO 不稳定。

【90秒主答】 比较时先区分数据从哪里来。On-policy rollout 由当前策略生成,策略和数据分布接近,优势估计与更新目标更一致;代价是生成新数据和奖励评估昂贵。PPO 通过 clipped surrogate objective 控制新旧策略概率比,并允许同一批数据做若干 epoch 的 minibatch 优化,所以它是有限复用,不是更新一次就丢,也不是 replay buffer 式长期复用。对语言模型,常把终局奖励、价值估计和相对 SFT reference 的 per-token KL 组合,但 KL 系数、控制方式和是否放进 reward 都是实现选择。Off-policy 算法可用旧策略或其他行为策略数据,多次更新能提高环境交互效率;若目标策略变化很大,重要性权重方差、Q 值外推和奖励模型分布外误差会破坏稳定性。更新频率也由 rollout、batch、优化步数和硬件流水线共同决定。

【完整展开】 DPO 的位置要单独讲。它从偏好对中比较 chosen 与 rejected,在策略和 reference policy 的对数概率差上施加由 beta 控制的目标,不显式训练独立奖励模型,也不在每轮优化时在线采样当前策略。它可以利用固定数据集,系统更简单;效果仍依赖偏好覆盖、标签噪声、reference、beta 和评测。原论文把稳定和轻量作为优点,因此没有证据给出“DPO 天生不如 PPO 稳定”的通用结论。PPO 的优势是能持续探索当前策略产生的新行为,并接收可验证或在线奖励,但成本、reward hacking 和训练波动都更高。

选择时看任务是否有可靠自动奖励、是否需要超出离线数据探索、偏好数据是否覆盖目标分布、采样成本和团队系统能力。静态偏好数据和行为对齐可先用 SFT 或 DPO;数学、代码等可执行奖励且需要探索的任务可考虑在线策略优化;风险高的通用对话要同时监控 KL、奖励、长度、熵和独立质量评测。所谓“当前主流”会随模型和工具变化,可靠回答应给出算法条件与实验设计,而不是把 on-policy 等同稳定、off-policy 等同危险。

关键一句:PPO 是有限 rollout 复用,DPO 是带 reference policy 的离线偏好目标,两者不能用一个 on/off-policy 标签概括。

核验来源

  1. Proximal Policy Optimization Algorithms
  2. Direct Preference Optimization: Your Language Model is Secretly a Reward Model
  3. Training language models to follow instructions with human feedback

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设一个对齐任务同时拥有离线偏好对和可在线验证的任务奖励,但 rollout 成本较高。你会如何在 DPO 类离线优化与 PPO/GRPO 类在线更新之间选择或分阶段组合?

  2. 问法 2 · 层层追问

    on-policy 与 off-policy 的数据来自哪里?……历史轨迹复用提高了什么,又引入哪些分布偏移?……PPO 一批 rollout 能否多 epoch 更新?……哪些条件下离线偏好优化更合适,哪些条件下需要当前策略探索?

  3. 问法 3 · 直球技术

    比较 on-policy 与 off-policy 在样本复用、偏差、稳定性、更新频率和系统成本上的取舍,并说明大模型对齐中不存在脱离条件的单一主流选择。

同模块相关题目