PPO vs GRPO vs DPO 适用场景?
三种策略优化方法原理对比,RLHF 对齐场景适用性分析
原题:请解释PPO、GRPO和DPO这三种策略优化方法的基本原理,并比较它们在强化学习与大模型对齐训练中的异同与适用场景。
RLHF与对齐 · 快手真题
回答与解析
三者的核心分界
| 方法 | 数据/反馈 | 是否在线采样 | critic | 主要目标 |
|---|---|---|---|---|
| PPO | 轨迹与标量奖励,可来自环境、规则或奖励模型 | 通常是 | 通常需要价值函数 | clipped policy gradient,可另加对参考策略的KL控制 |
| GRPO | 同一问题的一组在线样本与奖励 | 是 | 不需要独立critic | 用组内相对奖励构造优势,再做受约束策略更新 |
| DPO | 离线chosen/rejected偏好对 | 否 | 不需要 | 提高chosen相对rejected的参考校正对数概率差 |
PPO和GRPO不是只能“从人类偏好学习”,奖励也可程序化验证。PPO是否有独立奖励模型、各角色是否共享骨干,取决于反馈来源和实现;固定“四模型”不是算法定义。
DPO利用Bradley-Terry式偏好模型和KL正则化RL目标的重参数化,把偏好优化写成分类式损失。它无需单独奖励模型和在线rollout,但仍依赖参考策略或预计算参考对数概率,并受 beta、偏好噪声、长度偏差和分布外问题影响。
GRPO由同一prompt采样一组答案,依据组内奖励相对值估计优势,省去critic;它仍需要规则或奖励模型给分。可验证数学/代码任务适合构造奖励,但“更稳定/更好”必须由任务实验确认。
选型时先问:反馈是偏好对还是可验证标量奖励,是否需要当前策略持续探索,能否承担rollout,以及怎样监控reward hacking、KL、长度和人工质量。不要按固定模型数量或“通用对话/推理”标签机械选择。
口语版讲法(约4分钟)
- 先按反馈与在线采样分类
- 解释PPO闭环
- 解释DPO重参数化
- 解释GRPO组相对优势
- 给出选型与监控指标
我不会把这三种方法统一说成从人类偏好学习,因为PPO和GRPO也可以用环境奖励、规则奖励或可验证结果。更清晰的比较轴是:训练时是否在线采样、奖励从哪里来、需不需要critic、是否依赖参考策略,以及输入数据是轨迹还是离线偏好对。
PPO通常让当前或旧策略在线生成轨迹,再根据标量奖励和价值函数估计优势。更新时用概率比和裁剪目标限制单次变化,大模型对齐里常再对参考策略加KL控制。奖励可以来自奖励模型,也可以来自环境或程序验证,所以独立奖励模型不是PPO算法定义。策略、参考、奖励和价值是逻辑角色,实现时可能共享骨干或缓存,不能背成固定四个模型。
DPO使用同一提示下的chosen和rejected。它从带KL正则的奖励最大化目标与Bradley-Terry式偏好模型出发,把隐式奖励写成策略相对参考策略的对数概率比,最后得到分类形式的损失。因此它不需要单独训练奖励模型,也不做在线rollout,工程链路更接近SFT。但仍要维护参考模型或预计算参考对数概率。
DPO也不是没有超参和稳定性问题。beta控制相对参考策略的偏离强度;偏好标注噪声、chosen和rejected长度差、参考模型选择、覆盖范围不足都会影响结果。它优化神经网络参数仍是非凸问题。离线偏好对没覆盖到的区域,也不会因为损失形式简单就自动学好。
GRPO和PPO一样通常需要在线生成。它对同一个问题采样一组回答,取得每个回答的奖励,再用组内相对值做优势估计,从而省去独立critic。这里的“无价值网络”不能误说成“无奖励”:数学或代码任务可以用答案、测试用例等规则奖励,也可以使用奖励模型。组大小、奖励方差和一组样本都相同分时的处理都会影响训练信号。
选型上,如果已经有高质量、覆盖目标分布的离线偏好对,又不需要在线探索,我优先DPO。如果有可信标量奖励并需要当前策略持续产生新轨迹,就考虑PPO或GRPO;是否用GRPO取决于组采样是否自然、critic成本和奖励可比较性,而不是看到推理任务就机械选择。
评测也要对应风险。PPO和GRPO同时看reward、KL、回复长度、熵、规则通过率和人工盲评,防止reward hacking;DPO按长度、任务类型和难度分桶看偏好胜率,并保留独立偏好集。最终结论是按反馈闭环选算法,而不是按“二模型、三模型、四模型”选算法。
关键一句:GRPO省掉critic,但仍然需要可区分组内样本的奖励。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设一个任务同时有离线 chosen/rejected 偏好对和可程序验证的在线奖励。你会在 DPO、GRPO 与 PPO 中怎样选型,并分别说明是否需要 rollout、critic 和显式奖励模型?
- 问法 2 · 层层追问
PPO 的奖励可以来自哪些来源?……GRPO 如何用同一 prompt 的成组样本构造优势,是否仍需奖励信号?……DPO 为什么不需要单独训练奖励模型?……三者各自主要受什么数据与系统约束?
- 问法 3 · 直球技术
从数据/反馈、在线采样、critic、奖励来源和优化目标五个维度比较 PPO、GRPO 与 DPO,并说明各自适用边界。