跳到正文

SFT、偏好优化与 RL 怎么衔接?

经典后训练流程、数据迭代、replay 和再次 SFT 的证据边界

原题:在大模型后训练中,经典流程通常如何衔接SFT与偏好优化或强化学习?在什么证据和条件下,团队会迭代更新数据、奖励模型或策略,并考虑replay、混合语言建模目标或再次SFT?

RLHF与对齐 · 网易真题

回答与解析

核心判断

经典后训练更常见的基线是先用示范做 SFT,再收集偏好训练奖励模型或直接做偏好优化,随后用 PPO 等方法更新策略。InstructGPT明确展示了 SFT、奖励模型、PPO 的顺序,并在 PPO 中混入预训练梯度以缓解公开任务回退。它不能证明 SFT 与 RL 必须周期性交替,也不能证明再次 SFT 会自动恢复预训练知识。是否迭代,要由新增失败样本、奖励漂移和独立评测决定。

机制与边界

SFT提供可读、可执行的初始行为,也让后续策略采样落在相对合理的区域。偏好学习再比较多个候选,优化帮助性、安全性或任务成功率。PPO类方法可利用当前策略新采样的回答,但也可能过度优化奖励代理并偏离参考分布。DPO等离线偏好方法不需要训练时 rollout,仍受数据覆盖影响。真实工程可以重采样回答、补偏好标签、重训奖励模型,再更新策略;这是一种迭代数据闭环,不应简化成每轮都执行 SFT、RL、SFT 的固定配方。

能力回退的处理也有多种。InstructGPT的 PPO-ptx把预训练语言建模梯度混入 PPO 目标,这是 replay 或多目标正则的一种,不是再做一遍 SFT。也可以使用 KL 约束、保留通用指令数据混合训练、设置能力回归集或冻结部分参数。再次 SFT 可能修复明确收集到的失败模式,也可能覆盖偏好优化出的行为,甚至引入新的遗忘,所以必须有配对消融。Llama 2 展示的是 SFT 后进行 RLHF 的流程和多轮数据迭代,不能据此宣称周期性交替是所有团队的标准。

工程验证

落地以一个稳定 SFT checkpoint 为锚,保留通用能力、安全和目标业务三套评测。每轮记录新增数据来源、标注策略、奖励模型版本、参考策略和采样分布。比较只更新奖励、继续偏好优化、混入语言建模目标、加入旧数据 replay、再次 SFT 等方案,统一看任务胜率、KL、拒答、事实性、通用能力和成本。若再次 SFT 只让训练损失下降却损害偏好胜率,就不应保留;若 RL reward 上升但独立评测下降,应回到奖励和数据,而不是机械开启下一轮。

每轮是否继续还要看标签边际价值。若新增偏好只是重复已有简单样本,重训奖励模型的收益可能很小;更应围绕高分歧、失败和安全边界采样,并保留旧分布防止遗忘。

口语版讲法(约4分钟(先30秒,再90秒,可继续展开))

  • 30秒:经典顺序而非固定交替
  • 90秒:SFT、偏好数据与在线采样职责
  • 边界:PPO-ptx不等于再次SFT
  • 验证:锚点、回归集与配对消融

如果只给我三十秒,我会这样回答:经典后训练更常见的基线是先用示范做 SFT,再收集偏好训练奖励模型或直接做偏好优化,随后用 PPO 等方法更新策略。InstructGPT明确展示了 SFT、奖励模型、PPO 的顺序,并在 PPO 中混入预训练梯度以缓解公开任务回退。它不能证明 SFT 与 RL 必须周期性交替,也不能证明再次 SFT 会自动恢复预训练知识。是否迭代,要由新增失败样本、奖励漂移和独立评测决定。

如果有九十秒,我会把机制讲清楚。SFT提供可读、可执行的初始行为,也让后续策略采样落在相对合理的区域。偏好学习再比较多个候选,优化帮助性、安全性或任务成功率。PPO类方法可利用当前策略新采样的回答,但也可能过度优化奖励代理并偏离参考分布。DPO等离线偏好方法不需要训练时 rollout,仍受数据覆盖影响。真实工程可以重采样回答、补偏好标签、重训奖励模型,再更新策略;这是一种迭代数据闭环,不应简化成每轮都执行 SFT、RL、SFT 的固定配方。

继续展开时,我会补上容易混淆的边界。能力回退的处理也有多种。InstructGPT的 PPO-ptx把预训练语言建模梯度混入 PPO 目标,这是 replay 或多目标正则的一种,不是再做一遍 SFT。也可以使用 KL 约束、保留通用指令数据混合训练、设置能力回归集或冻结部分参数。再次 SFT 可能修复明确收集到的失败模式,也可能覆盖偏好优化出的行为,甚至引入新的遗忘,所以必须有配对消融。Llama 2 展示的是 SFT 后进行 RLHF 的流程和多轮数据迭代,不能据此宣称周期性交替是所有团队的标准。

落地时我会这样验证。落地以一个稳定 SFT checkpoint 为锚,保留通用能力、安全和目标业务三套评测。每轮记录新增数据来源、标注策略、奖励模型版本、参考策略和采样分布。比较只更新奖励、继续偏好优化、混入语言建模目标、加入旧数据 replay、再次 SFT 等方案,统一看任务胜率、KL、拒答、事实性、通用能力和成本。若再次 SFT 只让训练损失下降却损害偏好胜率,就不应保留;若 RL reward 上升但独立评测下降,应回到奖励和数据,而不是机械开启下一轮。

每轮是否继续还要看标签边际价值。若新增偏好只是重复已有简单样本,重训奖励模型的收益可能很小;更应围绕高分歧、失败和安全边界采样,并保留旧分布防止遗忘。

关键一句:怎样判断能力回退来自策略漂移,还是评测与数据分布变化?

核验来源

  1. Training language models to follow instructions with human feedback
  2. Llama 2: Open Foundation and Fine-Tuned Chat Models
  3. Direct Preference Optimization: Your Language Model is Secretly a Reward Model

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设模型完成 SFT 与一轮偏好优化后,训练奖励上升,但通用能力回归集下降。你会依据什么证据决定补数据、重训奖励模型、继续偏好优化、混入语言建模目标、replay 或再次 SFT?

  2. 问法 2 · 层层追问

    经典后训练通常怎样衔接 SFT 与偏好优化?……什么现象说明奖励或数据需要更新?……混合预训练梯度与再次 SFT 有何区别?……为什么固定 SFT→RL→SFT 不能直接视为更优?……怎样做消融?

  3. 问法 3 · 直球技术

    解释后训练中 SFT、奖励/偏好数据和策略更新的关系,并给出证据驱动的迭代条件、备选干预与评测方案,而不是固定交替配方。

同模块相关题目