GSPO 序列级比率与裁剪
同 prompt 组内优势、长度归一化 ratio 与 sequence-level clipping
原题:GSPO(Group Sequence Policy Optimization)在大模型强化学习中解决什么问题?请说明同一 prompt 的组内采样、相对 advantage、长度归一化的序列级 importance ratio 与 sequence-level clipping,并比较其与 GRPO 的优化粒度、训练稳定性和适用边界。
RLHF与对齐 · 美团真题
回答与解析
先说准全称与定位
GSPO 的全称是 Group Sequence Policy Optimization。有些旧资料会误写为 Generalized Supervised Policy Optimization,但两者不能混用。GSPO 是面向大模型强化学习的组内相对优化方法,不是“监督锚点 + 纯离线 RL”框架。
核心思想
对同一 prompt 采样一组序列,用组内奖励构造相对 advantage。与 GRPO 常用逐 token importance ratio 不同,GSPO 对整条序列计算长度归一化的似然比,例如:
s_i(theta)=exp((1/|y_i|) * sum_t log(pi_theta(y_it|x,y_i,<t)/pi_old(y_it|x,y_i,<t)))
再在 sequence level 做 clipping,并用同一序列权重更新该序列 token。这样让采样、奖励和优化单元更一致,减少长序列中少数 token ratio 极端值对更新的放大。论文重点之一是提升训练稳定性,并服务于 MoE 模型的 RL 训练。
与 GRPO 的关系和边界
二者都可对同一问题的多条回答做组内相对基线,通常不需要独立 value critic;奖励可以来自规则、验证器或奖励模型,并不必然来自人类偏好。GSPO 仍需要在线/近在线 rollout、旧策略概率、奖励、KL/clip 等训练控制,也会受组大小、奖励噪声、序列长度和策略陈旧度影响。
不能把 GSPO 与 DPO、监督微调或某公司调度案例混写。选型应在相同 rollout、奖励和模型上比较训练稳定性、KL、clip fraction、奖励、人评/验证器质量与吞吐。
口语版讲法(约3分钟)
- 先说准 GSPO 的全称和定位
- 解释组内相对优势
- 比较 sequence-level 与 token-level ratio
- 说明稳定性收益和使用边界
先把 GSPO 的全称和定位说准。GSPO 是 Group Sequence Policy Optimization;有些旧资料会误写为 Generalized Supervised Policy Optimization。它不是把监督学习和纯离线强化学习拼起来,而是面向大语言模型 rollout 的组内相对策略优化方法。
训练时,对同一个 prompt 从旧策略采样一组完整回答,用规则验证器或奖励模型给每条回答打分,再用组内统计构造相对 advantage。这个思路和 GRPO 有共同点:都可以不训练独立 value critic,用同组样本提供 baseline。奖励也不一定来自人类偏好,数学、代码等任务可以使用可验证规则。
关键区别在重要性比率的粒度。GRPO 的常见实现对每个 token 计算新旧策略概率比并裁剪。长序列中,只要少数 token 的 ratio 很极端,就可能让更新不稳定。GSPO 把一条序列内的新旧 log probability ratio 求平均,再指数化,得到长度归一化的 sequence-level ratio;随后在序列层做 clipping,并用同一个序列权重更新这条回答的 token。这样采样单元、奖励单元和优化权重都落在完整序列上。
它的意义不是“没有超参数”或“天然更优”,而是减少 token-level ratio 与 sequence-level reward 不一致带来的方差和极端更新。论文还强调它在 MoE 强化学习训练中的稳定性。但 GSPO 仍要 rollout、保存旧策略概率、计算奖励,并处理 KL、clip range、组大小、奖励噪声和策略陈旧度。序列级权重也可能掩盖局部坏 token,所以最终质量仍需验证。
做对比实验时,我会固定模型、prompt、组大小和奖励,观察训练 reward、真实验证器通过率、KL、clip fraction、梯度异常、长度分布和吞吐。若是 MoE,还要看路由负载和训练是否发散。DPO 使用离线偏好对,SFT 使用监督目标,它们和 GSPO 的数据闭环不同,不应该混写成同一算法。
实现时我会对 sequence ratio 做两个检查。新旧策略完全相同时,ratio 应接近一;只修改少数 token 的 log probability 时,长度归一化后的序列权重应按预期变化,而不是随序列长度无界放大。padding token、截断位置和 response mask 也必须排除,否则平均 log ratio 会被无效位置污染。
组内 advantage 还依赖同一 prompt 下奖励的相对差异。如果一组回答全同分,更新信号会很弱;如果奖励器被格式或长度主导,序列级优化仍会学到捷径。因此训练日志除了平均 reward,还要保留组内方差、有效样本比例和真实验证器通过率。只有稳定性与任务质量一起提升,才说明从 token 粒度改到序列粒度确实有价值。
如果 rollout 策略与当前策略相隔太久,importance ratio 会持续偏离一,裁剪样本增多,即使序列级算法也难以修复。工程上要监控策略版本差、clip fraction 和采样吞吐,在新鲜度与设备利用率之间做取舍,而不是只增加并行 rollout。
关键一句:序列级权重提升全局一致性,但细粒度步骤信用仍需额外 advantage 设计或 GSPO-token。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设一个 MoE 策略在可验证奖励任务中对每个 prompt 采样多条响应,训练时 token 级比率波动明显。你会怎样引入 GSPO,并用哪些指标判断序列级裁剪是否改善稳定性?
- 问法 2 · 层层追问
GSPO 的 Group Sequence 指什么?……组内奖励如何形成相对优势?……序列级似然比与 token 级比率有何区别?……clip、KL、组大小和序列长度会怎样影响更新?
- 问法 3 · 直球技术
说明 Group Sequence Policy Optimization 的目标与实现,重点解释序列级 importance sampling、clipping、奖励和优化单元,并比较 GRPO 与 PPO。