稀疏与延迟奖励的塑形与权衡
比较终局与过程信号、Potential-based Shaping 和多目标约束
原题:在构建强化学习系统的奖励机制时,需要综合考虑多个关键因素。请系统性地阐述设计奖励函数时应关注的主要因素,例如稀疏性、延迟性、奖励塑形、多目标权衡等,并说明它们对训练过程的影响。
RLHF与对齐 · 美团真题
回答与解析
奖励设计从目标、时间尺度和可被钻空子的边界出发
稀疏终局奖励直接对应任务成功,但探索与信用分配困难;密集过程奖励提供学习信号,却可能把代理行为变成目标。Potential-based shaping 在相应马尔可夫假设和形式 F(s,a,s')=gamma*Phi(s')-Phi(s) 下具有策略不变性结论,任意人工加分没有这个保证。HER 通过重标目标利用失败轨迹,主要适用于 goal-conditioned、可重新定义 achieved goal 的 off-policy RL,不是所有长序列或 RLHF 的通用解法。
延迟奖励要区分信号来源。典型 RLHF 奖励模型对完整 prompt-response 给一个序列级标量,训练中再叠加逐 token KL,并由 value function、return 或 GAE 把终局信号用于各时间步更新;这不等于奖励模型把偏好自动蒸馏成每步即时正确奖励。若有可验证中间状态,可以设计过程奖励,但需单独标注或校验其因果有效性。
多目标可用归一化加权、约束优化、词典序优先级或 Pareto 分析。安全、权限和预算常适合硬约束,而有用性、简洁度可作为软目标。最终要在独立任务和对抗样本上检查 reward hacking、长度偏好、代理目标偏移、过度优化与分布外行为,并监控真实任务成功而不只看训练 reward。
口语版讲法(30秒速答 + 90秒主答 + 完整展开)
- 把奖励视为真实目标的代理
- 权衡稀疏、密集和塑形信号
- 解释延迟奖励与信用分配
- 限定 HER 和 RLHF 奖励边界
- 用约束与对抗评测防止钻空子
【30秒速答】 奖励函数是任务目标的代理。稀疏终局奖励更贴近成功定义,但探索和信用分配难;密集奖励学得快,却容易让策略刷过程分。Potential-based shaping 只有满足特定形式时才有策略不变性保证。HER 主要用于 goal-conditioned 的 off-policy RL,通过重标目标复用失败轨迹,不是通用答案。典型 RLHF 奖励模型对完整回复给序列级分数,逐 token KL、价值估计和 GAE 再参与更新,不能说奖励模型直接产生每步即时偏好。多目标要配约束和独立评测。
【90秒主答】 设计从真实成功条件开始,列出不可违反的安全、权限和预算边界,再决定哪些信号可观测。只有任务完成才给分,目标清楚但正样本少;给每一步奖励能提高学习密度,却可能把“多调用工具”“回复更长”学成捷径。若使用 shaping,要验证它是否改变最优策略。经典 potential-based 形式利用相邻状态势函数差,在相应条件下保持策略不变;随意给某个动作加分没有这个保证。长时延问题可用 return、TD、value function 或 GAE 做信用分配,但这些方法仍是在估计哪些动作与未来回报相关,并不会自动证明因果。对 RLHF,奖励模型通常比较完整回复并输出标量,策略优化还会加入 reference KL;若希望评价中间推理步骤,需要过程监督、环境检查或可执行验证。
【完整展开】 HER 适合有明确 desired goal 和 achieved goal 的任务。一次抓取没有到原目标位置,可以把实际到达位置重标为目标,从失败轨迹学习;开放式对话没有可重标的目标结构时,硬套 HER 没有依据。多目标场景先统一尺度并检查冲突。安全和权限可写成不可越过的约束,任务成功、效率和表达质量再用权重或词典序组合;若权重变化会得到不同合理策略,可报告 Pareto 前沿而不是宣称一个万能权重。
验证时制作正常、边界和对抗任务,观察训练 reward 与真实成功是否分离。典型风险包括利用模拟器漏洞、重复容易动作、延长答案、迎合奖励模型和牺牲少数高风险样本换平均分。监控奖励各分量、KL、长度、熵、成功率、约束违例与分布外切片,并做奖励消融。若优化后的策略 reward 上升而独立评审、执行结果或安全指标下降,应回到奖励定义和数据,而不是继续调大学习率。好的奖励设计不追求信号越多越好,而是每个分量都有可验证含义、明确时间尺度和不能被轻易利用的边界。
关键一句:RLHF 的序列级奖励、逐 token KL、价值估计和过程奖励是不同组件,不能混成即时奖励。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设现在训练一个对话 Agent,只有任务最终完成时才得到反馈。你会怎样增加可学习信号,同时避免中间奖励把策略带向错误目标?
- 问法 2 · 层层追问
终局奖励为什么难做信用分配?……奖励塑形有哪些做法?……什么条件下潜势函数能保持最优策略?……怎样用独立成功率发现 reward hacking?
- 问法 3 · 直球技术
请系统说明强化学习奖励设计中的稀疏性、延迟、多目标、奖励塑形、硬约束与抗投机验证,并给出从训练日志到独立评测的闭环。