Reward 函数设计关键因素?
RLHF 中奖励稀疏性、信号延迟与多目标平衡怎么处理
原题:在基于强化学习的大模型训练(如RLHF)中,设计Reward函数时应综合考虑哪些关键因素,例如奖励稀疏性、信号延迟、多目标平衡以及人类偏好建模等?
RLHF与对齐 · 美团真题
回答与解析
奖励设计先分清四类信号
- ORM(Outcome Reward Model):对完整输出或终局结果评分。
- PRM(Process Reward Model):对中间步骤给出过程监督。
- Value model:估计给定状态后未来累计回报的期望。
- 搜索:MCTS 等方法使用策略、价值或环境模型选择分支;搜索本身不会自动把稀疏奖励变成稠密奖励。
关键设计维度
- 可验证性:能用单元测试、规则或环境结果验证时,优先使用可验证奖励;主观质量再用人工偏好模型补充。
- 稀疏与延迟:终局奖励可配合 PRM、价值估计、n-step/GAE 或搜索,但过程奖励必须防止代理目标被利用。
- 多目标:正确性、安全、帮助性、格式和成本应分别监控,再用有业务含义的权重、约束或分层策略组合,不能只压成一个不可解释总分。
- 偏好异质性:基础 Bradley-Terry 模型假设共享标量效用;不同人群偏好不一致时,要把 annotator、用户群或上下文纳入条件模型,或分层建模。
- 稳健性:留出人工评测集,监控 reward hacking、长度偏差、风格捷径、分布漂移和奖励模型不确定性。
Constitutional AI 不是用规则替代学习,而是用一组原则指导生成批评、修订和偏好监督,模型仍通过监督学习或偏好优化更新。
口语版讲法(约3分钟)
- 先区分结果、过程、价值和搜索
- 处理稀疏延迟与多目标奖励
- 显式建模人群偏好差异
- 用独立评测防奖励投机
我会先把几个经常混在一起的概念拆开。ORM 是给完整回答或终局结果打分,PRM 是评价中间推理步骤,value model 估计从当前状态出发的未来累计回报,而 MCTS 是利用策略、价值或环境模型做搜索。ORM 不是中间状态价值,MCTS 也不会凭空把一个稀疏终局奖励变成可靠的过程奖励。
设计奖励时,第一步是判断反馈能不能被验证。代码、数学或工具调用有单元测试和环境结果,我会优先用可验证奖励;帮助性、表达和安全等主观目标,再用人工偏好补充。对于长延迟任务,可以引入过程监督、价值估计、n-step 或 GAE,也可以在有模型的情况下做搜索。但过程奖励不是越密越好,若它只奖励格式完整或步骤数量,模型就可能学会刷分而不解决问题。
第二步是处理多目标。我不会一开始就把正确性、安全、格式、延迟和成本压成一个总分,然后只盯着总分上涨。更稳妥的做法是先分指标监控:硬安全边界用约束或过滤,正确性用可验证信号,主观质量用偏好模型,成本单独看。确实需要加权时,要记录各分量、权重和敏感性,确认优化一个目标没有牺牲另一个目标。
第三步是人类偏好。基础 Bradley-Terry 模型假设大家共享同一套标量效用,但真实用户可能在简洁、语气和风险容忍上不同。若这种差异影响产品,我会把标注者、用户群或上下文作为条件,或者分群训练和评估,而不是指望一个全局分数自动解决异质性。Constitutional AI 也不是用规则替代学习,它用原则指导批评、修订和偏好数据生成,后面仍要做监督或偏好优化。
最后一定要有独立的人评留出集,并检查长度偏差、模板捷径、拒答率和分布外样本。如果奖励上涨但真实任务成功率或人工胜率下降,我会把它当作 reward hacking,立即停止或回滚。奖励函数的价值不在于公式复杂,而在于它是否与真实目标一致、是否能被独立验证。
我还会把奖励系统当成一个会漂移的模型来维护。每次更新规则、奖励模型或采样策略,都保存版本,并在同一批人工留出样本上重跑。若分数上涨主要来自回答变长、套固定格式或更频繁拒答,就说明代理指标被钻了空子。此时不能只调一个惩罚系数,而要回到失败样本,判断是标注规范、奖励特征还是策略探索出了问题。
在线阶段则把任务成功、人工抽检和奖励分数并排看,并给高风险场景设置硬约束。奖励模型可以帮助扩大反馈规模,但不能自己证明自己。只有外部验证器、真实环境结果或独立人评也同步改善,才说明优化方向可信。这套闭环比追求一个看起来漂亮的总 reward 更重要。
关键一句:偏好异质性不能被单一全局奖励自动吸收,需要条件化建模并分群评测。
核验来源
面试官还可能这样问
- 问法 1 · 场景切入
假设你在做一个电商客服模型,用户问了一堆问题,模型最终给了一个长回答。你既希望回答有用,又希望安全、简洁,可能还有字数限制。这些目标有时候互相打架,你怎么设计奖励函数来平衡它们?
- 问法 2 · 层层追问
RLHF训练时,你是怎么设计reward信号的?……如果模型生成一个很长的回答,只有最后才给奖励,中间步骤没有反馈,这会导致什么问题?……那你怎么解决这种奖励稀疏和延迟的问题?
- 问法 3 · 直球架构
在强化学习训练大模型时,设计reward函数需要综合考虑哪些因素?比如奖励稀疏性、信号延迟、多目标平衡、人类偏好建模这些,你会怎么具体处理?