跳到正文

长视野任务的信用分配与 Option

从稀疏奖励与信用分配出发,说明分层强化学习、Option 与过程奖励的适用边界

原题:在处理长视野(Long Horizon)任务时,智能体常面临稀疏奖励和信用分配难题。请说明如何将此类任务与环境训练有效结合,列举并解释诸如分层强化学习、选项机制、过程奖励建模等关键技术手段。

RLHF与对齐 · 美团真题

回答与解析

核心判断

长视野任务的难点是终局奖励稀疏、策略探索空间大,且结果很难归因到早期动作。可把决策分层、引入时间扩展动作,并在确有可靠标签时增加过程反馈。HIRO让高层策略提出显式目标,低层策略执行并用 off-policy correction 处理低层变化;Option 本身包含启动集合、内部策略和终止条件,执行期间仍由内部策略逐步选择原子动作。

机制与边界

分层强化学习把长任务拆成不同时间尺度。HIRO中的高层输出目标,低层根据当前状态和目标产生动作。因为低层策略在训练中不断变化,旧轨迹对高层看到的“动作效果”会漂移,所以论文设计了离策略修正。这与“没有子目标空间”正好相反。Option 框架把一段闭环策略视为时间扩展动作,高层不必每个环境步都重选 option,但 option 的内部策略仍持续观察状态并选择动作,而且某些框架允许中断。它不是一段不再决策的固定宏命令。

过程奖励模型可以对中间步骤评分,增加比终局成败更密的监督,但监督来源要说清。OpenAI 的 PRM800K 使用了八十万个人工步骤级反馈标签,并非无需人工的蒙特卡洛自举。另一些方法会用可验证器、搜索统计或 rollout 估计步骤价值,这些是自动化近似,误差结构与人工标签不同。过程标签还可能奖励看起来合理的步骤,不能自动保证整条轨迹正确。对于部分可观测任务,还要用历史、循环状态或 belief state,避免把观测误当完整状态。

工程验证

评测时应按任务长度分桶,对比平坦策略、分层策略、带 option 的策略以及过程奖励版本。除终局成功率,还要记录样本效率、子目标可达率、option 使用时长、切换频率、离策略修正前后误差和步骤评分的校准度。过程监督需要保留人工或可执行验证器的盲测集,检查它是否偏爱冗长推理或表面格式。若加入层级后只让训练更快,却降低最终成功率,说明子目标或接口可能错了;若步骤分数升高但终局不变,则要审查过程标签是否真的携带因果信息。

层级方法还会引入新的失败点,例如高层目标不可达、低层只追逐局部奖励、option长期不终止。分层前后要用同一环境步预算比较,不能只看更漂亮的轨迹。

口语版讲法(约4分钟(先30秒,再90秒,可继续展开))

  • 30秒:分层、Option和过程监督三条路径
  • 90秒:讲清HIRO与Option机制
  • 边界:人工PRM不等于自动自举
  • 验证:长度分桶、子目标与步骤校准

如果只给我三十秒,我会这样回答:长视野任务的难点是终局奖励稀疏、策略探索空间大,且结果很难归因到早期动作。可把决策分层、引入时间扩展动作,并在确有可靠标签时增加过程反馈。HIRO让高层策略提出显式目标,低层策略执行并用 off-policy correction 处理低层变化;Option 本身包含启动集合、内部策略和终止条件,执行期间仍由内部策略逐步选择原子动作。

如果有九十秒,我会把机制讲清楚。分层强化学习把长任务拆成不同时间尺度。HIRO中的高层输出目标,低层根据当前状态和目标产生动作。因为低层策略在训练中不断变化,旧轨迹对高层看到的“动作效果”会漂移,所以论文设计了离策略修正。这与“没有子目标空间”正好相反。Option 框架把一段闭环策略视为时间扩展动作,高层不必每个环境步都重选 option,但 option 的内部策略仍持续观察状态并选择动作,而且某些框架允许中断。它不是一段不再决策的固定宏命令。

继续展开时,我会补上容易混淆的边界。过程奖励模型可以对中间步骤评分,增加比终局成败更密的监督,但监督来源要说清。OpenAI 的 PRM800K 使用了八十万个人工步骤级反馈标签,并非无需人工的蒙特卡洛自举。另一些方法会用可验证器、搜索统计或 rollout 估计步骤价值,这些是自动化近似,误差结构与人工标签不同。过程标签还可能奖励看起来合理的步骤,不能自动保证整条轨迹正确。对于部分可观测任务,还要用历史、循环状态或 belief state,避免把观测误当完整状态。

落地时我会这样验证。评测时应按任务长度分桶,对比平坦策略、分层策略、带 option 的策略以及过程奖励版本。除终局成功率,还要记录样本效率、子目标可达率、option 使用时长、切换频率、离策略修正前后误差和步骤评分的校准度。过程监督需要保留人工或可执行验证器的盲测集,检查它是否偏爱冗长推理或表面格式。若加入层级后只让训练更快,却降低最终成功率,说明子目标或接口可能错了;若步骤分数升高但终局不变,则要审查过程标签是否真的携带因果信息。

层级方法还会引入新的失败点,例如高层目标不可达、低层只追逐局部奖励、option长期不终止。分层前后要用同一环境步预算比较,不能只看更漂亮的轨迹。

关键一句:过程奖励分数提高时,怎样确认不是奖励了更像推理的表面形式?

核验来源

  1. Data-Efficient Hierarchical Reinforcement Learning
  2. Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforcement learning
  3. Let's Verify Step by Step

面试官还可能这样问

  1. 问法 1 · 场景切入

    假设现在训练一个需要经过多阶段交互才能完成任务的环境型 Agent,只有终局成败信号。你会怎样缩短探索路径,并把结果合理归因到早期决策?

  2. 问法 2 · 层层追问

    平坦策略为什么难学?……分层策略的高层目标与低层动作怎样衔接?……Option 包含哪些组成?……过程奖励来自人工标签、验证器或 rollout 时,各自有什么偏差?

  3. 问法 3 · 直球技术

    请针对环境交互中的长视野任务,比较分层强化学习、Option、过程奖励建模与历史状态建模,并说明它们缓解稀疏奖励和信用分配的能力边界。

同模块相关题目