势能奖励塑形

Potential-Based Reward Shaping:用势函数差分给每一步稠密反馈,在理论保证不改变最优策略的前提下加速学习;GridWorld 教程中取 +0.01 * (old_distance - new_distance)

简介

稀疏奖励(只在到终点或失败时给分)让智能体长期得不到学习信号,探索成本高。奖励塑形通过添加中间奖励加速训练,但任意塑形可能改变最优策略(agent 学会「刷中间分」而不完成任务)。

势能奖励塑形(Potential-Based Reward Shaping, PBRS) 是一类有理论保证的塑形:若附加奖励来自势函数 (F(s,s’)=\gamma\Phi(s’)-\Phi(s))(或无折扣变体),则最优策略集合保持不变。实践中常用「到目标距离变小给正、变大给负」作为 (\Phi) 的代理。

GridWorld悬崖行走 教程中,势塑形系数为 0.01,远小于事件奖励(+5 / -5)与撞墙惩罚(-2.5),确保塑形只「指路」不「夺权」。

关键信息

  • 类型:概念 / 技术
  • 领域:强化学习 · 奖励工程
  • 官方网站/地址:经典文献如 Ng et al. 关于 potential-based shaping 的工作
  • 定价/开源状态:方法论,实现于具体 env 的 step
  • 相关概念PPOGymnasiumGridWorld悬崖行走

核心特性

概念类必填项

  • 定义:将额外奖励定义为状态势函数的差分,使策略最优性在塑形前后一致(在相应假设下)
  • 核心组成
    1. 势函数 (\Phi(s))(如负距离、启发式)
    2. 差分形式 (F=\Phi(s’)-\Phi(s)) 或带 (\gamma) 形式
    3. 与稀疏任务奖励 (R) 相加:(R’=R+F)
    4. 系数缩放,避免 (F) 主导 (R)
  • 典型应用:导航到目标、迷宫、机械臂到达位姿、任何可定义进度度量的任务
  • 常见误区
    • 系数过大 → agent 在局部势谷刷分或忽略危险(悬崖)
    • 势函数与真实目标不一致 → 「理论保最优」前提被破坏
    • 只塑形不设时间惩罚 → 仍可能磨蹭(教程另加每步 -0.1)

教程中的具体设计

信号数值角色
每步基础-0.1时间惩罚,鼓励短路径
势能塑形+0.01×Δ距离缩短稠密进度
到目标+5.0主成功信号
悬崖-5.0主失败信号
撞墙-2.5硬约束失败
超时-1.0效率过低

完美约 8 步回合:(8\times(-0.1)+) 距离塑形约 (+0.4+5.0\approx 4.6),与训练后 mean≈4.38 对照。

不同素材中的观点

  • 2026-07-19-juejin-gridworld-cliff-ppo:把势能塑形列为自定义环境「黄金实践」之一——在不改变最优策略前提下提供稠密信号、加速收敛;明确写出公式与 0.01 系数选择理由;并与 Dict 观测、boundary_flag、事件惩罚组成完整奖励工程,而不是单靠 PPO 调参硬扛稀疏奖励。

实用信息

  • 相关资源:在 step 中记录 old_distance,合法移动后计算 new_distance,累加 coef * (old - new)(欧氏距离用于网格亦可作启发式)
  • 注意事项
    • 先保证任务奖励语义正确,再加塑形
    • 用理论满分锚点验证收敛是否合理
    • 动态目标/动态悬崖时势函数需随目标更新

相关页面