势能奖励塑形
Potential-Based Reward Shaping:用势函数差分给每一步稠密反馈,在理论保证不改变最优策略的前提下加速学习;GridWorld 教程中取
+0.01 * (old_distance - new_distance)。
简介
稀疏奖励(只在到终点或失败时给分)让智能体长期得不到学习信号,探索成本高。奖励塑形通过添加中间奖励加速训练,但任意塑形可能改变最优策略(agent 学会「刷中间分」而不完成任务)。
势能奖励塑形(Potential-Based Reward Shaping, PBRS) 是一类有理论保证的塑形:若附加奖励来自势函数 (F(s,s’)=\gamma\Phi(s’)-\Phi(s))(或无折扣变体),则最优策略集合保持不变。实践中常用「到目标距离变小给正、变大给负」作为 (\Phi) 的代理。
在 GridWorld悬崖行走 教程中,势塑形系数为 0.01,远小于事件奖励(+5 / -5)与撞墙惩罚(-2.5),确保塑形只「指路」不「夺权」。
关键信息
- 类型:概念 / 技术
- 领域:强化学习 · 奖励工程
- 官方网站/地址:经典文献如 Ng et al. 关于 potential-based shaping 的工作
- 定价/开源状态:方法论,实现于具体 env 的
step - 相关概念:PPO、Gymnasium、GridWorld悬崖行走
核心特性
概念类必填项
- 定义:将额外奖励定义为状态势函数的差分,使策略最优性在塑形前后一致(在相应假设下)
- 核心组成:
- 势函数 (\Phi(s))(如负距离、启发式)
- 差分形式 (F=\Phi(s’)-\Phi(s)) 或带 (\gamma) 形式
- 与稀疏任务奖励 (R) 相加:(R’=R+F)
- 系数缩放,避免 (F) 主导 (R)
- 典型应用:导航到目标、迷宫、机械臂到达位姿、任何可定义进度度量的任务
- 常见误区:
- 系数过大 → agent 在局部势谷刷分或忽略危险(悬崖)
- 势函数与真实目标不一致 → 「理论保最优」前提被破坏
- 只塑形不设时间惩罚 → 仍可能磨蹭(教程另加每步 -0.1)
教程中的具体设计
| 信号 | 数值 | 角色 |
|---|---|---|
| 每步基础 | -0.1 | 时间惩罚,鼓励短路径 |
| 势能塑形 | +0.01×Δ距离缩短 | 稠密进度 |
| 到目标 | +5.0 | 主成功信号 |
| 悬崖 | -5.0 | 主失败信号 |
| 撞墙 | -2.5 | 硬约束失败 |
| 超时 | -1.0 | 效率过低 |
完美约 8 步回合:(8\times(-0.1)+) 距离塑形约 (+0.4+5.0\approx 4.6),与训练后 mean≈4.38 对照。
不同素材中的观点
- 2026-07-19-juejin-gridworld-cliff-ppo:把势能塑形列为自定义环境「黄金实践」之一——在不改变最优策略前提下提供稠密信号、加速收敛;明确写出公式与 0.01 系数选择理由;并与 Dict 观测、boundary_flag、事件惩罚组成完整奖励工程,而不是单靠 PPO 调参硬扛稀疏奖励。
实用信息
- 相关资源:在
step中记录old_distance,合法移动后计算new_distance,累加coef * (old - new)(欧氏距离用于网格亦可作启发式) - 注意事项:
- 先保证任务奖励语义正确,再加塑形
- 用理论满分锚点验证收敛是否合理
- 动态目标/动态悬崖时势函数需随目标更新