武宇新的笔记

从策略梯度到 PPO:目标函数、GAE 与裁剪机制

PPO(Proximal Policy Optimization)常被概括为“用重要性采样复用数据,再把概率比截断”。这个说法只说对了一半:PPO 会在同一批新采样的数据上做有限次更新,但它仍然通常被归为 on-policy 策略梯度算法,并不支持像 DQN、SAC 那样长期从经验回放中任意取旧数据训练。 ...

发布于 2026.05.04 · 更新于 2026.07.27 · 7 分钟 · 3286 字 · 武宇新