从策略梯度到 PPO:目标函数、GAE 与裁剪机制
PPO(Proximal Policy Optimization)常被概括为“用重要性采样复用数据,再把概率比截断”。这个说法只说对了一半:PPO 会在同一批新采样的数据上做有限次更新,但它仍然通常被归为 on-policy 策略梯度算法,并不支持像 DQN、SAC 那样长期从经验回放中任意取旧数据训练。 ...
PPO(Proximal Policy Optimization)常被概括为“用重要性采样复用数据,再把概率比截断”。这个说法只说对了一半:PPO 会在同一批新采样的数据上做有限次更新,但它仍然通常被归为 on-policy 策略梯度算法,并不支持像 DQN、SAC 那样长期从经验回放中任意取旧数据训练。 ...