武宇新的笔记

从 RLHF 到 Agentic RL:重新理解 RL 的探索本质

之前提到"LLM 的强化学习",我脑子里几乎自动把它等同于 RLHF:让模型学会符合人类偏好、符合输出格式。最近在读 Agentic RL 方向的论文、并把 PPO/GRPO 从头复述一遍的过程中,这个理解被修正了。现在我会先问一个问题:这个 reward 到底编码了什么? ...

发布于 2026.08.03 · 5 分钟 · 2234 字 · 武宇新

从策略梯度到 PPO:目标函数、GAE 与裁剪机制

PPO(Proximal Policy Optimization)常被概括为“用重要性采样复用数据,再把概率比截断”。这个说法只说对了一半:PPO 会在同一批新采样的数据上做有限次更新,但它仍然通常被归为 on-policy 策略梯度算法,并不支持像 DQN、SAC 那样长期从经验回放中任意取旧数据训练。 ...

发布于 2026.05.04 · 更新于 2026.07.27 · 7 分钟 · 3286 字 · 武宇新