从 RLHF 到 Agentic RL:重新理解 RL 的探索本质
之前提到"LLM 的强化学习",我脑子里几乎自动把它等同于 RLHF:让模型学会符合人类偏好、符合输出格式。最近在读 Agentic RL 方向的论文、并把 PPO/GRPO 从头复述一遍的过程中,这个理解被修正了。现在我会先问一个问题:这个 reward 到底编码了什么? ...
之前提到"LLM 的强化学习",我脑子里几乎自动把它等同于 RLHF:让模型学会符合人类偏好、符合输出格式。最近在读 Agentic RL 方向的论文、并把 PPO/GRPO 从头复述一遍的过程中,这个理解被修正了。现在我会先问一个问题:这个 reward 到底编码了什么? ...