从 RLHF 到 Agentic RL:重新理解 RL 的探索本质
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
COLLECTION
公开发布的技术文章、学习系列与随笔。
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
从假期里的无聊与焦虑出发,思考如何通过输出、创造和写作重新获得与世界的联结。
从终端 Markdown 显示异常出发,定位 DeepSeek-TUI 的解析与渲染问题,并完成第一次 Rust 开源贡献。
从策略梯度、优势函数和 GAE 出发,推导 PPO 的概率比与 clipped objective,并说明它为何仍是 on-policy 算法。