Agentic RL 与强化学习
从 RLHF 到 Agentic RL:重新理解 RL 的探索本质
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
TOPICS
LATEST
Agentic RL 与强化学习
SFT 是拟合分布,RL 是奖励驱动下的行为探索;RLHF 为什么像 SFT,headroom 为什么决定 GRPO 能否生效。
开源实践
从终端 Markdown 显示异常出发,定位 DeepSeek-TUI 的解析与渲染问题,并完成第一次 Rust 开源贡献。
Agentic RL 与强化学习
从策略梯度、优势函数和 GAE 出发,推导 PPO 的概率比与 clipped objective,并说明它为何仍是 on-policy 算法。
PROJECTS
项目页会整理实验室工作、开源贡献与个人工具,保留背景、职责、证据和结果。