一条连续的知识主线 从一次 CartPole 试错出发,逐步走向价值学习、策略优化与现代智能体。 |
公式与代码互相印证 PPO、DPO、GRPO 的关键推导紧邻实现,让每个张量都有明确含义。 |
用实验检验判断 真实训练曲线、消融结果和失败信号帮助读者理解算法何时有效。 |
连接经典 RL 与大模型 从策略梯度和 PPO 出发,自然推导 RLHF、DPO、GRPO 与 RLVR。 |
把智能体还原为序贯决策 把工具调用、浏览器操作和代码修复写成状态、动作、轨迹与信用分配问题。 |
从现象进入理论 CartPole、LunarLander、Atari 与大模型实验先提出问题,再引出所需数学工具。 |
## 引用
如果您在教学材料、学习笔记或衍生非商业教育作品中使用本课程,请引用本仓库:
```bibtex
@misc{hands_on_modern_rl,
title = {Hands-On Modern RL: Practice-first reinforcement learning from CartPole to LLM post-training and agentic systems},
author = {WalkingLabs},
year = {2026},
howpublished = {\url{https://github.com/walkinglabs/hands-on-modern-rl}},
note = {Open courseware repository}
}
```
## 致谢
感谢 [OpenAI](https://openai.com/) 提供的开发资源支持,以及 [AMD](https://www.amd.com/) 提供的算力支持。没有他们的支持,本教程不可能迭代得如此之快。
## 开源协议
本课程资料在 [Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License](LICENSE) 下发布。
您可以出于非商业目的共享和修改本材料,前提是必须给出适当的署名,并且衍生作品也必须在相同的协议下分发。
---