🚧 本节建设中
根据 v5.1 完整大纲,本章节正在按规划逐步补全。
当前进展
本书正在按 v5.1 大纲从 16 章扩展到 38 章。新章节按以下优先级推进:
- P0(已发布):第 19/20/21/26/32/33/37 章等核心前沿内容
- P0(建设中):Part I 经典 RL 基础(第 3/5/6/7 章)、Part II 第 10 章、Part IV 第 22/23 章
- P1(规划中):Part III 高级 RL、Part V 第 26 章、Part VI 第 28 章、Part VII 第 34/35/36 章
如何贡献
如果你想加速本章节的写作:
- 在 GitHub 上 open 一个 issue,标注你最关心的章节
- 或直接提交 PR,参考
CLAUDE.md的写作风格指南
推荐阅读路径
在等待本章节完成期间,可先阅读:
- 理论前置:本书已发布的 MDP 与价值函数、Q-Learning 等基础章节
- 应用方向:GRPO 家族、Reasoning Models 等大模型 RL 章节
- 配套资源:Sutton & Barto《Reinforcement Learning》、CS285 Berkeley
最后更新:2026-06-19