[TOC] # 强化学习 ## 强化学习解决的是什么样的问题? - [ ] TODO ## 举出强化学习与有监督学习的异同点。有监督学习靠样本标签训练模型,强化学习靠的是什么? - [ ] TODO ## 强化学习的损失函数(loss function)是什么? - [ ] TODO ## 写贝尔曼方程(Bellman Equation) - [ ] TODO **参考资料** - [贝尔曼方程](https://blog.csdn.net/zbgzzz/article/details/80962645) ## 最优值函数和最优策略为什么等价? - [ ] TODO ## 求解马尔科夫决策过程都有哪些方法? - [ ] TODO ## 简述蒙特卡罗估计值函数的算法。 - [ ] TODO ## 简述时间差分算法 - [ ] TODO ## 介绍Q-Learning - [ ] TODO **参考资料** - [Q-Learning](http://mnemstudio.org/path-finding-q-learning-tutorial.htm) - [Q-learning算法](https://www.jianshu.com/p/eecb2230decf) - [【强化学习】Q-Learning算法详解](https://blog.csdn.net/qq_30615903/article/details/80739243) - [通过 Q-learning 深入理解强化学习](https://www.jiqizhixin.com/articles/2018-04-17-3) ## DQN 算法 ### 基本原理 **参考资料** - [【强化学习】Deep Q Network(DQN)算法详解](https://blog.csdn.net/qq_30615903/article/details/80744083) - [强化学习—DQN算法原理详解](https://wanjun0511.github.io/2017/11/05/DQN/) ### DQN的两个关键trick分别是什么? - [ ] TODO ### DQN 都有哪些变种?DQN有哪些改进方向? - [ ] TODO ### 引入状态奖励的是哪种DQN? - [ ] TODO - Double -DQN - 优先经验回放 - Dueling-DQN ### Dueling DQN和DQN有什么区别? - [ ] TODO ## 介绍OpenAI用的PPO算法 - [ ] TODO ## 介绍TRPO算法 - [ ] TODO ## 为什么TRPO能保证新策略的回报函数单调不减? - [ ] TODO ## 介绍DDPG算法 ## 画出DDPG框架 ## DDPG中的第二个D 为什么要确定? - [ ] TODO ## 介绍A3C算法 - [ ] TODO **参考资料** - [一文读懂 深度强化学习算法 A3C (Actor-Critic Algorithm)](https://www.cnblogs.com/wangxiaocvpr/p/8110120.html) - [深度强化学习——A3C](https://blog.csdn.net/u013236946/article/details/73195035/) ## A3C中优势函数意义 - [ ] TODO ## 强化学习如何用在推荐系统中? - [ ] TODO **参考资料** - [ ] [用强化学习研究推荐系统的前景和难度怎么样?](https://www.zhihu.com/question/328133447) - [ ] [深度强化学习如何和推荐系统结合起来?](https://www.zhihu.com/question/63037952) - [ ] [ICML 2019 | 强化学习用于推荐系统,蚂蚁金服提出生成对抗用户模型](https://zhuanlan.zhihu.com/p/68029391) - [ ] [最新!五大顶会2019必读的深度推荐系统与CTR预估相关的论文](https://zhuanlan.zhihu.com/p/69050253) ## 介绍Sarsa算法 - [ ] TODO **参考资料** - [AI学习笔记——Sarsa算法](https://www.jianshu.com/p/9bbe5aa3924b) ## Sarsa 和 Q-Learning区别 - [ ] TODO **参考资料** - [强化学习(五):Sarsa算法与Q-Learning算法](https://blog.csdn.net/liweibin1994/article/details/79119056) - [强化学习中的Q-learning算法和Sarsa算法的区别](https://blog.csdn.net/wshixinshouaaa/article/details/80832415) - [Bourne强化学习笔记2:彻底搞清楚什么是Q-learning与Sarsa](https://blog.csdn.net/linyijiong/article/details/81607691) ## 强化学习中有value-based 和 policy-based,这两种的优缺点分别是什么?应用场景分别是什么? - [ ] TODO ## value-based方法学习的目标是什么? - [ ] TODO ## 强化学习 DQN,DDQN,AC,DDPG 的区别 - [ ] TODO ## 参考资料 - [再励学习面试真题](https://zhuanlan.zhihu.com/p/33133828) - [强化学习面经](https://zhuanlan.zhihu.com/p/44285282)