课程内容:
- Introduction
- Markov Decision Process
- Planning by Dynamic Programming
- Model Free Prediction
- Model Free Control
- Value Function Approximation
- Advanced DQN
- Policy Gradient
- A3C & PPO
- DDPG & soft AC
- Optimal Control and Planning
- Model-Based Reinforcement Learning
- Variational Inference
- A Tutorial on Generative Models
好家伙,这一串课程目录从Introduction一路排到生成模型 tutorial,排面跟火锅店菜单一样,从锅底到甜品一条龙,生怕你吃完跑单。
考核方式:
Homework(50%) + Project(50%)
No Exam!!
看到"No Exam!!"两个感叹号没,这玩意儿就是选课界的免死金牌、平时分的直升机停机坪,期末考试直接被抬走,剩下的就看你作业和Project能不能扛住了。
授课质量:
没有去听过课, 所以很难评价授课质量, 不过听去上课的同学说, 质量还是比较高的, 讲的比较透彻.
我本人是没去听过课的,属于云旁听选手,所以让我评价授课质量我就跟盲盒鉴定师一样心虚;但据说去上课的同学反馈质量还是比较高的,讲得比较透彻——嗯,口碑这块属于是别人替我把草种了。
一共五次平时作业一次Project,没有期末考试
五次作业加一次Project,期末考试直接去世,听起来像送分题是吧,别急,后面的环境名字看完你就笑不出来了。
- HW1: 算法: iterative policy evaluation, policy iteration and value iteration 环境: GridWorld
- HW2: 算法: Monte-Carlo(MC) Learning and Temporal-Difference(TD) Learning 环境: GridWorld
- HW3 算法: Sarsa and Q-Learning 环境: GridWorld
- HW4 算法: DQN 环境: MountainCar-v0
- HW5 算法: DDPG and A3C 环境: Pendulum-v0
- Project 算法: Value-based and policy-based 环境: 一共四个Atari环境('VideoPinball-ramNoFrameskip-v4', 'BreakoutNoFrameskip-v4', 'PongNoFrameskip-v4', 'BoxingNoFrameskip-v4') 选择至少一个, 四个Mujoco环境('Ant-v2','HalfCheetah-v2', 'Hopper-v2', 'Humanoid-v2')选择至少一个.
前三次还搁GridWorld这种养老院环境里遛弯,挺好做;HW4开始上MountainCar-v0,HW5直接DDPG加A3C再拉Pendulum-v0上来,画风从散步秒变越野;到Project直接给你甩四个Atari和四个Mujoco:Atari那边四个抽一个,Mujoco那边再从四个腿里抽一个,抽卡抽到Humanoid-v2这种,你就当场知道什么叫手气即天命,纯纯的养成系抽卡游戏。
总体作业量不小, 每次作业都要从头开始写代码, 老师鼓励把报告写的越精彩越好, 要写出科技报告的感觉, 不要贴代码, 要有算法分析要有可视化等等.前三次确定性算法都还比较好做, 后面开始涉及神经网络之后就开始有很大的不确定性了, 调参需要一些精力和技巧的.
总体作业量不小,而且每次作业都得从零手搓代码,报菜名都省了,直接从头砌墙。老师是鼓励报告写得越精彩越好,主打一个写出科技报告的感觉,别贴代码,算法分析、可视化统统给我端上来。前三次确定性算法还算稳,属于乖宝宝题目,后面一碰神经网络就像撒手学走路,随机性满地乱窜,调参得搭进去不少精力和手法,属于是炼丹炉前拜一拜。
如果没做完可以和老师申请延迟DDL, 这学期有两次, 老师都同意了.
要是没做完还能跟老师申请延迟DDL,这学期有两次申请,老师都同意了——这点确实挺人性的,算是捞人上岸。
给分不太好.
至于给分,嗯,不太好,就这样,不多说,懂得都懂。