课程内容:强化学习入门地基,Value-based和Policy-based两套武功,外加一堆前沿算法优化花活。
上课自由度:高,不点名不提问当你是空气,学期中有一阵子班里人数直接跌破30。但别高兴太早,学期快结束时来了一次突击手写签到——想拿满那10%签到分的,建议还是次次到场,别跟自己的百分比过不去。
考核标准:40%平时作业,一次8分一共5次,给分很良心;10%签到;50%期末大作业,这个给分就相对严格了。问过老师,纯完成基本任务+报告只拿70%的分数,剩下30%靠代码完成度、优化、调优这一堆加成。评分标准明明白白,所以给分虽然不算高但公平得让人没法骂。
授课质量:中。知识点该讲的都讲了,但老师心里装的是一种“知识不是重点,实践才是爹”的哲学,所以数学推理那些基本是漂移过弯一带而过;课上为了辅助理解出的题目又偏偏是些复杂的强化学习题,讲得还飞快,直接给我整不会了。后来我自己跑去B站看了一个课,人家拿4 x 4那种小儿科网格题当例子,用这种基础例子把算法逻辑和概念计算捋一遍才叫人间清醒。也想跟老师说一句,算法本身就抽象,还上难度的题就是抽象plus,4 x 4那玩意好收敛,我这种菜鸡也能看懂。
```bash
It is also highly encouraged (with probably extra bonus points!) to
implement these value-based and policy-based RL algorithms that
we have learned in class to solve those practical engineering or
research problems that you are currently working on. If you decide
to do so, please contact with me first to see whether such a
proposal can be granted to replace the original project.
```
上面是期末大作业原话, 搁在这么一门没有考试、区分度几乎全靠大作业占比的课上
一个老师居然说能拿你的RL项目顶掉大作业还顺手撒点extra bonus?
# 这个"practical engineering or research problems"的评判标准长啥样, 我是真不敢想也不敢问, 这么一门正经的专业必修课, 你们甩出这种自由又好水的操作, 是来搞笑的吗?? ( 哦也对, 说不定chenglin大人把这话放这儿, 就是方便招同学进组打白工搞劳动力互换吧, 那可太公平太伟大了)
没错, 真实环境是更难的, 可你凭啥知道这东西是我做的还是我师兄做的, 是我现在做的还是我师兄早八百年前就做好的, 搞笑呢? 我本人就蹲在RL实验室, 顺手借个场景跑点实验就能交这玩意儿🤣
# 谢了, 这倒是给我提了个醒, 看来今天阴间签到的bonus有救了