非官方网站,与上海交通大学及其任何部门无隶属、授权或合作关系。

强化学习 · 修读回执档案

共 9 份可公开修读回执

清除筛选
? 最相关怎么排

“最相关”根据评论内容完整度、有用票及课程教学信息丰富程度排序,不按好评或差评倾向排序。

按有可靠绑定的教师调档
2025年秋季学期 · 邹君妮

历史匿名回执 ·

CS7309 强化学习理论与算法 刘卫文 考核标准: + 笔试?没有的事,压根不存在 + 5个notebook代码小作业(50%) + 就是撸代码,说不定还塞点探索性小课题进去 + 临时有事可以提前申请延期,延期两周以内按原始得分80%结算,延期超两周直接按70%砍 + 1个大作业(第4-6周放出,30%) + 给个可参考的方向,3人组队 + 主打探索创新,不逼你性能打榜,最后交出4+页的minipaper(外加附件和代码) + 答辩展示(第16周,10%):把大作业的研究问题、用的模型、实验结果端上来 + 出勤(10%) --- 纯路人,只是来做个信息搬运工。

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2025年春季学期 · 邹君妮

历史匿名回执 ·

给分这块儿,属于是端着金碗要饭——2学分的专业选修、还不用考试,人没摆烂你都摸不到90,这操作我只能说烂得很有层次感。2学分嘛,伤害不大,但恶心人这一下它拿捏得死死的。所以想活命的:能上博弈论就上博弈论,要不就趁前一个学期先把3分的专业选修给安排了(我同学直接退课跑路去博弈论,事儿不多给分还高,属实是别人家的课) 不过话又说回来,会来选这门2分强化学习的各位,估计都跟我一个心思——想直接凑个5分对吧(所以这个5分到底凑不凑,各位自己掂量着办 总之一句话:极度不推荐。真对RL有兴趣,不如早点进组整点相关的活儿。。。再说了它说到底就是个2分的课,对着凑3分的推免要求那是一点用没有,选完你还得再选一门,那还不如一开始就直奔一门3分完事。

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2025年春季学期 · 邹君妮

历史匿名回执 ·

课程内容: 上课自由度: 考核标准:五次小作业(50%)一次大作业(50%),前四次小作业任务量尚小,能抄的参考资料也多,第五次直接任务量陡增变本加厉,大作业更是任务量巨大,作为一门2学分的CS专业任意选修课来说完全不划算,而且平时那五次小作业给分很低。除非你有该方面的知识或代码经验需求,否则不建议选这门课。 授课质量:

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2025年春季学期 · 邹君妮

历史匿名回执 ·

首先说一下考核标准: 5次小作业(一次占比10%)+大作业(50%),本来说有出勤分现在来看应该不存在不出勤应该是倒扣——好家伙,这是签到表还是罚单生成器? 然后是上课内容: 上课主要还是讲的Model free的RL还稍微提了一下LLM的RL,model base部分讲的非常非常少——model base在这门课里属于是客串出演,出场三分钟领盒饭。 最后是给分: 可以说这门课给分不咋地,之前选课社区咋没人说呢我不知道反正你很努力去卷每一次作业达到接近论文的标准可能才能满G反正鼠鼠我做不到。这其实是一门CS的限选课可能老师不知道课程性质?但是反正这门课给分确实让人难受尤其是其他限选课基本很轻松能满G的情况下这个给分我不理解——满G的门槛高得跟论文答辩似的,鼠鼠我直接原地躺平;别的限选课发满G跟发传单一样,这门课发满G跟发诺贝尔似的,我是真不理解。

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2025年春季学期 · 邹君妮

历史匿名回执 ·

平时任务量是真大吧…这不是上课这是来交学费打工的吧… 期末大作业需要完成的时间也是真的很长吧…长到我怀疑它是不是想跟我耗到毕业… 而且这种领域的知识网上应该挺多的,那我花的这几个学分到底买了个啥,买了个寂寞盲盒是吧 给分也实在是诡异…平时作业做得有这么差吗,扣这么多平时成绩是在干什么,我寻思我也没交白卷啊。(平时成绩七十分,七十分,七十,听完人直接原地石化) 本来想着2学分交叉学点有用的东西,结果体验感不怎么样,属于是花钱买了个教训还附赠一堆ppt 建议不是必修的话还是别选了,留着这学分和头发去干点别的吧

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2025年春季学期 · 邹君妮

历史匿名回执 ·

学到的东西确实比较有用,问题是给分这块属实把人恶心到了(拿cs其他任选课相比的话) 真奔着学东西去的,不如自己自学,何必花钱来这课里挨罪😅

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2024年春季学期 · 邹君妮

历史匿名回执 ·

上课自由度:高得跟放养似的,但签到这玩意儿就像背后灵,甩都甩不掉 考核标准:平时分50+大作业50,平时任务量巨大,尤其涉及神经网络之后我个人感觉独立完成不太现实——这哪是大作业啊,这是要我在没有金刚钻的情况下硬揽瓷器活,一个人单挑一支军队是吧。好在给分没有太难为人,老师手下留情,没把我直接送走 授课质量:讲的挺好,满分10分能给8分这样,剩下2分扣在我脆弱的神经上

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2023年春季学期 · 邹君妮

历史匿名回执 ·

课程内容: - Introduction - Markov Decision Process - Planning by Dynamic Programming - Model Free Prediction - Model Free Control - Value Function Approximation - Advanced DQN - Policy Gradient - A3C & PPO - DDPG & soft AC - Optimal Control and Planning - Model-Based Reinforcement Learning - Variational Inference - A Tutorial on Generative Models 好家伙,这一串课程目录从Introduction一路排到生成模型 tutorial,排面跟火锅店菜单一样,从锅底到甜品一条龙,生怕你吃完跑单。 考核方式: Homework(50%) + Project(50%) No Exam!! 看到"No Exam!!"两个感叹号没,这玩意儿就是选课界的免死金牌、平时分的直升机停机坪,期末考试直接被抬走,剩下的就看你作业和Project能不能扛住了。 授课质量: 没有去听过课, 所以很难评价授课质量, 不过听去上课的同学说, 质量还是比较高的, 讲的比较透彻. 我本人是没去听过课的,属于云旁听选手,所以让我评价授课质量我就跟盲盒鉴定师一样心虚;但据说去上课的同学反馈质量还是比较高的,讲得比较透彻——嗯,口碑这块属于是别人替我把草种了。 一共五次平时作业一次Project,没有期末考试 五次作业加一次Project,期末考试直接去世,听起来像送分题是吧,别急,后面的环境名字看完你就笑不出来了。 - HW1: 算法: iterative policy evaluation, policy iteration and value iteration 环境: GridWorld - HW2: 算法: Monte-Carlo(MC) Learning and Temporal-Difference(TD) Learning 环境: GridWorld - HW3 算法: Sarsa and Q-Learning 环境: GridWorld - HW4 算法: DQN 环境: MountainCar-v0 - HW5 算法: DDPG and A3C 环境: Pendulum-v0 - Project 算法: Value-based and policy-based 环境: 一共四个Atari环境('VideoPinball-ramNoFrameskip-v4', 'BreakoutNoFrameskip-v4', 'PongNoFrameskip-v4', 'BoxingNoFrameskip-v4') 选择至少一个, 四个Mujoco环境('Ant-v2','HalfCheetah-v2', 'Hopper-v2', 'Humanoid-v2')选择至少一个. 前三次还搁GridWorld这种养老院环境里遛弯,挺好做;HW4开始上MountainCar-v0,HW5直接DDPG加A3C再拉Pendulum-v0上来,画风从散步秒变越野;到Project直接给你甩四个Atari和四个Mujoco:Atari那边四个抽一个,Mujoco那边再从四个腿里抽一个,抽卡抽到Humanoid-v2这种,你就当场知道什么叫手气即天命,纯纯的养成系抽卡游戏。 总体作业量不小, 每次作业都要从头开始写代码, 老师鼓励把报告写的越精彩越好, 要写出科技报告的感觉, 不要贴代码, 要有算法分析要有可视化等等.前三次确定性算法都还比较好做, 后面开始涉及神经网络之后就开始有很大的不确定性了, 调参需要一些精力和技巧的. 总体作业量不小,而且每次作业都得从零手搓代码,报菜名都省了,直接从头砌墙。老师是鼓励报告写得越精彩越好,主打一个写出科技报告的感觉,别贴代码,算法分析、可视化统统给我端上来。前三次确定性算法还算稳,属于乖宝宝题目,后面一碰神经网络就像撒手学走路,随机性满地乱窜,调参得搭进去不少精力和手法,属于是炼丹炉前拜一拜。 如果没做完可以和老师申请延迟DDL, 这学期有两次, 老师都同意了. 要是没做完还能跟老师申请延迟DDL,这学期有两次申请,老师都同意了——这点确实挺人性的,算是捞人上岸。 给分不太好. 至于给分,嗯,不太好,就这样,不多说,懂得都懂。

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
2022年春季学期 · 邹君妮

历史匿名回执 ·

课程内容:值迭代、策略迭代这些RL的祖师爷理论和应用,地基型知识。 上课自由度:高,无点名提问,空气一样自由。 考核标准:n次小作业+个人大作业,n大概是5-6次,传言作业量每年都在膨胀。我上课的时候有6个小作业,基本都是把当周讲的RL算法手搓一遍。我上课时候的大作业是自己实现RL方法在GYM和mujoco上训练,硬是把代码逼成宠物。 讲课质量:一般。

学生体验,不是官方事实。评价教学,不评价人格。
此回执链接
返回合同及回执摘要
修读回执受理窗口