匹配台全年无休,跨时区回复企业邮箱稍后开通,需求请走报价表
提交报价需求
Artificial Intelligence
方差大、种子敏感。课程作业要报告均值和波动,而不是单次曲线。
先把 MDP 写清楚:状态、动作、奖励是否稠密。实现对照伪代码逐步对。曲线会跑多个种子,讨论探索不足或奖励 hacking。
适合 gridworld、简单控制或策略梯度小实验。单次曲线很好看,多个种子一摊开就没有结论。
Reinforcement Learning 属于 人工智能。考核以「gridworld 实现、策略梯度小实验、稳定性讨论」为主,辅导按这门课的讲义风格走,不拿竞赛题解或另一所学校的作业套进来。
这门课通常走编程作业与实验辅导,起步 ¥1000 / 课时起。有报告或论文成分时可以叠加论文辅导,分析课时与千词分开报。
不代考、不登录评测机、不伪造测例通过记录。隐藏测例要你自己在场或能复述策略。
对应服务页:编程作业与实验辅导。把课程代码和 syllabus 发来即可匹配。
是则用指定环境。自己换游戏当“更难”而不改方法章,分数通常不涨。