二、简答题(共5道,每题8分)
61. 请描述你对“探索-利用”困境的理解,并结合强化学习实际应用(例如:推荐系统、自动驾驶)阐述至少两种解决该困境的策略及其优缺点。(8分)
62. 在强化学习中,价值函数估计的准确性直接影响策略的优劣。请分析蒙特卡洛方法、时序差分学习(TD learning)和动态规划(Dynamic Programming)三种方法在价值函数估计方面的优缺点,并说明在什么情况下你会选择使用哪种方法?(8分)
63. 请解释 Off-Policy 学习的含义,并以 Q-Learning 算法为例,详细阐述 Off-Policy 学习是如何实现的。同时,分析 Off-Policy 学习可能遇到的问题以及解决方法。(8分)
64. 结合你熟悉的强化学习算法(例如:PPO、DDPG),描述在解决连续动作空间问题时,你是如何设计状态空间、动作空间和奖励函数的。并分析你的设计对算法性能的影响。(8分)