Machine Learning4 min read
强化学习 01:基础概念
从智能体与环境的交互出发,建立状态、动作、奖励、回报、策略和马尔可夫决策过程的基本框架。
A long-term research and learning notebook for posts, notes, papers, projects, and research directions.
Archive
Entries collected under this content category.
从智能体与环境的交互出发,建立状态、动作、奖励、回报、策略和马尔可夫决策过程的基本框架。
推导策略值函数的 Bellman 期望方程,理解一步奖励与后续价值之间的递归关系。
从固定策略的价值递推走向最优价值递推,理解最优策略、贪心改进与 Bellman 最优算子。
比较值迭代、策略迭代与广义策略迭代,掌握已知环境模型时求解有限 MDP 的经典方法。
使用完整回合的实际回报估计值函数,并通过探索与重要性采样实现同策略和异策略控制。
从 Robbins-Monro 递推理解随机近似,分析学习率、噪声与强化学习增量更新的收敛条件。
从 TD 误差、n-step return 和 eligibility trace 出发,理解 SARSA、Q-learning 等在线控制算法。
用参数化模型表示大规模状态空间中的值函数,理解半梯度 TD、投影 Bellman 方程与深度 Q 网络。
直接对参数化策略的期望回报求梯度,掌握 REINFORCE、基线、优势函数与稳定策略更新。
结合策略优化与价值估计,理解 Actor-Critic 更新、GAE、异策略变体和连续控制算法。