
强化学习研究智能体如何通过与环境反复交互,学习一个能够最大化长期累积奖励的决策策略。与监督学习不同,智能体通常不会在每一步得到“正确动作”的标签,而只能观察动作带来的后果。
一次交互可以写成:
StAt(Rt+1,St+1)
其中 St 是时刻 t 的状态,At 是智能体选择的动作,Rt+1 是环境返回的奖励,St+1 是下一状态。
标准强化学习问题通常建模为马尔可夫决策过程(Markov Decision Process, MDP):
M=(S,A,P,R,γ)
| 符号 | 含义 |
|---|
| S | 状态空间 |
| A | 动作空间 |
| P(s′∣s,a) | 状态转移概率 |
| R(s,a,s′) | 即时奖励 |
| γ∈[0,1] | 折扣因子 |
马尔可夫性质要求:给定当前状态和动作后,下一状态的分布不再依赖更早的历史。
P(St+1∣St,At,St−1,At−1,…)=P(St+1∣St,At)
策略描述智能体在状态 s 下选择动作 a 的概率:
π(a∣s)=P(At=a∣St=s)
按照策略与环境交互会产生轨迹:
τ=(S0,A0,R1,S1,A1,R2,…)
回报的总和定义为 return,通常考虑折扣回报以保证收敛:
从时刻 t 开始的折扣回报(Discounted Return)定义为:
Gt=Rt+1+γRt+2+γ2Rt+3+⋯
折扣因子控制即时奖励与长期奖励之间的权衡。γ 越接近 0,智能体越短视;越接近 1,智能体越重视长期结果。并且系数约束防止在无限步下return变成无穷
状态值函数衡量从状态 s 出发并持续执行策略 π 时的期望回报:
Vπ(s)=Eπ[Gt∣St=s]
动作值函数进一步指定当前动作:
Qπ(s,a)=Eπ[Gt∣St=s,At=a]
二者通过策略联系起来:
Vπ(s)=a∑π(a∣s)Qπ(s,a)
智能体既要利用当前知识选择高价值动作,也要探索尚不确定的动作。常见的 ϵ-greedy 策略以 1−ϵ 的概率选择当前最优动作,以 ϵ 的概率随机探索。
强化学习方法还可以从几个维度分类:
- 基于模型与无模型:是否显式学习或使用环境的转移模型。
- 同策略与异策略:学习目标策略是否与采样数据的行为策略相同。
- 基于价值与基于策略:主要学习值函数,还是直接优化参数化策略。
- 回合式与持续式:任务是否存在自然终止状态。
强化学习的核心目标是寻找最优策略 π∗,使期望回报最大。后续章节将从 Bellman Equation 出发,把“长期回报”转化为可以递归计算和迭代优化的问题。