Personal Knowledge Base

A long-term research and learning notebook for posts, notes, papers, projects, and research directions.

Skip to content
← Back to notes

强化学习 01:基础概念

从智能体与环境的交互出发,建立状态、动作、奖励、回报、策略和马尔可夫决策过程的基本框架。

4 min read

强化学习架构图

强化学习解决什么问题

强化学习研究智能体如何通过与环境反复交互,学习一个能够最大化长期累积奖励的决策策略。与监督学习不同,智能体通常不会在每一步得到“正确动作”的标签,而只能观察动作带来的后果。

一次交互可以写成:

StAt(Rt+1,St+1)S_t \xrightarrow{A_t} (R_{t+1}, S_{t+1})

其中 StS_t 是时刻 tt 的状态,AtA_t 是智能体选择的动作,Rt+1R_{t+1} 是环境返回的奖励,St+1S_{t+1} 是下一状态。

马尔可夫决策过程

标准强化学习问题通常建模为马尔可夫决策过程(Markov Decision Process, MDP):

M=(S,A,P,R,γ)\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma)
符号含义
S\mathcal{S}状态空间
A\mathcal{A}动作空间
P(ss,a)P(s' \mid s,a)状态转移概率
R(s,a,s)R(s,a,s')即时奖励
γ[0,1]\gamma \in [0,1]折扣因子

马尔可夫性质要求:给定当前状态和动作后,下一状态的分布不再依赖更早的历史。

P(St+1St,At,St1,At1,)=P(St+1St,At)P(S_{t+1}\mid S_t,A_t,S_{t-1},A_{t-1},\ldots) =P(S_{t+1}\mid S_t,A_t)

策略、轨迹与回报

策略描述智能体在状态 ss 下选择动作 aa 的概率:

π(as)=P(At=aSt=s)\pi(a\mid s)=P(A_t=a\mid S_t=s)

按照策略与环境交互会产生轨迹:

τ=(S0,A0,R1,S1,A1,R2,)\tau=(S_0,A_0,R_1,S_1,A_1,R_2,\ldots)

回报的总和定义为 return,通常考虑折扣回报以保证收敛:

从时刻 tt 开始的折扣回报(Discounted Return)定义为:

Gt=Rt+1+γRt+2+γ2Rt+3+G_t=R_{t+1}+\gamma R_{t+2}+\gamma^2R_{t+3}+\cdots

折扣因子控制即时奖励与长期奖励之间的权衡。γ\gamma 越接近 00,智能体越短视;越接近 11,智能体越重视长期结果。并且系数约束防止在无限步下return变成无穷

值函数

状态值函数衡量从状态 ss 出发并持续执行策略 π\pi 时的期望回报:

Vπ(s)=Eπ[GtSt=s]V^\pi(s)=\mathbb{E}_\pi[G_t\mid S_t=s]

动作值函数进一步指定当前动作:

Qπ(s,a)=Eπ[GtSt=s,At=a]Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid S_t=s,A_t=a]

二者通过策略联系起来:

Vπ(s)=aπ(as)Qπ(s,a)V^\pi(s)=\sum_a \pi(a\mid s)Q^\pi(s,a)

探索与利用

智能体既要利用当前知识选择高价值动作,也要探索尚不确定的动作。常见的 ϵ\epsilon-greedy 策略以 1ϵ1-\epsilon 的概率选择当前最优动作,以 ϵ\epsilon 的概率随机探索。

强化学习方法还可以从几个维度分类:

  • 基于模型与无模型:是否显式学习或使用环境的转移模型。
  • 同策略与异策略:学习目标策略是否与采样数据的行为策略相同。
  • 基于价值与基于策略:主要学习值函数,还是直接优化参数化策略。
  • 回合式与持续式:任务是否存在自然终止状态。

本章小结

强化学习的核心目标是寻找最优策略 π\pi^*,使期望回报最大。后续章节将从 Bellman Equation 出发,把“长期回报”转化为可以递归计算和迭代优化的问题。

Related Posts